Qwen3.5-4B 微调实战：LLaMA-Factory 打造医疗 AI 助手 | 极客日志

PythonAI算法

Qwen3.5-4B 微调实战：LLaMA-Factory 打造医疗 AI 助手

使用 LLaMA-Factory 框架微调 Qwen3.5-4B 模型构建医疗 AI 助手的完整流程。内容包括硬件环境准备、模型下载、数据集格式规范、训练参数配置及效果测试。通过 LoRA 或 QLoRA 技术降低显存占用，支持 RTX 4070 及以上显卡运行。最终实现模型权重合并与 API 部署，适用于垂直领域智能问答场景。需注意数据质量与合规性，确保输出仅供参考。

时间旅人发布于 2026/4/5更新于 2026/7/2059 浏览

Qwen3.5-4B 微调实战：LLaMA-Factory 打造医疗 AI 助手

本文介绍使用 LLaMA-Factory 微调 Qwen3.5-4B 模型以构建医疗 AI 助手的完整流程。

核心工具链

LLaMA-Factory：开源社区成熟的微调框架，上手简单。
Qwen3.5-4B：阿里千问系列模型，参数量适中，显存友好。
医疗问答数据集：用于垂直领域训练。

准备工作

硬件要求

4B 模型使用 LoRA 微调时，12GB 显存显卡即可满足（如 RTX 4070）。若显存不足，可采用 QLoRA 量化方案。

微调方式	4B 模型显存需求	推荐显卡
LoRA (16-bit)	~10-12 GB	RTX 4070 / RTX 3090
QLoRA (8-bit)	~6-8 GB	RTX 4060 / RTX 3070
QLoRA (4-bit)	~4-6 GB	RTX 3060

软件环境

建议 Python 3.11+，PyTorch 2.0 以上。CUDA 版本推荐 12.x。

下载 Qwen3.5-4B 模型

从魔搭社区下载模型：

# 安装 modelscope
pip install modelscope

# 方式一：Python 代码下载
from modelscope import snapshot_download
model_dir = snapshot_download('Qwen/Qwen3.5-4B')
print(f"模型已下载到：{model_dir}")

# 方式二：命令行下载
modelscope download --model Qwen/Qwen3.5-4B --local_dir ./models/Qwen3.5-4B

注意：模型约 9.3GB，建议检查文件完整性。

搭建 LLaMA-Factory 环境

# 克隆仓库
git clone --depth 1 https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory

# 安装依赖
pip install -e .
pip install -r requirements/metrics.txt

# 如需 DeepSpeed 加速（可选）
pip install -r requirements/deepspeed.txt

验证环境：

llamafactory-cli version

准备医疗数据集

数据集格式需符合 LLaMA-Factory 规范：

相关免费在线工具

加密/解密文本
使用加密算法（如AES、TripleDES、Rabbit或RC4）加密和解密文本明文。在线工具，加密/解密文本在线工具，online
RSA密钥对生成器
生成新的随机RSA私钥和公钥pem证书。在线工具，RSA密钥对生成器在线工具，online
Mermaid 预览与可视化编辑
基于 Mermaid.js 实时预览流程图、时序图等图表，支持源码编辑与即时渲染。在线工具，Mermaid 预览与可视化编辑在线工具，online
随机西班牙地址生成器
随机生成西班牙地址（支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选），支持数量快捷选择、显示全部与下载。在线工具，随机西班牙地址生成器在线工具，online
Gemini 图片去水印
基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印，支持批量处理与下载。在线工具，Gemini 图片去水印在线工具，online
curl 转代码
解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。在线工具，curl 转代码在线工具，online

{
  "medical_qa": {
    "file_name": "medical_qa.json",
    "columns": {
      "prompt": "instruction",
      "query": "input",
      "response": "output"
    }
  }
}

### 模型配置 ###
model_name_or_path: ./models/Qwen3.5-4B
trust_remote_code: true

### 微调方法 ###
stage: sft
do_train: true
finetuning_type: lora
lora_rank: 64
lora_alpha: 128
lora_target: all

### 数据集配置 ###
dataset: medical_qa
template: qwen3
cutoff_len: 2048
preprocessing_num_workers: 8

### 训练参数 ###
output_dir: ./output/qwen35_medical_lora
per_device_train_batch_size: 2
gradient_accumulation_steps: 8
learning_rate: 1.0e-4
num_train_epochs: 3.0
lr_scheduler_type: cosine
warmup_ratio: 0.1
logging_steps: 10
save_steps: 500

### 显存优化 ###
bf16: true
gradient_checkpointing: true

llamafactory-cli train examples/train_lora/qwen35_medical_lora.yaml

tensorboard --logdir=./output/qwen35_medical_lora/runs

llamafactory-cli chat examples/inference/qwen35_medical_lora.yaml

model_name_or_path: ./models/Qwen3.5-4B
adapter_name_or_path: ./output/qwen35_medical_lora
template: qwen3
finetuning_type: lora

llamafactory-cli export examples/merge_lora/qwen35_medical_merge.yaml

model_name_or_path: ./models/Qwen3.5-4B
adapter_name_or_path: ./output/qwen35_medical_lora
template: qwen3
finetuning_type: lora
export_dir: ./models/Qwen35-Medical
export_size: 4
export_device: cuda
export_legacy_format: false

pip install vllm
vllm serve ./models/Qwen35-Medical --port 8000

API_PORT=8000 llamafactory-cli api examples/inference/qwen35_medical.yaml

Qwen3.5-4B 微调实战：LLaMA-Factory 打造医疗 AI 助手

Qwen3.5-4B 微调实战：LLaMA-Factory 打造医疗 AI 助手

核心工具链

准备工作

硬件要求

软件环境

下载 Qwen3.5-4B 模型

搭建 LLaMA-Factory 环境

准备医疗数据集

更多推荐文章

相关免费在线工具

开始微调

测试效果

导出和部署

常见问题

更多推荐文章

相关免费在线工具

Qwen3.5-4B 微调实战：LLaMA-Factory 打造医疗 AI 助手

Qwen3.5-4B 微调实战：LLaMA-Factory 打造医疗 AI 助手

核心工具链

准备工作

硬件要求

软件环境

下载 Qwen3.5-4B 模型

搭建 LLaMA-Factory 环境

准备医疗数据集

微信扫一扫，关注极客日志

更多推荐文章

相关免费在线工具

开始微调

测试效果

导出和部署

常见问题

微信扫一扫，关注极客日志

更多推荐文章

相关免费在线工具