基于 LLaMA-Factory 的 Qwen3.5-4B 医疗助手微调指南 | 极客日志

PythonAI算法

基于 LLaMA-Factory 的 Qwen3.5-4B 医疗助手微调指南

Qwen3.5-4B 模型结合 LLaMA-Factory 框架进行垂直领域微调的完整流程。涵盖硬件选型、环境搭建、数据集构建、LoRA 参数配置及部署方案。重点解决显存优化与医疗场景适配问题，提供从训练到合并导出的实操步骤。

imJackJia发布于 2026/4/10更新于 2026/5/229 浏览

基于 LLaMA-Factory 的 Qwen3.5-4B 医疗助手微调指南

针对垂直领域的医疗问答场景，利用开源大模型构建专业助手已成为趋势。Qwen3.5-4B 参数量适中，在效果与显存占用之间取得了不错的平衡；配合 LLaMA-Factory 这一成熟框架，开发者可以快速完成从环境搭建到模型部署的全流程。

硬件与环境准备

LoRA 微调对显存要求相对友好。对于 4B 模型，12GB 显存的显卡（如 RTX 4070）即可满足基础需求。若资源有限，QLoRA 量化方案能进一步降低门槛。

微调方式	4B 模型显存需求	推荐显卡
LoRA (16-bit)	~10-12 GB	RTX 4070 / RTX 3090
QLoRA (8-bit)	~6-8 GB	RTX 4060 / RTX 3070
QLoRA (4-bit)	~4-6 GB	RTX 3060

软件层面建议 Python 3.11+，PyTorch 2.0 以上，CUDA 版本推荐 12.x 以保证兼容性。

模型下载与安装

获取基座模型

国内用户推荐使用魔搭社区下载，速度较快：

# 方式一：Python 脚本下载
pip install modelscope
from modelscope import snapshot_download
model_dir = snapshot_download('Qwen/Qwen3.5-4B')
print(f"模型已下载到：{model_dir}")

# 方式二：命令行下载
modelscape download --model Qwen/Qwen3.5-4B --local_dir ./models/Qwen3.5-4B

*注意：模型体积约 9.3GB，建议预留足够空间并校验文件完整性。

搭建 LLaMA-Factory 环境

克隆仓库并安装依赖：

git clone --depth 1 https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory
pip install -e .
pip install -r requirements/metrics.txt
# 如需 DeepSpeed 加速可额外安装
pip install -r requirements/deepspeed.txt

安装完成后执行 llamafactory-cli version 确认环境正常。

数据集构建

数据质量直接决定微调上限。医疗领域建议使用结构清晰的问答对，覆盖内科、外科等常见科室。

LLaMA-Factory 支持 JSON 格式，字段映射如下：

[
  {
    "instruction":

相关免费在线工具

加密/解密文本
使用加密算法（如AES、TripleDES、Rabbit或RC4）加密和解密文本明文。在线工具，加密/解密文本在线工具，online
RSA密钥对生成器
生成新的随机RSA私钥和公钥pem证书。在线工具，RSA密钥对生成器在线工具，online
Mermaid 预览与可视化编辑
基于 Mermaid.js 实时预览流程图、时序图等图表，支持源码编辑与即时渲染。在线工具，Mermaid 预览与可视化编辑在线工具，online
随机西班牙地址生成器
随机生成西班牙地址（支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选），支持数量快捷选择、显示全部与下载。在线工具，随机西班牙地址生成器在线工具，online
Gemini 图片去水印
基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印，支持批量处理与下载。在线工具，Gemini 图片去水印在线工具，online
curl 转代码
解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。在线工具，curl 转代码在线工具，online

{
  "medical_qa": {
    "file_name": "medical_qa.json",
    "columns": {
      "prompt": "instruction",
      "query": "input",
      "response": "output"
    }
  }
}

### 模型配置 ###
model_name_or_path: ./models/Qwen3.5-4B
trust_remote_code: true

### 微调方法 ###
stage: sft
do_train: true
finetuning_type: lora
lora_rank: 64
lora_alpha: 128
lora_target: all

### 数据集配置 ###
dataset: medical_qa
template: qwen3
cutoff_len: 2048
preprocessing_num_workers: 8

### 训练参数 ###
output_dir: ./output/qwen35_medical_lora
per_device_train_batch_size: 2
gradient_accumulation_steps: 8
learning_rate: 1.0e-4
num_train_epochs: 3.0
lr_scheduler_type: cosine
warmup_ratio: 0.1
logging_steps: 10
save_steps: 500

### 显存优化 ###
bf16: true
gradient_checkpointing: true

llamafactory-cli train examples/train_lora/qwen35_medical_lora.yaml

tensorboard --logdir=./output/qwen35_medical_lora/runs

llamafactory-cli chat examples/inference/qwen35_medical_lora.yaml

model_name_or_path: ./models/Qwen3.5-4B
adapter_name_or_path: ./output/qwen35_medical_lora
template: qwen3
finetuning_type: lora

llamafactory-cli export examples/merge_lora/qwen35_medical_merge.yaml

model_name_or_path: ./models/Qwen3.5-4B
adapter_name_or_path: ./output/qwen35_medical_lora
template: qwen3
finetuning_type: lora
export_dir: ./models/Qwen35-Medical
export_size: 2
export_device: cuda
export_legacy_format: false

# vLLM 部署
pip install vllm
vllm serve ./models/Qwen35-Medical --port 8000

# 或使用 LLaMA-Factory 内置 API
API_PORT=8000 llamafactory-cli api examples/inference/qwen35_medical.yaml

基于 LLaMA-Factory 的 Qwen3.5-4B 医疗助手微调指南

基于 LLaMA-Factory 的 Qwen3.5-4B 医疗助手微调指南

硬件与环境准备

模型下载与安装

获取基座模型

搭建 LLaMA-Factory 环境

数据集构建

更多推荐文章

相关免费在线工具

训练配置与执行

推理与部署

快速测试

权重合并与 API 服务

常见问题排查

更多推荐文章

相关免费在线工具

基于 LLaMA-Factory 的 Qwen3.5-4B 医疗助手微调指南

基于 LLaMA-Factory 的 Qwen3.5-4B 医疗助手微调指南

硬件与环境准备

模型下载与安装

获取基座模型

搭建 LLaMA-Factory 环境

数据集构建

微信扫一扫，关注极客日志

更多推荐文章

相关免费在线工具

训练配置与执行

推理与部署

快速测试

权重合并与 API 服务

常见问题排查

微信扫一扫，关注极客日志

更多推荐文章

相关免费在线工具