LLaMA Factory 高效微调平台概览
LLaMA Factory 是一个开源的大模型高效微调平台,在 GitHub 上拥有超过 60k 收藏,非常适合入门开发者。它提供了一站式操作界面,通过可视化操作即可完成对 LLMs(大语言模型)或 VLMs(视觉语言模型)的微调。
开源地址:https://github.com/hiyouga/LLaMA-Factory
核心特色
该平台支持广泛的模型和训练策略,主要特性包括:
- 多种模型:支持 LLaMA、LLaVA、Mistral、Mixtral-MoE、Qwen、DeepSeek、Yi、Gemma、ChatGLM、Phi 等主流架构。
- 集成方法:涵盖(增量)预训练、指令监督微调、奖励模型训练、PPO、DPO、KTO、ORPO 等多种训练方式。
- 多种精度:支持 16 比特全参数微调、冻结微调、LoRA 以及基于 AQLM/AWQ/GPTQ 等的 2/3/4/5/6/8 比特 QLoRA 微调。
- 先进算法:内置 GaLore、BAdam、APOLLO、Muon、OFT、DoRA、LongLoRA、PiSSA 等前沿优化算法。
- 实用技巧:集成 FlashAttention-2、Unsloth、Liger Kernel、RoPE scaling、NEFTune 等技术加速训练。
- 实验监控:支持 LlamaBoard、TensorBoard、Wandb、MLflow 等监控工具。
- 极速推理:基于 vLLM 或 SGLang 的 OpenAI 风格 API、浏览器界面和命令行接口。
推荐适配计划
| 适配时间 | 模型名称 |
|---|---|
| Day 0 | Qwen3 / Qwen2.5-VL / Gemma 3 / GLM-4.1V / InternLM 3 / MiniCPM-o-2.6 |
| Day 1 | Llama 3 / GLM-4 / Mistral Small / PaliGemma2 / Llama 4 |
支持的训练方法
| 方法 | 全参数训练 | 部分参数训练 | LoRA | QLoRA |
|---|---|---|---|---|
| 预训练 | ✅ | ✅ | ✅ | ✅ |
| 指令监督微调 | ✅ | ✅ | ✅ | ✅ |
| 奖励模型训练 | ✅ | ✅ | ✅ | ✅ |
| PPO 训练 | ✅ | ✅ | ✅ | ✅ |
| DPO 训练 | ✅ | ✅ | ✅ | ✅ |
| KTO 训练 | ✅ | ✅ | ✅ | ✅ |
| ORPO 训练 | ✅ | ✅ | ✅ | ✅ |
| SimPO 训练 |


