跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

LLaMA Factory 大模型微调、导出与量化指南

使用 LLaMA Factory 工具对大语言模型进行微调、验证、导出及量化的全流程。内容涵盖环境安装、数据集准备与格式说明、WebUI 参数配置、模型合并导出以及量化设置。通过该工具支持多种模型架构和训练算法,可实现高效的本地模型优化与部署。

晚风告白发布于 2026/3/27更新于 2026/7/2553 浏览
LLaMA Factory 大模型微调、导出与量化指南

LLaMA Factory 大模型微调、导出与量化指南

  • 模型种类:LLaMA、LLaVA、Mistral、Mixtral-MoE、Qwen、Yi、Gemma、Baichuan、ChatGLM、Phi 等等。
  • 训练算法:(增量)预训练、(多模态)指令监督微调、奖励模型训练、PPO 训练、DPO 训练、KTO 训练、ORPO 训练等等。
  • 运算精度:16 比特全参数微调、冻结微调、LoRA 微调和基于 AQLM/AWQ/GPTQ/LLM.int8/HQQ/EETQ 的 2/3/4/5/6/8 比特 QLoRA 微调。
  • 优化算法:GaLore、BAdam、DoRA、LongLoRA、LLaMA Pro、Mixture-of-Depths、LoRA+、LoftQ 和 PiSSA。
  • 加速算子:FlashAttention-2 和 Unsloth。
  • 推理引擎:Transformers 和 vLLM。
  • 实验监控:LlamaBoard、TensorBoard、Wandb、MLflow、SwanLab 等等。

GitHub 地址: https://github.com/hiyouga/LLaMA-Factory

官方文档: https://llamafactory.readthedocs.io/zh-cn/latest/

一、安装 LLaMA Factory

将源码下载到本地,cd 到根目录进行安装。

conda create -n llamafactory python=3.10 -y
conda activate llamafactory
git clone --depth 1 https://github.com/hiyouga/LLaMA-Factory.git
cd LLaMA-Factory
pip install -e ".[torch,metrics]"

在根目录启动 WebUI。记住一定要在 LLaMA Factory 的根目录启动。

llamafactory-cli webui

默认启动的端口是 7860。

二、LLaMA Factory 微调入门

1. 选择一个大模型

从魔塔社区下载 Qwen2.5-0.5B-Instruct 到本地,对该模型进行微调训练。

# 模型下载
from modelscope import snapshot_download
model_dir = snapshot_download('Qwen/Qwen2.5-0.5B-Instruct', cache_dir="/root/autodl-tmp/llm")

2. 选择一个数据集

LLaMA Factory 的源码里默认提供了很多种可直接训练的数据集,在 data 目录下。我们就拿 identity.json 身份认知训练集来做微调。

将里面的占位符替换成合适的文字,并且保存。

3. 指令监督微调数据集介绍

指令监督微调 (Instruct Tuning) 通过让模型学习详细的指令以及对应的回答来优化模型在特定指令下的表现。

instruction 列对应的内容为人类指令,input 列对应的内容为人类输入,output 列对应的内容为模型回答。下面是一个例子。

"alpaca_zh_demo.json": 
   
   
   

{
"instruction"
:
"计算这些物品的总费用。"
,
"input"
:
"输入:汽车 - $3000,衣服 - $100,书 - $20。"
,
"output"
:
"汽车、衣服和书的总费用为 $3000 + $100 + $20 = $3120。"
}

在进行指令监督微调时,instruction 列对应的内容会与 input 列对应的内容拼接后作为最终的人类输入,即人类输入为 instruction\ninput。而 output 列对应的内容为模型回答。在上面的例子中,人类的最终输入是:

计算这些物品的总费用。 输入:汽车 - $3000,衣服 - $100,书 - $20。

模型的回答是:

汽车、衣服和书的总费用为 $3000 + $100 + $20 = $3120。

如果指定,system 列对应的内容将被作为系统提示词。

history 列是由多个字符串二元组构成的列表,分别代表历史消息中每轮对话的指令和回答。注意在指令监督微调时,历史消息中的回答内容也会被用于模型学习。

指令监督微调数据集格式要求如下:

[
  {
    "instruction": "人类指令(必填)",
    "input": "人类输入(选填)",
    "output": "模型回答(必填)",
    "system": "系统提示词(选填)",
    "history": [
      ["第一轮指令(选填)", "第一轮回答(选填)"],
      ["第二轮指令(选填)", "第二轮回答(选填)"]
    ]
  }
]

下面提供一个 alpaca 格式多轮对话的例子,对于单轮对话只需省略 history 列即可。

[
  {
    "instruction": "今天的天气怎么样?",
    "input": "",
    "output": "今天的天气不错,是晴天。",
    "history": [
      ["今天会下雨吗?", "今天不会下雨,是个好天气。"],
      ["今天适合出去玩吗?", "非常适合,空气质量很好。"]
    ]
  }
]

对于上述格式的数据,dataset_info.json 中的数据集描述应为:

"数据集名称": {
  "file_name": "data.json",
  "columns": {
    "prompt": "instruction",
    "query": "input",
    "response": "output",
    "system": "system",
    "history": "history"
  }
}

4. 微调实操

打开 WebUI 界面,网址如下:

http://localhost:7860/

界面的几个重要参数说明:

  1. 模型路径:一定要选择本地的模型路径,否则就会去 Hugging Face 上下载。
  2. 微调方法:默认 LoRA。
  3. 检查点路径:训练过程中保存的权重,可从其中的一个权重重新训练。
  4. 对话模板:不同的模型对应的对话模板是不一样的。选择模型名称,会自动选择对话模板。
  5. 中间的 4 个任务:Train 训练,Evaluate/Predict 测试,Chat 对话,Export 模型导出。
  6. 训练方式:LoRA 默认的训练方式就是 Supervised Fine-Tuning。
  7. 数据路径:data。
  8. 数据集:选择一个数据集,identity,可以点击预览查看数据集。
  9. 训练轮次:至少 300。
  10. 最大样本数:可以控制样本的数量上限。
  11. 截断长度:长度越长越占显存,根据样本里的文本长度,大部分数据的最大长度值即可,比如,有 90% 的样本数据的长度是 200,这里填写 200。
  12. 批处理大小:超参数,需要根据你服务器的配置,尝试运行几次,找到资源利用率最高的数值。
  13. 验证集比例:0.1,也可以不给。
  14. 输出目录:会自动生成一个路径,要确保每次的目录都不相同,若已存在,则需要去服务器上删除,目录在 llamafactory-save 目录下。

参数配置完毕后,点击'开始'进行微调。可以看右下角的这个曲线图,也可以看下服务器控制台的日志输出,以及 nvitop 查看显存的使用情况。

一般来说,该曲线中,蓝色曲线比较平滑收敛时候就可以结束了,比如上图,在 700 的时候可以中断。

三、Chat 验证微调效果

切换到 Chat,检查点路径选择微调时保存的 checkpoint 点的路径;推理引擎直接使用 HuggingFace 即可,点击加载模型,输入问题看效果。

看到效果了吧。若不加载检查点路径,就是原来模型,你可以输入相同的问题对比下效果。

四、微调后的模型合并导出

切换到 Export,检查点路径输入正确,最大分块大小选 4G,导出设备 auto,导出目录填写正确的目录地址。点击'开始导出'即可。过一会就会导出成功。

五、微调后的模型量化

Export 页面还可以处理量化操作,但是必须是第四步完成后才可以。

  • 模型路径:第四步保存的最新的模型路径。
  • 导出量化等级:可以选择 8 或 4,但是 2 和 3 一般不要选择。
  • 导出设备:auto。
  • 导出目录:填写地址。

目录

  1. LLaMA Factory 大模型微调、导出与量化指南
  2. 一、安装 LLaMA Factory
  3. 二、LLaMA Factory 微调入门
  4. 1. 选择一个大模型
  5. 模型下载
  6. 2. 选择一个数据集
  7. 3. 指令监督微调数据集介绍
  8. 4. 微调实操
  9. 三、Chat 验证微调效果
  10. 四、微调后的模型合并导出
  11. 五、微调后的模型量化
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Vite 打包常见问题与解决方案详解
  • 五大经典排序算法详解:插入、希尔、冒泡、选择与堆排序
  • 微信开放官方 Bot API:ClawBot 插件技术解析与接入指南
  • MySQL 9.6.0 Windows 版安装与配置指南
  • Anaconda 环境变量配置意义及捆绑 Python 路径说明
  • openclaw新手入门指南:一文看懂环境搭建、模型配置与 WebUI 远程访问
  • 基于 Milvus 与混合检索的云厂商文档智能问答系统:Java SpringBoot 实践
  • Zotero 本地 AI 文献助手:RAG 检索增强与 MCP 协议集成实战
  • Claude Code 在 Linux(Ubuntu) 上的完整安装部署指南
  • OpenCode:开源 AI 编程智能体,支持多模型与远程协作
  • MuJoCo 足式机器人强化学习:URDF 转 XML 配置指南
  • IMDB 情感分类实战:Word2Vec + 逻辑回归完整解析
  • DeepSeek 各版本说明与优缺点分析
  • AI 时代,为何架构师反而更稀缺了?
  • 给本地 AI 助手装「超级插件市场」:OpenClaw 技能实战指南
  • 机器人系统设计核心:从架构拆解到工程落地实践
  • MiniMax 海螺 AI 视频:图片与文本生成高质量视频
  • Ubuntu 22.04 基于 ROS2 Humble 的 PX4 无人机仿真环境搭建
  • 算法基础:前缀和技巧与区间求和优化
  • AI 编程工具收费模式变革:Token 计费时代的开发者生存指南

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online