跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

LLaMA-Factory 项目介绍与安装部署

LLaMA-Factory 是一个低代码微调框架,支持多种主流大语言模型。包括 Transformer、PEFT 在内的主流微调框架对比,重点讲解了 LLaMA-Factory 的模型支持、硬件要求及安装步骤。内容涵盖项目结构解析、WebUI 启动方式以及预训练模型下载方法,适用于希望快速上手大模型微调的用户。

DevOpsTeam发布于 2026/4/5更新于 2026/7/2761 浏览
LLaMA-Factory 项目介绍与安装部署

主流微调框架介绍

1. Transformer

  • 生态地位:Hugging Face 核心库,NLP 领域最广泛使用的基础框架
  • 技术特点:
    • 支持全参数微调
    • 兼容 PEFT 库扩展
  • 优势:
    • 生态系统最完善,社区活跃
    • 与 PyTorch/TensorFlow 无缝集成
    • 模型和教程资源丰富
  • 适用场景:中小规模模型实验、研究和开发,微调入门首选

2. PEFT

  • 技术定位:参数高效微调标准库
  • 核心方法:LoRA, Prefix-tuning, AdaLoRA, Prompt Tuning
  • 突出优势:
    • 计算和存储成本极低
    • 与 Transformers 完美集成
    • 操作简单易用
  • 局限性:仅支持单卡微调,不适合分布式训练
  • 适用场景:资源受限环境(如单卡),需高效适配多任务的场景

3. LLaMA-Factory

  • 产品特色:低代码/无代码快速微调框架
  • 技术集成:多种微调方法(含 LoRA 等),集成优化技术
  • 用户体验:提供友好 Web UI 界面,支持拖拽式参数配置,无需深厚代码功底
  • 典型应用:快速原型验证,非技术人员微调

4. ModelScope

  • 平台定位:阿里'模型即服务'(MaaS) 平台
  • 技术特点:多模态模型支持,训练 - 评估 - 部署全流程
  • 特色优势:中文场景优化,企业级生产环境支持
  • 适用场景:需要多模态模型和完整流水线的企业用户

5. MS-SWIFT

  • 规模支持:超大规模模型微调
  • 核心技术:LoRA/QLoRA, 分布式训练,量化技术
  • 模型覆盖:支持 500+ LLM, 200+ 多模态模型
  • 适用场景:需要微调超大规模模型或追求极致性能的生产部署

6. Unsloth

  • 技术突破:动态量化微调(2024 年新技术)
  • 核心优化:LoRA/QLoRA 底层重构,训练速度提升 2 倍,显存占用大幅降低
  • 显著特点:量化微调几乎无损精度,兼容 Hugging Face 生态
  • 当前局限:仅支持单卡微调
  • 适用场景:计算资源严格受限,追求训练效率极限,20B 参数以下模型

7. 小结

  • 框架选择指南:
    • 入门实验:Transformers+PEFT 组合
    • 快速实现:LLaMA-Factory
    • 企业多模态:ModelScope/MS-SWIFT
    • 资源受限:Unsloth
  • 课程选择:本课程以 LLaMA-Factory 作为主要教学框架

LLaMA-Factory 项目介绍

  • 项目地址:https://github.com/hiyouga/LLaMA-Factory
  • 项目热度:目前已有 57.2k stars,287 watching 和 7k forks,从 2023 年开始人气持续快速增长

文章配图

1. 支持的模型

  • 覆盖范围:支持几乎所有主流大语言模型,包括:
    • Baichuan 2 (7B/13B)
    • BLOOM/BLOOMZ (560M-176B)
    • DeepSeek 系列 (1.5B-671B)
    • Gemma 系列 (2B-27B)
    • GLM 系列 (9B-355B)
    • GPT 系列 (0.1B-120B)
    • 最新支持的 GPT-OSS (20B/120B)
  • 模板支持:每个模型都有对应的对话模板 (chat template)

2. 安装要求

  • 核心依赖:
    • Python: 3.9(最低)/3.10(推荐)
    • PyTorch: 2.0.0(最低)/2.6.0(推荐)
    • Transformers: 4.49.0(最低)/4.50.0(推荐)
  • 可选组件:
    • CUDA: 11.6(最低)/12.2(推荐)
    • Flash-attn: 2.5.6(最低)/2.7.2(推荐)
  • 环境适配:部分功能需要特定架构的显卡支持,如 V100 显卡不支持某些功能

3. 硬件要求

  • 全精度训练:
    • 32 位:7B 模型需要 120GB 显存
    • 16 位 (bf16):7B 模型需要 60GB 显存
  • 高效微调方法:
    • LoRA/Freeze: 7B 模型仅需 16GB 显存
    • QLoRA 8-bit: 7B 模型需 10GB 显存
    • QLoRA 4-bit: 7B 模型仅需 6GB 显存

4. 安装

准备开发环境后,执行以下步骤:

cd ~/workspace
git clone --depth 1 https://github.com/hiyouga/LlamaFactory.git
cd LlamaFactory

虚拟环境建议:本地使用建议创建 conda 虚拟环境

conda create -n llamafactory python=3.10

拓展模块安装:

  • flashAttention 库----加速
pip install flash-attn --no-build-isolation # 注意:V100 不支持该库
  • bitsandbytes 库--量化库
pip install bitsandbytes
  • deepspeed 库---做分布式微调
pip install deepspeed==0.12.3
  • accelerate 库--加速
pip install accelerate

主程序安装:

pip install -e . pip install -r requirements/metrics.txt

文章配图 文章配图 文章配图 文章配图

llama factory 项目文件介绍

文章配图

  • /data 文件夹:存放数据集的文件夹,可以用开源数据集,也可以自己写数据集
  • /examples 文件夹:提供了训练(deepspeed,lora,qlora,fsdp)、模型合并、推理等示例代码,可以直接用
  • /scripts 文件夹:存放微调、训练、模型合并、评估等脚本的文件夹
  • /docker 文件夹:各类显卡的 docker 部署
  • /evaluation 文件夹:评估模型性能数据集,脚本

启动 llama

在终端输入:

GRADIO_SERVER_PORT=6006 llamafactory-cli webui

打开浏览器访问对应地址即可进入。

密码输入的时候是不显示的,直接输入完即可。

文章配图 文章配图 文章配图 文章配图

预训练模型下载

1. 模型选择与下载准备

  • 目标模型:本次微调使用的是通义千问 3-4B-Base 模型
  • 模型特点:
    • 是 Qwen 系列最新一代大型语言模型
    • 提供密集型和专家混合 (MoE) 两种架构
    • 预训练使用了 119 种语言的 36 万亿个标记
    • 语言覆盖范围是 Qwen2.5 的三倍
    • 包含编码、STEM、推理等丰富的高质量数据

2. 下载方法

使用命令行工具下载:

pip install modelscope
cd ./workspace
cp -r /path/to/cache_dir ./
modelscope download --model Qwen/Qwen3.5-4B-Base --cache_dir ./

文章配图 文章配图 文章配图 文章配图

目录

  1. 主流微调框架介绍
  2. 1. Transformer
  3. 2. PEFT
  4. 3. LLaMA-Factory
  5. 4. ModelScope
  6. 5. MS-SWIFT
  7. 6. Unsloth
  8. 7. 小结
  9. LLaMA-Factory 项目介绍
  10. 1. 支持的模型
  11. 2. 安装要求
  12. 3. 硬件要求
  13. 4. 安装
  14. llama factory 项目文件介绍
  15. 启动 llama
  16. 预训练模型下载
  17. 1. 模型选择与下载准备
  18. 2. 下载方法
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • GSD 元提示系统:深度拆解解决 AI 编程上下文遗忘问题
  • VSCode 配合 Git 实现代码仓库回滚实战
  • Claude Code 与 OpenSpec 环境搭建及场景测试
  • Python 爬虫从入门到实战:Requests、Scrapy、异步与反爬
  • 空间复杂度怎么判断:几个常见例子讲透
  • webdav-server 轻量级部署与实战指南
  • AI 大模型 Token 收费机制与技术原理详解
  • C++ 哈希表原理与线性探测、哈希桶模拟实现
  • Anthropic 限制第三方工具接入:Claude Code 订阅政策调整引发的成本与管控之争
  • AI Agent 沙箱选型指南:五种隔离架构对比
  • HarmonyOS 6.0 Camera Kit 微距状态监听能力详解
  • Vivado 安装教程:从官网下载到完成配置
  • MySQL 表操作实战:创建、修改与删除详解
  • Llama-3.2V-11B-cot 读胸片实测:推理过程、准确率与落地取舍
  • AI 辅助开发实战:用 AIGC LLM 提升代码生成效率与质量
  • xsimd 实战指南:从零开始掌握 C++ SIMD 编程
  • 用 DeepSeek 辅助前端开发:代码、测试、部署的一些实践
  • MobaXterm 连接远程 Linux 服务器图形化界面
  • Dev C++ 安装与配置完整指南
  • Git 安装状态检查方法汇总

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online