大模型微调后部署实战:GGUF 转换与 ModelScope 托管
上一篇文章我们聊了 LLaMAFactory 和 ModelScope 的微调流程,今天接着把最后一块拼图补上——如何把微调好的模型部署起来,并分享给社区。
本次演示基于魔搭社区(ModelScope)环境,重点讲解如何将 HF 格式转换为 GGUF,并通过 llama.cpp 进行本地或服务端部署。
一、将模型转换为 GGUF 格式
为了让模型能在本地高效运行,我们需要将其转换为 llama.cpp 支持的 GGUF 格式。这一步是轻量级部署的关键。
1. 准备 llama.cpp 环境
首先克隆仓库并安装依赖。注意,这里需要用到 convert_hf_to_gguf.py 脚本。
# 进入工作目录
cd /mnt/workspace
# 克隆 llama.cpp 仓库
git clone https://github.com/ggerganov/llama.cpp.git
# 进入仓库目录
cd llama.cpp
# 创建并激活虚拟环境
python -m venv .venv
source .venv/bin/activate
# 安装 Python 依赖
pip install -r requirements.txt
2. 执行格式转换
准备好环境后,直接调用转换脚本。这里以 Qwen3-4B 为例,使用 q8_0 量化等级,平衡精度与体积。
python convert_hf_to_gguf.py \
/mnt/workspace/LLaMA-Factory/saves/qwen3_sft_merged \
--outtype q8_0 \
--verbose \
--outfile /mnt/workspace/LLaMA-Factory/saves/qwen3_sft_merged/Qwen3-4B-Instruct_q8_0.gguf
执行完成后,生成的 .gguf 文件会保存在指定路径下,后续部署都会用到它。
二、模型部署方案
转换好格式后,我们有两种主流方式加载模型:命令行交互模式和服务端 API 模式。
1. 使用 llama.app (推荐)
GitHub 上的 llama.cpp 项目提供了便捷的部署工具,支持 macOS/Linux 一键安装。
安装依赖
如果系统未安装 Homebrew,先执行安装命令:
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"
随后安装 llama.cpp 组件:
brew install llama.cpp
命令行交互模式 (CLI)
适合快速测试模型效果,直接在终端对话。
llama-cli -m /mnt/workspace/LLaMA-Factory/saves/qwen3_sft_merged/Qwen3-4B-Instruct_q8_0.gguf
启动后即可在命令行输入问题,模型会实时生成回复。


