01 - 大模型推理框架选型入门：Ollama、llama.cpp与vLLM全景对比

优质文章学习记录

09 Apr 2026 — 5 min read

01 - 大模型推理框架选型入门：Ollama、llama.cpp与vLLM全景对比

本文是《大模型推理框架深度解析》系列的第一篇，适合刚接触LLM部署的开发者阅读。

写在前面

随着大语言模型（LLM）的广泛应用，如何将模型高效地部署到生产环境成为每个AI工程师必须面对的问题。目前市面上主流的推理框架有Ollama、llama.cpp和vLLM，但它们的技术定位、适用场景差异巨大。

很多开发者在选型时容易陷入误区：

用Ollama部署高并发API服务，结果吞吐量上不去
用vLLM跑边缘设备，发现资源占用过高
混淆llama.cpp和vLLM的定位，不知道何时该用哪个

本文将从架构分层视角出发，帮你建立清晰的选型认知。

一、三大框架的技术定位

1.1 三层架构视角

如果把LLM推理技术栈比作一座大厦，三个框架分别位于不同的楼层：

┌─────────────────────────────────────────────────────────────┐ │ 应用层（第3层） │ │ ┌─────────────┐ │ │ │ Ollama │ ← 一键式模型管理，类似Docker的体验 │ │ └─────────────┘ │ ├─────────────────────────────────────────────────────────────┤ │ 推理引擎层（第2层） │ │ ┌─────────────┐ ┌─────────────────────────────────────┐ │ │ │ llama.cpp │ │ vLLM │ │ │ │ C++引擎 │ │ Python推理服务平台 │ │ │ └─────────────┘ └─────────────────────────────────────┘ │ ├─────────────────────────────────────────────────────────────┤ │ 硬件加速层（第1层） │ │ CUDA / Metal / ROCm / AVX512 │ └─────────────────────────────────────────────────────────────┘

核心区别一句话总结：

Ollama：让开发者"开箱即用"的工具层
llama.cpp：追求极致轻量的C++推理引擎
vLLM：面向生产的高吞吐推理服务平台

1.2 各框架的本质定位

维度	Ollama	llama.cpp	vLLM
本质	模型管理工具	推理引擎库	推理服务框架
设计目标	开发便捷	跨平台兼容	高吞吐服务化
核心用户	开发者/研究者	嵌入式工程师	SRE/运维工程师
部署形态	单二进制文件	静态库/可执行文件	Python服务+API

1.3 Ollama的真相：llama.cpp的封装层

很多开发者不知道的是，Ollama底层调用的正是llama.cpp：

Ollama CLI → Modelfile解析 → GGUF模型下载 → llama.cpp推理引擎

这意味着：

Ollama的"简单"是有代价的——它隐藏了llama.cpp的精细调参能力
在高并发场景下，Ollama的HTTP层成为瓶颈
生产环境建议绕过Ollama，直接使用底层引擎

二、适用场景速查表

2.1 按使用场景选型

场景	推荐框架	理由
本地开发测试	Ollama	一键安装，Modelfile灵活配置
MacBook Pro本地跑70B	llama.cpp	Metal后端优化，统一内存优势
边缘设备/嵌入式	llama.cpp	ARM NEON优化，低资源占用
高并发API服务	vLLM	连续批处理，PagedAttention
70B+大模型生产部署	vLLM	TP/PP分布式支持完善
MoE模型(DeepSeek)	vLLM	EP专家并行原生支持
CPU兜底/降级链路	llama.cpp	跨平台稳定，GGUF生态成熟

2.2 按硬件环境选型

无GPU环境：

# 唯一选择：llama.cpp ./llama-cli -m model.gguf --threads 32

单卡消费级GPU（RTX 4090 24GB）：

# 7B-13B模型：vLLM或llama.cpp均可# 70B模型：必须用量化版 + vLLM vllm serve --model llama-70b-awq --quantization awq

多卡数据中心GPU（A100/H100）：

# vLLM是最佳选择 vllm serve --model llama-405b --tensor-parallel-size 8

Apple Silicon（M1/M2/M3）：

# llama.cpp Metal后端最优 ./llama-cli -m model.gguf -ngl 99# 全部层卸载到GPU

三、快速上手示例

3.1 Ollama：5分钟跑起来

# 安装curl -fsSL https://ollama.com/install.sh |sh# 拉取并运行模型 ollama run llama3.1:70b # 自定义Modelfilecat> Modelfile <<'EOF' FROM llama3.1:70b PARAMETER temperature 0.7 PARAMETER top_p 0.9 SYSTEM "你是一个专业的编程助手" EOF ollama create my-model -f Modelfile

3.2 llama.cpp：从源码构建

# 克隆并编译git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp make -j LLAMA_CUDA=1# NVIDIA GPU# 下载GGUF模型并运行 ./llama-cli \ -m models/llama-3.1-70b-Q4_K_M.gguf \ --ctx-size 32768\ --threads 32\ -ngl 99# GPU层数，99表示全部

3.3 vLLM：生产级部署

# pip安装 pip install vllm # 启动服务 vllm serve meta-llama/Llama-3.1-70B \ --tensor-parallel-size 4\ --gpu-memory-utilization 0.85\ --max-model-len 32768\ --enable-prefix-caching # 调用APIcurl http://localhost:8000/v1/completions \ -H "Content-Type: application/json"\ -d '{ "model": "meta-llama/Llama-3.1-70B", "prompt": "Hello,", "max_tokens": 100 }'

四、常见误区澄清

误区1：Ollama可以替代vLLM用于生产

真相：Ollama的HTTP层和调度逻辑在高并发下会成为瓶颈。实测数据显示，相同硬件下vLLM的吞吐量是Ollama的3-5倍。

误区2：llama.cpp比vLLM慢，应该被淘汰

真相：llama.cpp在CPU推理和边缘设备场景下是最佳选择。它的跨平台能力和GGUF生态是vLLM无法替代的。

误区3：vLLM支持所有模型格式

真相：vLLM主要支持HuggingFace格式（safetensors/bin），而llama.cpp专注于GGUF。选型前需要确认模型格式支持。

五、系列文章预告

本文是系列的开篇，后续将深入各个技术细节：

02 - 量化与性能：GGUF、AWQ、GPTQ的原理差异与性能基准
03 - KV Cache与批处理：PagedAttention如何让内存利用率从60%提升到95%
04 - 分布式推理：TP/PP/EP并行策略的原理与配置
05 - 生产架构：Kubernetes部署与混合链路设计
06 - 故障排查：监控指标、性能调优与故障演练

参考资源

文章标签

大模型推理LLM部署vLLMllama.cppOllamaAI工程化模型量化

【保姆级教程】告别命令行！ClawX：可视化AI智能体，小白也能轻松玩出花！

【保姆级教程】告别命令行！ClawX：可视化AI智能体，小白也能轻松玩出花！黑底白字、敲命令、改配置… 是不是每次想让AI乖乖干活，都得先在终端里跟那些"代码黑魔法"死磕？现在不用了！今天给大家安利一款「零门槛AI神器」——ClawX，让你把OpenClaw的强大能力装进可视化界面，从此和枯燥的命令行说拜拜！ 🚀 为什么你需要ClawX？（痛点暴击！）想象一下： * 同事A：“你会用OpenClaw写个定时抓取新闻的Agent吗？” * 你（内心OS）：“先安装Node.js，配置npm镜像源，再写个Cron表达式…啊，我的发际线！” ClawX直接把「AI智能体」变成了手机App： ✅ 零配置小白友好：下载安装→填API Key→开聊，全程不用碰黑窗口 ✅ 聊天式操作：像微信聊天一样输入prompt，AI直接给你出结果 ✅ 可视化自动化：拖拽设置定时任务，7x24小时当你的"数字打工人&

2026写小说用什么软件？国内外靠谱的7款AI写作工具深度测评（附新手教程）

很多朋友问我：“Edward，我脑子里有个绝佳的故事，但每次写不到三万字就卡壳，最后只能弃坑，怎么办？” 其实，写作不仅靠灵感，更靠“工程化”的执行。在2025年的今天，我们其实非常幸运。一方面，成熟的网文写作方法论已经可以帮我们规避90%的“雷区”；另一方面，AI工具的爆发让“卡文”不再是绝症。今天这篇文章，不讲虚的，把一套完整的新手写作SOP和7款我亲测好用的AI工具一次性分享给大家。第一部分：新手写小说的“排雷”指南与核心方法在打开AI工具之前，你必须先掌握这套“内功”。否则工具再强，你也只是生成了一堆没有灵魂的文字垃圾。 1、拒绝“裸奔”写作：雪花法大纲很多新人的最大雷区就是无大纲写作。想到哪写到哪，结果写到第十章发现逻辑崩了，前面埋的坑填不上。解决方法：使用“雪花法”或“三幕式结构”。一句话核心：用20字概括你的故事（谁+

OpenClaw ACP 协议深度解析：让 IDE 直接驱动你的 AI Agent

OpenClaw ACP 协议深度解析：让 IDE 直接驱动你的 AI Agent 🔗 ACP（Agent Client Protocol）是 OpenClaw 最新的核心基础设施升级 —— 一个连接 IDE 和 OpenClaw Gateway 的通信隧道，让你在 VS Code / Zed 中直接驱动 AI Agent，一切都无需离开编辑器 📑 文章目录 1. 为什么需要 ACP：在 IDE 和 Agent 之间反复横跳的痛苦 2. ACP 30 秒速懂：AI 世界的 Language Server Protocol 3. ACP 架构全景：

小白必看！用Llama Factory可视化界面玩转大模型微调

小白必看！用Llama Factory可视化界面玩转大模型微调作为一名对AI技术充满好奇的平面设计师，你是否曾想过让大模型学会生成具有你个人艺术风格的文本？但一看到复杂的命令行和代码就望而却步？别担心，Llama Factory正是为你量身打造的可视化大模型微调工具。它通过简洁的Web界面，让你无需编写任何代码就能完成从数据准备到模型训练的全流程。目前ZEEKLOG算力平台已提供预装Llama Factory的镜像，只需几分钟即可在GPU环境下启动你的第一个微调任务。为什么选择Llama Factory进行大模型微调 Llama Factory是一个开源的低代码大模型微调框架，它最大的特点就是提供了完整的图形化操作界面。对于非技术背景的用户来说，这意味： * 完全摆脱命令行操作，所有功能通过网页点选完成 * 内置多种预训练模型支持，包括LLaMA、Qwen、ChatGLM等热门模型 * 支持LoRA等轻量化微调方法，大幅降低显存需求 * 预置常见数据集模板，艺术风格文本生成也能快速上手我实测下来，即使没有任何编程基础，也能在半小时内完成第一个微调任务。下面我就