跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
C++AI

llama.cpp 大模型部署指南:CPU/GPU 兼容方案

llama.cpp 是基于 C/C++ 实现的大型语言模型推理工具,支持跨平台及 Docker 部署。文章演示了通过 Docker Compose 快速启动服务的方法,涵盖 CPU 与 GPU(CUDA)两种运行模式配置。提供了 Web UI 界面及 OpenAI 兼容 API 的使用示例,支持文本与多模态对话。该方案无需复杂依赖,适合本地私有化部署大模型应用。

星落发布于 2026/4/10更新于 2026/9/969 浏览
llama.cpp 大模型部署指南:CPU/GPU 兼容方案

一、简介

  • llama.cpp 是一个在 C/C++ 中实现大型语言模型(LLM)推理的工具
  • 支持跨平台部署,也支持使用 Docker 快速启动
  • 可以运行多种量化模型,对电脑要求不高,CPU/GPU 设备均可流畅运行
  • 开源地址参考:https://github.com/ggml-org/llama.cpp

核心工作流程参考:

文章配图

二、安装与下载模型(Docker 方式)

1. 搜索可用模型
  • 这里以 qwen3-vl 模型为例,提供了多种量化版本,每种版本的大小不一样,根据自己的电脑性能做选择,如选择(模型 + 量化标签):Qwen/Qwen3-VL-8B-Instruct-GGUF:Q8_0

文章配图

  • 可以在 huggingface 官网中搜索可用的量化模型:https://huggingface.co/models?search=gguf

文章配图

2. 使用 docker-compose 安装启动 llama.cpp
  • 提前安装好 Docker、docker-compose 软件环境
  • (可选)如果有 GPU,需要安装好 NVIDIA 驱动程序、NVIDIA Container Toolkit 英伟达驱动安装参考文档:https://developer.nvidia.com/cuda-toolkit-archive NVIDIA Container Toolkit 安装参考:https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/install-guide.html
# 运行下面命令,如果输出显卡信息即 Docker 内可以正常使用 GPU
docker run --rm --gpus all nvidia/cuda:12.5.0-runtime-ubuntu22.04 nvidia-smi
  • 新建 docker-compose.yml 配置文件,参考下面内容:

CPU 运行版本

services:
  llama-cpp-server:
    image: ghcr.io/ggml-org/llama.cpp:server
    ports:
      - "8000:8000"
    volumes:
      - ./cache:/root/.cache
    command: >
      -hf Qwen/Qwen3-VL-8B-Instruct-GGUF:Q8_0 --jinja -c 65535 --port "8000" --host 0.0.0.0
    restart: unless-stopped

GPU 运行版本

services:
  llama-cpp-server:
    image: ghcr.io/ggml-org/llama.cpp:server-cuda
    ports:
      - "8000:8000"
    volumes:
      - ./cache:/root/.cache
    command: >
      -hf Qwen/Qwen3-VL-8B-Instruct-GGUF:Q8_0 --jinja -c 65535 --port "8000" --host 0.0.0.0 --n-gpu-layers 99
    restart: unless-stopped
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]

关键参数注解,参考如下

-hf # 从 HuggingFace 自动下载模型
--jinja # 启用聊天格式模板(多轮对话必需)
-c 65535 # 上下文窗口大小(tokens 数量,越大占用越多显存)
--port "8000" # 容器内监听端口
--host 0.0.0.0 # 监听所有网络接口(Docker 容器必需)
--n-gpu-layers 99 # GPU 加载层数(99=全部层,0=纯 CPU)
更多参数用法参考:https://github.com/ggml-org/llama.cpp/blob/master/tools/server/README.md
  • 配置完,直接一键启动即可
docker-compose up -d

初次启动会自动从 huggingface 下载模型可能比较耗时(网络不好的话请自行配置加速代理),成功下载并启动截图如下:

文章配图

三、使用

1. llama.cpp 默认提供的 Web UI 中使用
  • 启动后,可直接访问:http://ip:8000/,进入对话页面

  • 在对话界面,可以输入文本、文件、图片等直接和启动的模型进行对话

文本对话

文章配图

多模态对话

文章配图

2. 使用 llama.cpp 提供的 OpenAI 接口兼容 API
  • 多模态对话示例 上面启动的 Qwen/Qwen3-VL 是非常强大的多模态模型,可以进行图片对话,输入下面手写文本图片

文章配图

postman 请求示例截图如下:

文章配图

  • 文本对话 API,适合通用问题回答 postman 请求示例截图如下:

文章配图

四、总结

  • llama.cpp 是个非常强大大语言模型启动工具,让普通电脑也能快速运行大语言模型,基于 C/C++ 开发,性能比 Ollama 更优
  • 安装依赖较少,兼容 CPU/GPU,可跨平台部署,可 Docker 一键部署
  • 提供 Web UI 在线访问,也提供 OpenAI 接口兼容的 Api,方便快速接入各种客户端
  • 私有部署,完全免费且私密,可以满足各种应用场景,如询问一下私密问题、搭建本地 AI 笔记、搭建本地 AI 数据库应用、识别自己的图片内容等

目录

  1. 一、简介
  2. 二、安装与下载模型(Docker 方式)
  3. 1. 搜索可用模型
  4. 2. 使用 docker-compose 安装启动 llama.cpp
  5. 运行下面命令,如果输出显卡信息即 Docker 内可以正常使用 GPU
  6. 三、使用
  7. 1. llama.cpp 默认提供的 Web UI 中使用
  8. 2. 使用 llama.cpp 提供的 OpenAI 接口兼容 API
  9. 四、总结

更多推荐文章

查看全部
  • AMD显卡运行llama.cpp的兼容性与部署方案
  • AMD AI Max+ 395 CPU 本地大模型推理性能评测
  • 网络安全初学者环境搭建指南:Kali Linux、phpStudy、Pikachu 及 BurpSuite 安装配置
  • 通义万相 2.1 开源视频生成模型功能解析
  • Windows 环境本地大模型工具链安装教程:Ollama + llama.cpp + LLaMA Factory
  • 深度评测 GLM-5:代码生成实战体验
  • 基于 DeepFace 与 OpenCV 的实时情绪分析系统
  • Linux 构建工具核心:make、进度条与 Git 仓库管理
  • 龙虾机器人(OpenClaw)本地部署指南
  • 大语言模型逻辑一致性研究:测量、评估与提升
  • 命令行启动 MongoDB 服务器报错:YAML 配置文件解析错误及解决
  • 基于 GitLab CI/CD 与 DeepSeek 的 AI Code Review 自动化方案
  • AI 生成海贼王漫画、苹果限制员工用 ChatGPT、李彦宏谈大模型与就业
  • GLM-4.6V-Flash-WEB 多模态模型轻量化部署指南
  • GitSync:Android 平台 Git 仓库同步工具解析
  • Ubuntu Server 22.04 LTS 安装与基础配置记录
  • OpenClaw、OpenAkita、MiniMax Agent 与 Kimi Claw 个人 AI 助手对比
  • 基于 Java 的 B/S 架构小区物业管理系统设计与实现
  • TCP 协议详解:报文结构、连接管理与流量控制
  • 大模型技术演进与未来办公形态变革分析

相关免费在线工具

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online

  • Base64 文件转换器

    将字符串、文件或图像转换为其 Base64 表示形式。 在线工具,Base64 文件转换器在线工具,online

  • Markdown转HTML

    将 Markdown(GFM)转为 HTML 片段,浏览器内 marked 解析;与 HTML转Markdown 互为补充。 在线工具,Markdown转HTML在线工具,online