跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
C++AI算法

llama.cpp 多环境部署指南:从 CPU 到 CUDA/Metal 的高效推理实践

llama.cpp 是一款基于 C/C++ 的轻量级推理引擎,支持将 Hugging Face 模型转换为 GGUF 格式并在多种硬件环境下运行。文章详细说明了从零开始的环境准备工作,包括安装编译工具链及依赖项。重点阐述了针对不同硬件架构的编译方法,涵盖纯 CPU 版本构建、Apple Silicon 芯片下的 Metal 加速配置,以及 Windows 下 WSL2 环境的推荐方案。通过合理的编译选项设置,用户可以在本地实现离线的大模型推理体验。

灵魂摆渡发布于 2026/4/10更新于 2026/7/2441 浏览

1. 环境准备:从零开始的硬件与软件栈

对于希望在本地运行大模型的用户,llama.cpp 是一个轻量级推理引擎,能将 Hugging Face 上的模型转换为 GGUF 格式文件,然后在本地电脑上——无论是 Mac 的 Apple Silicon 芯片,还是 Windows/Linux 的 CPU 或 NVIDIA GPU——流畅地运行。

本文介绍从环境准备到模型量化、再到跨平台高效推理的完整流程。重点分享在不同硬件(CPU、Apple Metal、NVIDIA CUDA)下的部署差异,以及如何针对单卡和多卡进行性能调优。无需深厚的 C++ 背景或深度学习框架经验即可操作。

在开始动手之前,先理清需要准备的东西。硬件上,主要分为三种情况:纯 CPU、苹果电脑的 Metal(Apple Silicon M 系列芯片),或者带有 NVIDIA 显卡的电脑。软件栈主要围绕 llama.cpp 的编译环境。对于大多数 Linux 和 macOS 用户,系统自带的终端和包管理器(如 apt、brew)就足够了。Windows 用户推荐使用 WSL2(Windows Subsystem for Linux),它能提供一个近乎原生的 Linux 环境。

注意:无论你选择哪种硬件路径,第一步都是确保你的系统有基础的编译工具链。打开终端,输入 gcc --version 或 clang --version 查看,如果没有,就用 sudo apt install build-essential(Ubuntu)或 xcode-select --install(macOS)来安装。

2. 编译 llama.cpp:针对不同硬件的'定制化'构建

拿到 llama.cpp 的源代码后,需要根据你的硬件环境进行编译,生成最适合你机器的可执行文件。

2.1 获取源代码与基础准备

首先,克隆仓库。打开终端,执行命令:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp

这个仓库里包含了所有的源代码和工具。接下来,需要编译工具 make。通常 Linux 系统已经自带,如果没有,用 sudo apt install make 安装。macOS 用户如果安装了 Xcode Command Line Tools,也会包含 make。为了确保万无一失,还需要安装 cmake 和 pkg-config。一条命令搞定:

# Ubuntu/Debian
sudo apt update && sudo apt install build-essential cmake pkg-config
# macOS (使用 Homebrew)
brew install cmake pkg-config

准备工作就绪,现在进入关键环节:针对不同硬件编译。

2.2 CPU 版本编译:最通用的起点

CPU 版本是兼容性最广的,不依赖任何特殊的图形 API,完全依靠中央处理器进行计算。编译命令也最简单:

make

这个命令会调用 Makefile,自动检测系统环境,编译出纯 CPU 版本的可执行文件,比如 main、llama-cli、llama-server 等。编译完成后,可以运行 ./llama-cli -h 查看帮助信息,确认编译成功。对于只是想体验或者硬件没有 GPU 的用户来说,这一步就够了。但 CPU 推理速度相对较慢,尤其是大模型,所以如果你的机器有 GPU,建议继续查看后续内容。

2.3 Metal (Apple Silicon) 版本编译:榨干苹果芯片的性能

如果你用的是搭载 M1、M2、M3 等 Apple Silicon 芯片的 Mac,那么 Metal Performance Shaders (MPS) 是你的性能利器。它允许计算任务直接跑在强大的集成 GPU 上。编译时,需要显式地启用 Metal 支持。

目录

  1. 1. 环境准备:从零开始的硬件与软件栈
  2. 2. 编译 llama.cpp:针对不同硬件的“定制化”构建
  3. 2.1 获取源代码与基础准备
  4. Ubuntu/Debian
  5. macOS (使用 Homebrew)
  6. 2.2 CPU 版本编译:最通用的起点
  7. 2.3 Metal (Apple Silicon) 版本编译:榨干苹果芯片的性能
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Mac mini M4 部署 OpenClaw + Ollama 本地大模型接入飞书机器人
  • LangChain 速成课程:构建基于 OpenAI LLM 的应用
  • MCP 插件配置指南:以 browser-tools-mcp 为例
  • H800 多卡集群网络配置:Mellanox 与 NVLink 调优指南
  • 通义万相 2.1 在 AIGC 中的应用与集成实践
  • 在本地跑起大模型:Ollama + Open WebUI 搭建记录
  • ZLibrary 反爬机制深度解析:JS 混淆、签名与频率限制绕过
  • OpenClaw 开源机器人实现空间智能记忆,具身智能新里程碑
  • 大模型幻觉问题治理:技术体系、工程实践与未来演进
  • VsCode 远程连接服务器后 GitHub Copilot 无法使用修复方案
  • 网络安全行业入门指南:岗位方向与学习路径
  • 前端内容创作 Agent 提示词
  • 动态规划:求乘积为正数的最长子数组长度
  • 学术写作中重复率与 AIGC 检测风险的双重化解方案
  • Python 简易背景抠图方案实践与探索
  • 豆包 Seedream 4.0 多图融合能力测评:田园犬与三花猫多场景创作
  • 基于大模型的智能网页爬虫技术实现
  • AI Agent 新范式:基于 FastGPT 与 MCP 协议构建工具增强型智能体
  • ToDesk ToClaw AI 实现科技新闻日报自动化实战
  • MySQL 库级 DDL 操作详解:创建、修改与删除

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online