跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

llama-cpp-python 完整安装与配置指南

llama-cpp-python 的安装与配置流程。支持通过 pip 直接安装源码构建,或指定 CMAKE_ARGS 启用 CUDA、Metal 及 OpenBLAS 硬件加速。提供预构建轮子安装方案以简化流程。内容涵盖 Windows 和 MacOS 常见错误解决、开发环境搭建、高级 API 调用示例(文本生成与聊天完成)以及性能优化建议。旨在帮助用户快速在本地部署大型语言模型应用。

狂少发布于 2026/4/6更新于 2026/9/1079 浏览

llama-cpp-python 完整安装与配置指南

本文介绍 llama-cpp-python 的安装配置方法。作为 llama.cpp 的 Python 绑定库,它提供了简单易用的 AI 开发体验。

基础安装:一键搞定

llama-cpp-python 的安装过程简单,只需运行以下命令:

pip install llama-cpp-python

该命令会自动从源码构建 llama.cpp。如果遇到构建问题,可以添加 --verbose 参数查看详细日志。

硬件加速配置方案

为了获得最佳性能表现,您可以根据自己的硬件配置选择合适的加速后端。

CUDA 加速配置(NVIDIA 显卡用户)
CMAKE_ARGS="-DGGML_CUDA=on" pip install llama-cpp-python
Metal 加速配置(苹果设备用户)
CMAKE_ARGS="-DGGML_METAL=on" pip install llama-cpp-python
OpenBLAS 加速配置(CPU 优化方案)
CMAKE_ARGS="-DGGML_BLAS=ON -DGGML_BLAS_VENDOR=OpenBLAS" pip install llama-cpp-python

预构建轮子安装方法

如果您不想从源码编译,可以使用预构建的二进制轮子进行快速安装。

基础 CPU 版本
pip install llama-cpp-python --extra-index-url https://abetlen.github.io/llama-cpp-python/whl/cpu
CUDA 加速版本
pip install llama-cpp-python --extra-index-url https://abetlen.github.io/llama-cpp-python/whl/cu121

快速验证安装结果

安装完成后,您可以通过创建一个简单的测试脚本来验证安装是否成功:

from llama_cpp import Llama
# 初始化模型(请替换为实际模型路径)
llm = Llama(model_path="./models/your-model.gguf")
# 进行简单的文本生成测试
output = llm("你好,请介绍一下你自己", max_tokens=32)
print(output)

常见安装问题解决方案

Windows 系统安装问题

如果在 Windows 系统上遇到'找不到 nmake'或 CMAKE_C_COMPILER 相关错误,可以设置以下环境变量:

:CMAKE_GENERATOR = 
:CMAKE_ARGS = 
$env
"MinGW Makefiles"
$env
"-DGGML_OPENBLAS=on -DCMAKE_C_COMPILER=C:/w64devkit/bin/gcc.exe"
MacOS 系统注意事项

苹果 M 系列芯片用户务必安装 ARM64 版本的 Python,否则性能会大幅下降。

开发环境搭建指南

如果您想要参与项目开发或进行定制化修改,可以按照以下步骤搭建开发环境:

git clone --recurse-submodules https://github.com/abetlen/llama-cpp-python
cd llama-cpp-python
# 升级 pip 以确保兼容性
pip install --upgrade pip
# 以可编辑模式安装
pip install -e .
# 安装服务器功能(可选)
pip install -e '.[server]'

核心功能模块介绍

高级 API 使用示例

llama-cpp-python 提供了简单易用的高级 API 接口:

from llama_cpp import Llama
# 初始化模型并设置参数
llm = Llama(
    model_path="./models/7B/llama-model.gguf",
    n_ctx=2048,  # 设置上下文窗口大小
    n_gpu_layers=-1,  # 启用 GPU 加速
    seed=1337  # 设置随机种子
)
# 创建文本补全
response = llm.create_completion(
    prompt="请解释什么是人工智能",
    max_tokens=100,
    temperature=0.7
)
聊天完成功能
# 创建聊天完成
chat_response = llm.create_chat_completion(
    messages=[
        {"role": "system", "content": "你是一个乐于助人的 AI 助手"},
        {"role": "user", "content": "今天天气怎么样?"}
    ]
)

实用工具和资源

项目中提供了丰富的示例代码和实用工具:

  • 高级 API 示例:examples/high_level_api/
  • 底层 API 示例:examples/low_level_api/
  • Gradio 聊天界面:examples/gradio_chat/
  • 服务器配置:llama_cpp/server/

性能优化技巧

  1. 调整上下文窗口:根据任务需求合理设置 n_ctx 参数
  2. 启用 GPU 加速:使用 n_gpu_layers 参数
  3. 选择合适的模型:根据硬件配置选择适当规模的模型

下一步学习建议

完成基础安装后,您可以进一步探索:

  • 学习 examples 目录中的各种应用场景
  • 查看官方文档获取详细 API 说明
  • 尝试不同的模型配置以获得最佳效果

现在您已经掌握了 llama-cpp-python 的完整安装配置方法,可以开始构建自己的 AI 应用了!

目录

  1. llama-cpp-python 完整安装与配置指南
  2. 基础安装:一键搞定
  3. 硬件加速配置方案
  4. CUDA 加速配置(NVIDIA 显卡用户)
  5. Metal 加速配置(苹果设备用户)
  6. OpenBLAS 加速配置(CPU 优化方案)
  7. 预构建轮子安装方法
  8. 基础 CPU 版本
  9. CUDA 加速版本
  10. 快速验证安装结果
  11. 初始化模型(请替换为实际模型路径)
  12. 进行简单的文本生成测试
  13. 常见安装问题解决方案
  14. Windows 系统安装问题
  15. MacOS 系统注意事项
  16. 开发环境搭建指南
  17. 升级 pip 以确保兼容性
  18. 以可编辑模式安装
  19. 安装服务器功能(可选)
  20. 核心功能模块介绍
  21. 高级 API 使用示例
  22. 初始化模型并设置参数
  23. 创建文本补全
  24. 聊天完成功能
  25. 创建聊天完成
  26. 实用工具和资源
  27. 性能优化技巧
  28. 下一步学习建议

更多推荐文章

查看全部
  • VS Code Copilot 深度使用指南:从安装到高级配置
  • 前端安全:核心漏洞防御与最佳实践
  • 前端通用 AI Rules 定义:适配 Cursor、Trae 等主流开发工具
  • Linux 生产者 - 消费者模型与条件变量详解
  • Linux 权限管理指南:从 Shell 命令到文件访问控制
  • 知网 AIGC 检测算法升级分析与应对策略
  • 文件的时间属性与时间戳管理
  • 常见 AI 降重工具功能对比与选择指南
  • Spring Cloud Alibaba AI 初体验
  • Python 2026 发展局势:AI 时代的通用基础设施语言
  • 车载AVM开发:核心算法与C++实战
  • Diffusion Transformer (DiT) 架构解析:从图像生成到机器人动作预测
  • Whisper-base.en:74M 参数打造精准英文语音识别工具
  • 遥感时序视觉语言模型:技术原理与应用综述
  • ARM 架构盒子零依赖部署 Nullclaw 实践指南
  • 高鋒集團黃俊瑯:資本與生態如何賦能傳統企業 Web3 轉型
  • iOS 新系统适配:TabBar 液态玻璃效果与 WiFi SSID 获取方案
  • 从三年前端到 CS 硕士:我在韩国留学的得失复盘
  • 前端拖拽排序实现详解:从原理到实践
  • 如何优化 Whisper JAX 推理速度:10 个实用技巧提升性能

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online