跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
Shell / BashNode.jsAI

Windows 11 下配置 CUDA 版 llama.cpp 本地聊天

在 Windows 11 上使用 CUDA 版 llama.cpp 跑 GGUF 本地模型,核心是把预编译包解压到固定目录并加入系统 Path,这样 `llama-cli.exe` 可以全局调用。准备好支持 CUDA 的 NVIDIA 显卡、匹配的驱动和 CUDA 工具包后,下载 GGUF 模型并用 `-m` 指定路径、`--gpu-layers` 控制显存占用即可启动聊天。文中还整理了环境变量验证、常见报错、批处理启动和 `llama-server` 本地 API 的用法。

不羁发布于 2026/6/30更新于 2026/8/1728 浏览
Windows 11 下配置 CUDA 版 llama.cpp 本地聊天

Windows 11 下配置 CUDA 版 llama.cpp 本地聊天

这套配置的目标很明确:让 llama-cli.exe 能在任意目录直接调用,同时用 CUDA 把 GGUF 模型跑起来。做法不复杂,但有几个地方容易踩坑,尤其是环境变量、CUDA 版本和模型格式这三件事。

前置准备

硬件和系统
  • NVIDIA 独立显卡,建议支持 CUDA 12 或 13,算力 7.5 及以上更稳一些,像 RTX 30/40/50 系列、TITAN 都可以。
  • 显存要看模型大小。20B 4/3 量化模型,16G 以上会舒服很多;7B 模型 8G 也能跑。
  • 硬盘要留出模型空间,GGUF 文件通常在 3-20G 之间。
  • 系统用 Windows 11 64 位,家庭版和专业版都行。
  • 显卡驱动尽量用 NVIDIA 官方最新版,CUDA 兼容性会省很多事。
  • CUDA 工具包要和 llama.cpp 版本对上,建议直接用 CUDA 13.1。
需要下载的东西
  • CUDA 版 llama.cpp 预编译包。Windows 版本建议直接下官方发布页里的 llama-b7907-bin-win-cuda-13.1-x64.zip。
  • GGUF 格式模型。llama.cpp 只认 GGUF,Hugging Face 上能找到不少,量化等级从 Q2_K 到 Q6_K 都有,越高通常效果越好,但也越吃显存。

解压并整理目录

我更建议把 llama.cpp 放到一个固定、干净的目录里,比如 D:\llama。这样后面配 Path、写批处理都省心,路径里也别带中文和空格。

解压后,你会看到几个常用文件:llama-cli.exe、ggml-cuda.dll、llama-server.exe 等。

文件夹名称也尽量简单,别给自己后面调用时添麻烦。

配置系统环境变量

这一步做完,llama-cli.exe 就能像系统命令一样直接调用,不用每次都切到 D:\llama。

打开环境变量窗口
  1. 按 Win + R,输入 sysdm.cpl,回车。
  2. 切到「高级」选项卡,点右下角的「环境变量」。
把 llama.cpp 目录加到 Path
  1. 在「系统变量」里找到 Path,双击打开。这里要改的是系统变量,不是用户变量。
  2. 点「新建」,填入 D:\llama。
  3. 把这条路径往上挪一挪,然后一路点「确定」保存。
检查是否生效

环境变量改完后,必须重启已经打开的 CMD 或 PowerShell 窗口,必要时直接重启电脑。我一般会直接重开,省得排查半天发现只是窗口没刷新。

重启后打开任意终端,执行:

where.exe llama-cli

如果输出里有 D:\llama\llama-cli.exe,说明 Path 已经生效。

再执行一次:

llama-cli.exe

如果看到 error: --model is required,同时终端里出现 CUDA 设备信息,说明程序已经能正常找到并调用 GPU。

ggml_cuda_init: found 1 CUDA devices: Device 0: NVIDIA GeForce RTX 3090, compute capability 8.6, VMM: yes load_backend: loaded CUDA backend from D:\llama\ggml-cuda.dll 

运行 GGUF 模型聊天

模型放哪儿

模型建议单独放一个目录,比如 E:\Downloads\LLM_Models。别放在乱七八糟的临时目录里,后面改路径很烦。

先跑起来的命令

最核心的参数就几个:

  • -m:模型文件完整路径,必填。
  • -n:单次生成的最大 token 数,常用 2048 或 4096。
  • --gpu-layers:放进显存的层数,这个参数最关键。RTX 3090 可以从 35 往上试,显存小就往下调。
  • --temp、--ctx-size 这类参数可以后面再调,不是起步必需项。

命令长这样:

llama-cli.exe -m "模型文件路径" -n 2048 --gpu-layers 35

示例:

llama-cli.exe -m "E:\Downloads\gpt-oss-20b-base.Q3_K_L.gguf" -n 2048 --gpu-layers 35
怎么判断跑通了

正常启动时,终端会先显示 CUDA 设备加载,再加载模型,然后出现 llama.cpp 的标识和模型信息,最后进入交互界面,提示符一般是 >。

这时候直接输入问题,回车就能得到本地回复。CUDA 开起来以后,速度会比纯 CPU 快不少,实际体验差距很明显。

常用交互命令
  • 退出:/exit 或 Ctrl+C
  • 重新生成:/regen
  • 清空上下文:/clear
  • 读入文本文件:/read 文本文件路径

常见问题

llama-cli.exe 不是内部或外部命令

通常是这几个原因:环境变量没配好、配完没重启终端、路径写错了。

先检查 Path 里是不是 D:\llama,再确认终端有没有重开。路径里最好也不要有中文和空格,少走很多弯路。

输入 .\llama-cli.exe 报错,但直接输入 llama-cli.exe 正常

这是调用方式的问题。./ 这种写法更偏 Linux 或某些 shell 的习惯,Windows 下如果已经把目录加到 Path,直接输入 llama-cli.exe 就够了。

CUDA 设备没找到,退回纯 CPU

一般是驱动太旧、CUDA 版本不匹配,或者根本没装 CUDA 工具包。

先更新 NVIDIA 官方驱动,再确认下载的 llama.cpp 包和 CUDA 版本一致。可以在 CMD 里跑一下:

nvcc -V
模型加载失败,提示文件格式错误

多半是模型不是 GGUF 格式。重新下载 GGUF 版本就行,Hugging Face 上找对应仓库会更稳一些。

运行时报 out of memory

这基本就是显存不够了。常见原因是量化等级太高、--gpu-layers 设太大,或者你同时还开着别的显存占用程序。

处理办法也直接:换更低量化的模型,降低 --gpu-layers,或者先把其他吃显存的软件关掉。

进阶用法

写一个批处理文件双击启动

如果你不想每次都手敲命令,写个 .bat 文件最省事。

  1. 右键桌面,新建一个文本文档,改名为 run_llama.bat。
  2. 用记事本打开,写入下面内容,把模型路径改成自己的:
@echo off
echo 正在启动 CUDA 版 llama.cpp,加载模型中...
llama-cli.exe -m "E:\Downloads\gpt-oss-20b-base.Q3_K_L.gguf" -n 2048 --gpu-layers 35
pause
统一管理模型和脚本

如果模型比较多,我会直接在 D:\llama 下建一个 Models 文件夹,把 GGUF 模型集中放进去。批处理文件可以放桌面,也可以单独建一个启动目录,核心是别散得到处都是。

用 llama-server 起 API

llama.cpp 也能开本地服务,方便别的程序接入。

llama-server.exe -m "E:\Downloads\gpt-oss-20b-base.Q3_K_L.gguf" --gpu-layers 35 --port 8080 

启动后,访问 http://localhost:8080 就能看到服务。

这套流程的关键不是参数有多花,而是路径、驱动、CUDA 版本和模型格式都对得上。前面四项稳定了,后面跑聊天、开服务、写批处理其实都只是顺手的事。

目录

  1. Windows 11 下配置 CUDA 版 llama.cpp 本地聊天
  2. 前置准备
  3. 硬件和系统
  4. 需要下载的东西
  5. 解压并整理目录
  6. 配置系统环境变量
  7. 打开环境变量窗口
  8. 把 llama.cpp 目录加到 Path
  9. 检查是否生效
  10. 运行 GGUF 模型聊天
  11. 模型放哪儿
  12. 先跑起来的命令
  13. 怎么判断跑通了
  14. 常用交互命令
  15. 常见问题
  16. llama-cli.exe 不是内部或外部命令
  17. 输入 .\llama-cli.exe 报错,但直接输入 llama-cli.exe 正常
  18. CUDA 设备没找到,退回纯 CPU
  19. 模型加载失败,提示文件格式错误
  20. 运行时报 out of memory
  21. 进阶用法
  22. 写一个批处理文件双击启动
  23. 统一管理模型和脚本
  24. 用 llama-server 起 API
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Ingress-Nginx 概念解析与实践部署指南
  • OpenClaw 开源个人 AI 助手部署指南:一键脚本 Docker npm 安装与中文配置
  • 基于 WebGIS 的体感温度实证分析:中国火炉城市评估
  • Llama Factory 微调训练全过程详解
  • 基于 Spring Boot 的视频点播系统设计与实现
  • WhisperLiveKit 实战指南:从本地部署到生产环境
  • AI 时代初级开发者的创意生存指南:数据与创新的边界
  • ComfyUI 入门:ControlNet 节点与预处理器使用指南
  • 滑动窗口算法实战:从长度最小子数组到最小覆盖子串
  • OpenClaw 全能助手安装与配置指南
  • Android 求职指南:简历优化与面试核心问题解析
  • FPGA 工程实战经验:板级调试与 Qsys 系统搭建
  • Vivado IP 核 DDS 配置与原理详解
  • 基于 FPGA 的深度强化学习框架实现超音速闭环智能流动控制实验
  • pxcharts-vue:基于 Vue3 的开源多维表格解决方案
  • 鸿蒙系统生态展望:Flutter 框架与跨平台开发趋势分析
  • 大模型时代的技术趋势与产业机遇
  • OpenClaw 飞书机器人权限配置与安全实践
  • PPT 中嵌入 VR 全景图片与 Google 相机空间图片的操作方法
  • VSCode 搭建 Java 开发环境指南

相关免费在线工具

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online

  • Base64 文件转换器

    将字符串、文件或图像转换为其 Base64 表示形式。 在线工具,Base64 文件转换器在线工具,online

  • Markdown转HTML

    将 Markdown(GFM)转为 HTML 片段,浏览器内 marked 解析;与 HTML转Markdown 互为补充。 在线工具,Markdown转HTML在线工具,online