跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

Windows 11 使用 llama.cpp 运行 Qwen3.5 量化模型测试

记录了在 Windows 11 环境下使用 llama.cpp 本地部署和测试 Qwen3.5 系列量化模型的过程。通过下载 CPU 版本的 llama.cpp 二进制文件及 Hugging Face 镜像站上的 GGUF 模型(包括 0.8B 和 2B 版本的不同量化方案),进行了多轮对话、翻译、数学计算及物理问题求解的推理测试。测试结果显示,UD-Q4_K_XL 量化版本在精度上优于 Q4_K_M,但生成速度随参数量增加而下降。同时发现小模型在处理复杂逻辑、物理公式推导及长文本翻译时存在幻觉或错误,需结合实际场景选择合适模型。

山野来信发布于 2026/4/6更新于 2026/9/877 浏览

Windows 11 使用 llama.cpp 运行 Qwen3.5 量化模型测试

1. 下载 llama.cpp 二进制文件

访问 GitHub 发布页: https://github.com/ggml-org/llama.cpp/releases

选择适合自己平台的版本。由于无独立显卡,选择 CPU 版本。

下载地址示例: https://github.com/ggml-org/llama.cpp/releases/download/b8192/llama-b8192-bin-win-cpu-x64.zip

解压至 D:\llama8\ 目录。

2. 下载量化模型

参考社区指南,建议闭眼选 UD-Q4_K_XL 或 Q4_K_M。Unsloth 官方的 KL Divergence 测试显示,UD-Q4_K_XL 在 Pareto 前沿上表现 SOTA(State of the Art),精度损失可以忽略不计。

原教程中的 hf download 命令行方式报错(连接超时),因此通过镜像站手工查找并下载文件。

下载链接如下:

  1. https://hf-mirror.com/Mustafaege/Qwen3.5-0.8B-GGUF-q4_k_m/resolve/main/Qwen3.5-0.8B.Q4_K_M.gguf?download=true
  2. https://hf-mirror.com/unsloth/Qwen3.5-0.8B-GGUF/resolve/main/Qwen3.5-0.8B-UD-Q4_K_XL.gguf?download=true
  3. https://hf-mirror.com/unsloth/Qwen3.5-2B-GGUF/resolve/main/Qwen3.5-2B-UD-Q4_K_XL.gguf?download=true

注:第一个模型非 Unsloth 官方发布,大小与官方版相近,作为对比保留。

3. 模型测试与结果分析

使用 llama-cli 命令行工具进行测试,参数设置 --ctx-size 16384。

3.1 模型一:Qwen3.5-0.8B.Q4_K_M.gguf

命令:

C:\d\models\qw3508q4>\d\llama8\llama-cli -m Qwen3.5-0.8B.Q4_K_M.gguf --ctx-size 16384

测试结果:

  • 翻译任务: 输入 "translate into Chinese" 时未能正确理解指令,直接抄录英文原文;修正为 "transalte into Chinese" 后输出正常。
  • 生成速度: 约 36 t/s。
  • Host 1192 MiB。
内存占用:

3.2 模型二:Qwen3.5-0.8B-UD-Q4_K_XL.gguf

测试结果:

  • 翻译任务: 能够准确翻译技术文档内容(如 Yannakakis 算法相关描述)。
  • 数学计算: 能正确使用求根公式法解方程 $x^2-x-20=0$,步骤清晰。
  • 因式分解: 能正确给出结果 $x_1=5, x_2=-4$。
  • 生成速度: 约 32 t/s。
  • 内存占用: Host 1222 MiB。

注意: 部分术语(如 conjunctive queries)翻译存在遗漏。

3.3 模型三:Qwen3.5-2B-UD-Q4_K_XL.gguf

测试结果:

  • 翻译任务: 翻译流畅度优于 0.8B 版本,但仍有少量漏译。
  • 数学计算: 求根公式解答正确。
  • 物理题: 题目要求计算瞬时功率 $P=Fv$。模型给出的推导过程复杂且最终结果错误(得出 $mv^3/4x$),而网页版 Qwen3.5 Plus 直接指出 $P=Fv$ 且距离 $x$ 为干扰信息。说明小模型在处理复杂逻辑推理时容易出错。
  • 化学方程式: 格式书写规范。
  • 连续对话: 出现幻觉,将西红柿误称为杂粮,复制了上一个问题的答案。
  • 生成速度: 约 23 t/s。
  • 内存占用: Host 1975 MiB。

4. 总结

  1. 性能对比: 参数量越大,生成速度越慢(0.8B ~32t/s,2B ~23t/s)。UD-Q4_K_XL 量化版本在精度和逻辑推理上略优于 Q4_K_M。
  2. 准确性: 小模型在处理简单翻译和基础数学时表现尚可,但在物理公式推导、长文本翻译及多轮对话一致性上存在明显缺陷,容易出现幻觉或逻辑错误。
  3. 适用场景: 适合本地轻量级部署体验,若需高精度推理建议结合云端大模型或使用更高规格硬件。

目录

  1. Windows 11 使用 llama.cpp 运行 Qwen3.5 量化模型测试
  2. 1. 下载 llama.cpp 二进制文件
  3. 2. 下载量化模型
  4. 3. 模型测试与结果分析
  5. 3.1 模型一:Qwen3.5-0.8B.Q4KM.gguf
  6. 3.2 模型二:Qwen3.5-0.8B-UD-Q4KXL.gguf
  7. 3.3 模型三:Qwen3.5-2B-UD-Q4KXL.gguf
  8. 4. 总结

更多推荐文章

查看全部
  • 基于STM32的智能家居安防系统设计与实现
  • 力扣 Hot100 普通数组题目 Python 实现
  • 文心一言 4.5 开源模型技术解析与部署实践
  • 2026 牛客寒假算法基础集训营 1 题解
  • KoboldAI 安装与配置指南
  • Ubuntu 24.04 中文版 n8n Docker Compose 部署指南
  • Gradio用几行代码构建 AI Web 应用
  • Nanbeige4.1-3B 模型前向传播优化:LlamaForCausalLM 源码解析
  • go-zero 微服务架构入门与实践
  • LightGBM 模型部署:从训练到 Java 生产环境完整指南
  • 宇树科技机器人核心技术
  • 金仓数据库 ksql 指南:创建与管理用户和权限 (KingbaseES 安全控制核心)
  • 基于 WebTop 与 Tailscale 的云端 OpenClaw 真实浏览器部署方案
  • 基于 Next.js 的曼德勃罗集 Web 可视化应用
  • ComfyUI Photoshop 插件安装与使用指南
  • 机器人实践开发①:Foxglove 开发环境完整搭建指南
  • AI 绘画实战:从关键词到高质量图像生成的技术实现与优化
  • 飞算 JavaAI 插件安装与实战开发指南
  • 利用 Claude Code 和 Skills 自动组装 AI 工作流
  • 扩散模型(Diffusion Model)原理与图像生成实战

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online