跳到主要内容
Windows 11 使用 llama.cpp 运行 Qwen3.5 量化模型测试 | 极客日志
text
or
stop
or
exit
text
> translate into Chinese: No Thinking Content in History: In multi-turn conversations, the historical model output should only include the final output part and does not need to include the thinking content. It is implemented in the provided chat template in Jinja2. However, for frameworks that do not directly use the Jinja2 chat template, it is up to the developers to ensure that the best practice is followed.
结果:无思考内容的历史:在多轮对话中,历史模型的输出应仅包含最终输出部分,无需包含思考内容。该实现方式已嵌入到提供的聊天模板中(Jinja2)。但对于不使用该 Jinja2 聊天模板的框架,应由开发者确保遵循最佳实践。
Prompt: 437.5 t/s | Generation: 35.7 t/s
PostgreSQL 是一个强大的开源对象关系数据库系统,拥有超过 35 年的活跃开发历史。该系统因其卓越的重叠性、强大的功能完备性以及出色的性能表现,在国际上获得了广泛认可。
Prompt: 450.5 t/s | Generation: 35.6 t/s
llama_memory_breakdown_print: | memory breakdown [MiB] |
total free self model context compute unaccounted |
llama_memory_breakdown_print: | - Host | 1192 = 492 + 211 + 489 |
llama_memory_breakdown_print: | - CPU_REPACK | 181 = 181 + 0 + 0 |
结论:0.8B Q4_K_M 量化的生成速度约 36 t/s。直接抄录英文原文的情况较多,需明确指令。
3.2 第二个模型 (Qwen3.5-0.8B-UD-Q4_K_XL) C:\d\models\qw3508q4> D:\llama8\llama-cli -m Qwen3.5-0.8B-UD-Q4_K_XL.gguf --ctx-size 16384 -cnv
> translate into Chinese: Acyclic conjunctive queries form the backbone of most analytical workloads...
结果:循环有向 conjunctive queries 构成了大多数分析工作负载的核心基础...(翻译质量有所提升)。
结果:
步骤清晰,计算正确。
x1 = 5, x2 = -4
Prompt: 302.9 t/s | Generation: 31.0 t/s
Prompt: 324.5 t/s | Generation: 30.8 t/s
> 一物体静止在水平面上,在水平恒力 F 作用下由静止开始运动,前进距离为 x 时,速度达到 v,求此时力 F 的瞬时功率
结果:推导过程存在错误,最终公式 P = mv^3 / 4x 有误,正确答案应为 P = Fv 或结合动能定理推导。
Prompt: 203.0 t/s | Generation: 23.4 t/s
结论:0.8B UD-Q4_K_XL 量化的生成速度约 32 t/s。conjunctive queries 漏译问题仍存在。
3.3 第三个模型 (Qwen3.5-2B-UD-Q4_K_XL) C:\d\models\qw3508q4> D:\llama8\llama-cli -m Qwen3.5-2B-UD-Q4_K_XL.gguf --ctx-size 16384 -cnv
> translate into Chinese: Acyclic conjunctive queries form the backbone of most analytical workloads...
结果:循环查询构成了大多数分析工作负载的核心...(翻译更准确)。
Prompt: 199.7 t/s | Generation: 24.0 t/s
结果:步骤详细,计算正确。
x1 = 5, x2 = -4
Prompt: 198.5 t/s | Generation: 23.3 t/s
> 一物体静止在水平面上,在水平恒力 F 作用下由静止开始运动,前进距离为 x 时,速度达到 v,求此时力 F 的瞬时功率
结果:方法二推导出现错误,P = mv^3 / 4x。网页版 Qwen3.5-Plus 回答指出题目未给出质量 m,且瞬时功率核心公式是 P = Fv。
Prompt: 203.0 t/s | Generation: 23.4 t/s
> 室温下,0.1 mol·L⁻¹ 氨水的 pH = 11 。NH₃·H₂O 的电离方程式是?
结果:NH₃·H₂O ⇌ NH₄⁺ + OH⁻(格式不错)。
> 形而上学是什么意思?
> 红薯是怎么传到中国的?
> 西红柿是怎么传到中国的?
结果:连续对话容易错,把西红柿也说成了杂粮,抄了上一个问题的答案。
Prompt: 193.9 t/s | Generation: 23.4 t/s
结论:2B UD-Q4_K_XL 量化的生成速度约 23 t/s。相比 0.8B 模型,逻辑能力增强,但推理复杂物理题仍有偏差。
4. 总结
速度 :0.8B Q4_K_M 最快 (~36 t/s),2B 最慢 (~23 t/s)。
质量 :UD-Q4_K_XL 优于 Q4_K_M,但在特定术语翻译上仍有瑕疵。
能力 :2B 模型在数学和逻辑上优于 0.8B,但仍不如云端 Plus 版本。
注意 :连续对话易产生幻觉,需人工校验复杂任务结果。
相关免费在线工具 加密/解密文本 使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online
RSA密钥对生成器 生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online
Mermaid 预览与可视化编辑 基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online
随机西班牙地址生成器 随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online
Gemini 图片去水印 基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online
Base64 字符串编码/解码 将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online