跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
C++AI算法

llama.cpp 新增 Web UI,本地大模型部署性能与体验升级

llama.cpp 迎来重大更新,内置 Web UI 界面,支持命令行快速安装与部署。实测显示其推理速度优于 Ollama,且具备上下文缓存、多文件/PDF/图片输入、数学公式渲染等功能。支持通过 pake 打包为桌面应用。相比 Ollama,llama.cpp 更轻量但模型下载依赖 HuggingFace,国内网络环境可能受限,暂不支持网络搜索和 MCP。适合追求隐私和性能的本地大模型部署场景。

魔法巫师发布于 2026/4/5更新于 2026/7/1759 浏览
llama.cpp 新增 Web UI,本地大模型部署性能与体验升级

Ollama 背后执行推理的核心技术其实是由 llama.cpp 承担的,GGUF 模型格式也是由 llama.cpp 的作者所开发。

现在 llama.cpp 迎来重大更新,它也有了自己的 Web UI,我测试了安装部署和自行打包,很多地方确实比 Ollama 还有方便好用。

官方介绍,优势如下:

  • 完全免费、开源且由社区驱动
  • 在所有硬件上表现出色
  • 高级上下文和前缀缓存
  • 并行和远程用户支持
  • 极其轻量级且内存高效
  • 充满活力且富有创造力的社区
  • 100% 隐私

使用之前需要先安装 llama.cpp server

llama.cpp Server

我还是喜欢命令行直接安装

## Winget (Windows)
winget install llama.cpp

## Homebrew (Mac and Linux)
brew install llama.cpp

然后启动 UI,也是命令行,为了快速测试,我调用 Qwen2.5 的 0.5b

llama-server -hf Qwen/Qwen2.5-0.5B-Instruct-GGUF --jinja -c 0 --host 127.0.0.1 --port 8033

量化后模型文件来到不到 500Mb,我发现它默认选 q4_k_m

Model Info

然后浏览器打开

Web UI

随便问个问题,速度 97t/s

对比 Ollama 82t/s 的样子

Speed Comparison

其他功能也都挺实用

从磁盘或剪贴板添加多个文本文件到对话的上下文中

Text Context

将一个或多个 PDF 附件添加到对话中。默认情况下,PDF 的内容将被转换为纯文本,不包括任何视觉元素。

PDF Attachment

也可以在 AI 模型支持的情况下将 PDF 处理为图像。

PDF Image

当所选的 AI 模型具有视觉输入能力时,可以在对话中插入图片:

Image Insert

图片可以与文本上下文一起插入:

Context Image

可以渲染数学表达式:

Math Render

使用 Import/Export 选项直接管理私人对话:

Chat Export

新的 WebUI 对移动设备友好:

Mobile Friendly

其他功能还有,比如:

  • 支持通过 URL 参数传递输入
  • 根据之前的讨论点编辑或重新生成消息以创建分支
  • 同时运行多个聊天对话
  • 并行图像处理
  • 支持嵌入式渲染生成的 HTML/JS 代码
  • 指定一个自定义的 JSON 模式以约束生成的输出到特定格式

目前硬伤是只能浏览器,想打包成 app 也可以,我使用的是 tw93 开发的 pake,一行命令即可,本地服务也可以打包成 app

Pake App

然后它就将只能浏览器访问的 web 应用打包成 app 了

App Result

如此轻量舒服的应用,我与这位网友有相同的期待——支持其他模型的接入

Expectation

总结来看,比之前想要挑战 ollama 的 Shimmy 要好很多,但是 Ollama 玩了这么久也不是吃素的:

  1. Ollama 有更加方便的 app,随时切换本地模型甚是方便
  2. Ollama 还有免费云模型可以调用呢,deepseek-v3.1:671b-cloud都敢给
  3. 网络问题,它目前只能支持 HF 下载模型,国内用户不友好
  4. 网络搜索和 MCP 也不支持

目录

  1. Winget (Windows)
  2. Homebrew (Mac and Linux)
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Java 并发编程:核心原理、实战与避坑
  • LLM Agent:RAG 召回多样性优化策略详解
  • Java 中 == 与 equals() 的区别
  • HarmonyOS 动态轨道生成:实现点击延伸的随机路径系统
  • 利用检索增强生成(RAG)降低大模型幻觉与虚假信息
  • 网络安全入门:成为安全从业者的 12 个关键步骤
  • 基于 FPGA 的图像形态学腐蚀处理 Verilog 开发与硬件测试
  • 从叠盘子到括号匹配——用C实现栈
  • Git 基础:命令、分支与远程仓库管理
  • AI 产品经理核心能力:技术模型与三大知识体系
  • FPGA 实现 MIPI 协议全解析与完整时序规范
  • Linux 文件系统详解:从硬件结构到 inode 机制
  • 前端函数防抖详解:原理、手写与 Lodash 实战
  • Python 深度学习:ResNext 网络核心原理与分组卷积解析
  • AR 滤镜触发机制:基于特定图案识别激活特效
  • 大语言模型提示词工程(Prompt)基础与实践
  • GitHub 汉化插件安装与配置指南
  • Spring AI 引入 Agent Skills:模块化智能体能力新范式
  • Stable Diffusion XL 1.0 部署实战:构建云端 AI 绘画服务
  • Dify 工作流发布为 MCP Server 实战指南

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online