llama.cpp 性能基准库 llama-bench 参数调优与多场景测试
llama.cpp 性能基准库 llama-bench 参数调优与多场景测试 你是否还在为本地部署大语言模型(LLM)时的性能瓶颈发愁?同样的硬件配置,为何有人能跑 100 tokens/秒,而你却卡在 20 tokens/秒?将带你深度掌握 llama.cpp 官方性能测试工具——llama-bench,通过标准化测试流程和参数调优技巧,让你的模型性能提升…
博客作者
无法理解
362
已发布文章
9.7K
博客获赞
488K
博客浏览
第 4 页
llama.cpp 性能基准库 llama-bench 参数调优与多场景测试 你是否还在为本地部署大语言模型(LLM)时的性能瓶颈发愁?同样的硬件配置,为何有人能跑 100 tokens/秒,而你却卡在 20 tokens/秒?将带你深度掌握 llama.cpp 官方性能测试工具——llama-bench,通过标准化测试流程和参数调优技巧,让你的模型性能提升…
针对本地算力不足无法并行测试多个大模型的问题,提出基于云端 GPU 实例的解决方案。通过容器化技术在同一服务器部署 Youtu-LLM、Qwen-1.8B 及 Phi-3-mini 等多个轻量级模型,利用 vLLM 优化推理性能。构建统一测试任务模板,实现公平竞技下的写作风格、逻辑连贯性及创意表达横向对比。实测显示在 A10G 环境下可稳定运行三个 2B 级…

阐述了人工智能(AI)、机器学习(ML)与深度学习(DL)的概念区别及层级关系。AI 是模拟人类智能的总目标,ML 是实现 AI 的主流方法,DL 是 ML 中基于神经网络的子集。文章对比了传统规则驱动编程与模型驱动机器学习的差异,指出后者通过数据训练而非显式编码适应复杂场景。此外,还介绍了 AI 发展的三次浪潮、爆发基础(数据、算法、算力)以及样本、特征、…
HY-Motion 1.0 在健身指导、AR 试衣及元宇宙 NPC 驱动中的实际落地表现。文章通过实测对比不同硬件环境下的性能差异,提供显存与响应速度的平衡建议。同时梳理了提示词编写规范,避开生物禁区与交互陷阱,帮助开发者将动作生成技术融入业务流。重点在于工程化应用而非单纯参数堆砌,强调 Lite 版在特定场景的性价比。
Open WebUI 重排序功能通过二次评分优化检索结果。配置流程包括选择模型(如 jinaai/jina-colbert-v2)、修改配置文件启用混合检索、设置环境变量及验证生效。调优参数涉及 top_k、相关性阈值等。实施后能显著提升搜索结果相关性和用户满意度,减少响应时间波动。故障排查主要关注模型加载失败和排序效果不明显问题。该功能适用于需要精准知识库…
探讨了前端开发的技术趋势,对比了过时技术与现代最佳实践。重点介绍了 React 18 的并发模式(Concurrent Mode)及其在提升用户体验中的应用,阐述了 React Server Components 在减少客户端负载方面的优势。此外,还涉及了边缘计算(Edge Computing)在 Vercel 和 Cloudflare 上的实现,以及 AI…
微信小程序自定义 tabBar 的实现方案。针对原生 tabBar 样式受限、数量限制等问题,通过封装自定义组件实现底部导航栏。内容包括组件结构设计、动态页面切换、图标文字高亮管理、样式美化及中间凸起按钮扩展。文章提供了完整的项目结构、WXML/WXSS/JS 代码示例,并总结了常见问题与解决方案,帮助开发者灵活构建美观的底部导航。
IndexedDB 是浏览器内置的 NoSQL 数据库,支持存储大量结构化数据。介绍其核心概念(数据库、对象存储、索引、事务、游标),并提供联系人管理器的完整代码示例,涵盖初始化、增删改查及高级查询。内容还包含最佳实践、浏览器支持情况及第三方库推荐,适合构建离线 Web 应用。

介绍如何利用 Openclaw 框架结合字节 Seed2.0 技能包实现 AI 漫剧自动生成。流程涵盖剧本逻辑编排、主角形象设定、风格化视频生成及效果验收四个步骤。核心利用 doubao-seed-2.0-code 模型的多模态理解与 Agent 能力,通过 seedance-video、manga-drama 等技能完成从文本到视频的转化,并提供情感分析与…
介绍 ComfyUI 节点式工作流的核心优势,对比其与 WebUI 的黑箱操作差异,阐述从模型加载到图像解码的可视化流水线理念。内容涵盖环境准备及 Checkpoint Loader、CLIP Text Encode 等关键节点的配置方法,重点解析 SDXL 模型下 Base 与 Refiner 的协同流程,适合希望掌握 AI 绘画底层逻辑的进阶用户。

人形机器人双足踝关节的串联与并联构型差异,阐述了选择 2-RSS-1U 并联方案的理由。详细推导了运动学模型,包括逆运动学解析解、雅可比矩阵构建及正运动学的牛顿迭代法求解。最后提供了基于 Eigen 库的 C++ 逆运动学实现代码示例,用于电机角度计算。

分享了在 IntelliJ IDEA 中使用通义千问插件进行 Java 后端开发的实战经验。主要涵盖工具适配优势、解决 Maven 依赖冲突与配置难题、代码重构与文档生成效率提升,以及辅助开发 SSE 流式接口的全流程案例。插件在代码生成、智能问答及依赖排错方面表现优异,显著缩短开发周期。同时也指出了其在小众框架支持及离线本地化方面的局限,并提出了优化建议。

介绍通义万相 2.1 模型的核心功能,包括文生图、图生图及高分辨率生成能力。分析了其在艺术风格、细节强化及训练策略上的技术亮点。同时阐述了在高性能计算平台上部署该模型的基本流程,涵盖硬件配置、参数调节(如提示词、分辨率、扩散步数)及中英文 Prompt 效果对比。旨在帮助开发者理解模型特性并快速上手 AI 图像生成任务。
米家 API Python 库的使用方法。涵盖通过 PyPI 安装、二维码登录认证、设备属性读写及动作执行等核心功能。同时提供了命令行工具操作示例和常见问题解答,帮助开发者快速实现小米智能家居设备的自动化控制与场景管理。
记录了将 Whisper 大模型压缩至 1.46MB 并部署于 BES 2800 芯片耳机的全过程。通过结构裁剪(CTC-Only)、INT4 量化、知识蒸馏及汇编优化,实现体积压缩 26 倍,WER 4.8%,功耗 7.3mA,满足离线会议速记场景需求。
腾讯于 2025 年 9 月开源混元图像 3.0,采用 800 亿参数 MoE 架构,单次推理激活 130 亿参数。该模型在 LMArena 榜单超越 DALL-E 3 和 Midjourney v6,支持千字文本转译、工业级文字渲染及 8K 超高清生成。提供商用友好开源协议,含训练代码与部署文档,推荐配置为 3×80GB GPU,基于 Python 实现快…
介绍如何在 Android 设备上使用 Whisper 模型实现离线语音识别。文章分析了离线识别的优势,如隐私安全、无需网络及即时响应。提供了从获取代码、选择技术路线(Java 或 Native)、导入 Android Studio 到运行测试的完整步骤。此外还包含录音质量优化、转录效果提升技巧、多场景应用解析及常见问题解答,帮助开发者在本地完成高质量的语音…

FPGA 光通信中 Aurora 64B/66B 协议的使用。内容包括 IP 核架构、接口定义(数据、控制、复位)、初始化流程及配置方法。详细说明了双工模式下的复位时序、时钟关系以及 Framing 与 Streaming 接口的区别。通过仿真和上板测试验证了收发数据的正确性,适用于基于 Xilinx 核的高速串行通信开发。
对比了国内七款主流 AI 工具:豆包、元宝、千问、Kimi、DeepSeek、MiniMax 和 GLM。涵盖字节跳动、腾讯、阿里云、Moonshot AI 等厂商产品。文章从功能特点、适用场景、优劣势及使用建议维度进行分析。豆包适合快速问答与写作;元宝专注视频会议辅助;千问与 GLM 中文理解强;Kimi 擅长长文档处理;DeepSeek 代码能力突出;M…

介绍如何使用 OpenClaw 结合飞书构建 AI 机器人。主要步骤包括:安装 Node.js 环境及 OpenClaw 工具;配置大语言模型 API;在飞书开放平台创建企业自建应用并获取凭证;将飞书凭证配置至 OpenClaw;设置应用权限并发布;最后在飞书中授权配对完成连接。整个过程通过命令行操作,实现本地 AI 助手与飞书的集成。