
AI Agent 中的 Skills 概念及其作用
AI Agent 中的 Skills 是结构化的指令文件,充当操作手册指导 Agent 执行特定任务。其核心作用是将领域知识与操作步骤打包,确保任务执行流程标准化且输出质量可预期。通过定义不同 Skills,可使通用 Agent 获得垂直领域能力而无需重新训练模型,典型格式通常为 Markdown。
博客作者
AI智能
381
已发布文章
9.3K
博客获赞
741K
博客浏览
第 5 页

AI Agent 中的 Skills 是结构化的指令文件,充当操作手册指导 Agent 执行特定任务。其核心作用是将领域知识与操作步骤打包,确保任务执行流程标准化且输出质量可预期。通过定义不同 Skills,可使通用 Agent 获得垂直领域能力而无需重新训练模型,典型格式通常为 Markdown。
介绍 llama.cpp 在资源受限环境下的大模型推理内存优化策略。内容涵盖内存池架构设计、KV 缓存优化配置、分层内存布局及状态压缩技术。通过预分配与复用机制解决内存碎片化问题,支持 GPU、CPU 和磁盘的智能分层调度。文章提供了具体的命令行参数配置示例及企业级部署最佳实践,旨在帮助技术团队在现有硬件条件下显著提升推理性能并降低内存开销。

介绍 WebGL 中索引缓存(Index Buffer)的核心概念与应用。通过对比无索引与有索引的顶点存储方式,展示了如何利用索引数组实现顶点复用,从而减少显存占用并提升渲染性能。文章详细解析了 gl.createBuffer、bindBuffer、bufferData 等 API 的使用,重点讲解了 vertexAttribPointer 参数中 stri…

Cursor 2.0 版本更新推出了自研商用闭源大模型 Composer,宣称速度提升显著。新版本支持多代理编码,最多可同时选择 8 个模型。实测对比显示,Composer 在生成速度上优于 Claude Sonnet 4.5、GPT-5 CodeX 和 Gemini 2.5 Pro。在代码质量方面,Composer 与 Claude Sonnet 4.5…
web-print-pdf 是一个基于 Playwright 内核的 Node.js 跨平台 Web 打印解决方案。它解决了浏览器安全限制导致的 Web 应用无法直接控制打印硬件的问题。核心功能包括真正的静默打印、精确控制打印机和纸张尺寸、高质量矢量 PDF 生成与预览、批量打印队列管理以及远程打印支持。相比自研 Electron 方案,该工具包内存占用更低…

介绍 Web Animations API(WAAPI)的背景、原理及应用。WAAPI 作为原生 JavaScript API,通过直接交互渲染引擎提升性能,支持精确控制与简洁代码。文章涵盖页面过渡、交互及数据可视化场景,并提供代码示例,助力开发者打造流畅 Web 体验。

KingbaseES 通过行列混合存储与四级并行架构实现 HTAP 能力,支持事务与分析在同一集群运行。当前版本 V8R6 已具备基础 HTAP 功能,V9R2 规划引入自研向量引擎 kdb_vector 及 GPU 加速,以支撑 AI 场景。现有产品包括 TDC 事务型、Sharding 高扩展型及 ADC 分析型分布式集群。优势在于多语法兼容与政企适配成…
雷达信号处理中的恒虚警率(CFAR)技术,这是一种自适应阈值目标检测方法,能在变化的噪声背景下保持恒定虚警概率。内容涵盖 CFAR 的基本原理(滑动窗口、单元划分、门限计算)、四种常见算法(CA、GO、SO、OS)及其适用场景对比。此外,提供了基于 MATLAB 的 CA-CFAR 一维距离向数据检测代码示例,详细展示了从数据模拟、参数设置、检测循环到结果可…
介绍使用 Arduino 和 SG90 舵机实现机器人面部表情模拟的技术方案。内容包括舵机 PWM 控制原理、Servo 库代码示例、平滑过渡算法实现、多舵机独立供电解决方案及机械传动设计。项目成本低、门槛低,支持表情切换与扩展,适合嵌入式入门及情感化机器人开发。
实测 Qwen-Image-2512 文生图模型在多主体交互场景下的表现,重点测试了猫弹吉他场景中手指按弦的动作逻辑。结果显示模型在空间关系理解、动作逻辑把握及中文提示词理解方面表现优异,极速模式 10 步生成即可达到高质量。建议通过明确主体关系、指定动作细节和优化提示词来提升复杂场景生成效果。
介绍基于 SenseVoice-Small 模型的语音识别系统开发流程。内容包括环境准备、ModelScope 模型加载测试、Gradio 前端界面深度定制(布局优化、自定义样式)、功能扩展(批量处理、RESTful API、实时音频流处理)以及性能优化与容器化部署建议。旨在帮助开发者构建功能丰富且用户体验良好的语音识别应用。
Z-Image-Turbo 是一款面向新手的 AI 绘画工具,支持中文提示词直接输入。文章介绍了三步启动服务的方法,无需复杂配置即可运行。核心内容包括提示词编写结构、关键参数调整策略(如 CFG Scale 和采样步数)以及常见避坑指南。通过具体案例演示了水墨风格图像的生成流程,并提供了 API 接入示例,帮助用户快速掌握文生图技术并应用于实际工作流。

llama.cpp 迎来重大更新,新增内置 Web UI。相比 Ollama,其安装部署更灵活,推理速度更快(测试中达 97t/s)。支持 PDF、图片、数学公式渲染及多对话管理,可通过 pake 打包为 App。优势在于开源免费、隐私安全;劣势在于国内下载 HF 模型不便,暂不支持网络搜索和 MCP。适合追求高性能和本地化部署的用户。
在服务器下载 llama.cpp Docker 镜像时遇到的速度慢问题,并提供了解决方案。通过将官方镜像源 ghcr.io 替换为国内镜像源 ghcr.nju.edu.cn,可以显著提升下载速度,节省等待时间。
在国产麒麟系统上部署 OpenAI Whisper 语音识别模型的完整流程。主要步骤包括:确认并升级 Python 3.8+ 环境,安装编译依赖及 ffmpeg,配置 pip 源并安装 torch 与 openai-whisper 库,最后通过 Python http.server 构建一个简单的语音识别服务接口。方案支持 x86_64 架构,建议使用虚拟环…

介绍智能体工作流的导出与导入功能,解决政务场景中开发环境割裂、协作效率低的问题。通过 12345 热线分拨助手案例,演示从零代码搭建流程到一键复用模板的全过程。涵盖节点配置、提示词编写、变量绑定及测试调优。重点讲解如何避免变量解析错误和路径依赖问题,实现'一地创新、多地复用'。适用于信访分类、企业诉求派单等政务 AI 场景,强调配置即资产的理念。

浏览器桌面通知功能的实现。通过 Notification API 申请权限并发送通知,支持本地开发(localhost)及 HTTPS 环境。内容包含权限状态管理、拒绝后引导跳转设置页、以及发送通知的代码示例与常见问题排查,帮助开发者快速集成 Web 消息提醒功能。

解析了 IDE 中 AI 大模型 Session 的真实含义,指出其不仅是聊天历史,更是包含代码上下文与 Agent 状态的认知空间。文章分析了在同一 Session 处理多任务导致的目标稀释、意图混叠及 Token 成本上涨等问题,并提出了将 Session 对应为明确认知阶段的实践建议。通过合理划分 Session 生命周期,开发者可有效管理 AI 注意…

在 Rokid 智能眼镜上开发 AI 天气应用的技术方案。主要实现了三个核心功能:一是通过 GPS 和高德逆地理编码实现自动定位,支持'这里天气'等指令;二是构建多轮对话上下文工程,处理续播意图如'那边呢';三是接入 Claude API 进行 AI 旅游规划,根据天气生成个性化建议。文中提供了完整的 Kotlin 代码示例,包括 LocationHelpe…
提供了一份详细的 2026 年 AI 学习路线图,涵盖从入门到精通的四个阶段。第一阶段夯实数学与编程基础;第二阶段掌握深度学习、NLP 及强化学习核心算法;第三阶段聚焦 MLOps、模型部署与工程化能力;第四阶段深耕产业实践、前沿技术及项目管理。内容包含每月详细任务清单,旨在帮助学习者系统构建 AI 技术体系并实现落地应用。