跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

RAGChecker:亚马逊开源的 RAG 系统细粒度评估框架

亚马逊开源的RAGChecker框架通过声明级细粒度评估,为RAG系统提供检索器与生成器的全面诊断指标。元评估显示其与人类判断高度相关。在10个领域、8种系统上的实验揭示了检索器质量、模型规模、上下文利用率与噪声敏感性之间的权衡,为优化RAG流水线提供了可操作的见解。

ApiHolic发布于 2026/6/30更新于 2026/8/1718 浏览
RAGChecker:亚马逊开源的 RAG 系统细粒度评估框架

尽管检索增强生成(RAG)模型在很多场景下表现不错,但回答不准依然是个头疼的问题。怎么诊断到底是检索没找对文档,还是生成模型在编造?亚马逊最近开源了一个工具 RAGChecker,专门用来把 RAG 系统的表现拆开来检查,帮 CTO 和开发者快速定位问题。

目前市面上已经有不少 RAG 评估框架,比如 TruLens、RAGAS、ARES 等,它们大多围绕'答案相关性''忠实度'这类端到端指标。但要么依赖人工评估,成本高又难扩展,要么只在简单短答案上靠谱,碰上需要生成长回答的复杂场景就抓瞎了。下面这张表总结了一些代表性工作:

评估方向框架描述
生成器基本能力RGB手动构造测试集,评估噪声鲁棒性、负拒绝、信息整合等
生成器基本能力RECALL引入反事实上下文,测试 LLMs 的反事实鲁棒性
生成器基本能力NoMIRACL用人工标注判断 LLM 对检索错误的鲁棒性
生成器基本能力2024.10198量化 LLMs 的忠实度与内部先验的平衡
生成器基本能力FAAF细粒度事实验证,评估真实性
端到端评估TruLens提出 RAG 三元组(上下文相关性、基础性、答案相关性)
端到端评估RAGAS / ARES沿用三元组概念,在不同数据集上优化分数预测
端到端评估CRUD-RAG针对 CRUD 操作设计的特定数据集和评估标准
其他端到端EMNLP 2023人类评估流畅性、感知效用、可验证性
其他端到端MEDRAG医学 RAG 基准,用 QA 准确性评估
其他端到端MultiHop-RAG多跳查询,评估 QA 准确性
其他端到端CDQA动态生成问题,要求最新信息

RAGChecker 指标示意图

RAGChecker 的做法不太一样:它在声明(Claim)级别做细粒度比对。具体来说,先把模型回答和标准答案拆成一条条原子化的声明,再逐条检查这些声明是否被检索到的上下文支持。这样就能算出检索器和生成器各自的毛病。

RAGChecker 指标示意图

它输出一套诊断指标:

  • 整体看:精度(回答里正确的声明比例)、召回率(标准答案里被正确覆盖的声明比例)、F1。
  • 针对检索器:声明召回率(标准答案中的声明在检索块里出现的比例)和上下文精度(检索块里含有标准答案声明的比例)。
  • 针生成器:忠实度(生成声明与上下文一致的比例)、(在相关块里生成错误声明的比例)、(在无关块里犯错的比例)、(完全不在任何检索块里的声明)、(靠模型自己知识答对的比例)、(生成器实际用到的标准答案声明占检索块中所有相关声明的比例)。
相关噪声敏感性
无关噪声敏感性
幻觉
自我知识
上下文利用率

有了这些,我们就能知道问题是出在检索没召回足够信息,还是生成器拿了正确信息却没用对,或者纯粹在胡说。

为了验证这套指标,研究团队在 10 个领域(Wikipedia、AI Science、Novel、Biomedical、Finance 等)的 4162 条查询上测试了 8 种 RAG 系统,这些系统由两种检索器(BM25 和 E5-Mistral)与四种生成器(GPT-4、Mixtral-8x7B、Llama3-8B、Llama3-70B)组合而成。同时他们还做了一轮元评估,把 RAGChecker 的判断与人类偏好对比,发现它的相关性比其他工具高出一截——正确性相关度 49.66、完整性 60.67、整体 61.93。

RAGChecker 相关性结果

实验跑下来有几个有意思的发现:

  • 检索器很关键:E5-Mistral + GPT-4 的组合几乎在所有指标上都最好,高质量的检索上下文能明显抑制幻觉。
  • 大模型确实更强:同是 Llama3,70B 全面优于 8B,尤其在上下文利用率和减少噪声敏感性上。
  • 上下文利用率与整体 F1 强相关,而且这个指标在不同检索器间表现稳定,所以是一个可靠的优化目标。
  • 但检索召回率越高,生成器反而对所有噪声更敏感——这意味着过高的召回会把更多干扰文档带进来,从而降低生成质量。得在召回和精度之间找平衡。
  • 开源模型(如 Mixtral、Llama3)在区分准确信息和噪声上不如 GPT-4,GPT-4 虽然上下文利用率高,但也更倾向于盲目相信上下文中所有内容。

RAGChecker 系统表现

顺便说一下,RAGChecker 内部的事实检查流程其实不复杂:它先用一个 LLM 把文本拆成一堆 Claim,再用另一个 checker 判断每个 Claim 是否被参考文本支持(entailment / contradiction / neutral),最后统一计算出上述指标。这种细粒度方式的好处是,你不仅能知道回答好不好,还能知道哪里没答全、哪里答错了是因为检索没跟上还是生成时跑偏了。

如果你正在调优 RAG 流水线,不妨试试用 RAGChecker 先看一遍各项指标,往往能节省不少盲猜的时间。特别是当用户抱怨回答不可信时,用幻觉和忠实度一查,通常就能定位到是检索库需要优化,还是对 Prompt 做针对性调整。

  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • Mac 本地部署 OpenClaw-CN 指南
  • VS Code+GitHub Copilot避坑指南:从安装配置到最佳实践的完整手册
  • AI 算法工程师的职业困境与向开发转型的路径分析
  • 基于 LangChain 实现数据库问答机器人
  • 在 Cursor 中配置和使用 MCP 服务实现自动化任务
  • Python 作用域与命名空间:全局/局部变量及 LEGB 规则解析
  • OpenClaw 跨平台安装指南:Windows 与 Ubuntu
  • Java 大数据在智能家居设备联动与场景化节能中的应用
  • DeepSeek-R1 大模型基于 MS-Swift 框架部署推理与微调实践
  • Ubuntu 系统部署 FastDFS 分布式文件系统指南
  • Visual Studio Code 核心特性与实战体验
  • Vue 踩坑:el-checkbox-group 编辑页状态同步失效修复
  • 开源 YouTube 替代方案 Invidious 部署与使用指南
  • Ubuntu 系统分区详解与最佳分配策略
  • 无人机经典教材 MAVSim 仿真资源与代码实践
  • MoltBot 对接钉钉 Stream 流式接入配置详解
  • DFS 算法实战:水流问题、扫雷与衣橱整理
  • Verilog 语法详解:从入门到精通
  • Electron 前端开发快速入门教程:从零搭建到打包部署
  • Obsidian+Claude Code打造本地AI知识库

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online