跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

RAG 系统知识投毒攻击研究:One Shot Dominance 论文解读

一种名为 AuthChain 的单文档知识投毒攻击方案,旨在优化现有的 PoisonedRAG 攻击。该方法通过意图提取、证据链构建(CoE)和权威机构认证生成三个步骤,构造高检索度和逻辑闭环的恶意文档。实验在 NQ、MS-MARCO 和 HotpotQA 数据集上进行,对比了多种大模型和防御框架。结果显示 AuthChain 能有效操纵 RAG 系统输出,甚至在对抗内部知识偏见时表现优异。

MongoKing发布于 2026/4/6更新于 2026/7/2562 浏览
RAG 系统知识投毒攻击研究:One Shot Dominance 论文解读

One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systems

背景

以 PoisonedRAG 为代表的知识投毒攻击通常需要注入多个有毒文档,导致隐蔽性差,且仅在简单查询上有效。本文提出 AuthChain 攻击方案,旨在通过单条恶意文本达到多文本的诱导效果。

现有方案构造有毒文本时,易与其他 top-k 文档造成知识冲突,且 LLM 内部知识可能否决恶意诱导。AuthChain 通过增强生成模型对有毒文本的置信度,确保逻辑闭环并与目标问题主题契合。

AuthChain 方法

1. 基于意图的内容生成

目的:在检索过程中最大化文档的可见性。

  • 特征提取:
    • 意图:提取为名词或名词短语,代表问题的最终目标,确保生成的内容直接解决 LLM 在检索和推理过程中的优先事项。
    • 证据链:由证据节点及其关系组成,捕获问题的逻辑结构。证据节点是关键实体,证据关系表示节点间的逻辑连接。
  • 生成策略:代理被指示生成的内容不仅提供目标答案,还明确将问题意图纳入文本中,强调答案生成和意图整合,有助于实现更高的检索排名。

2. 证据链内容生成 (CoE)

为了保持高可检索性并优于其他外部知识源,AuthChain 构建了独立的证据链,保留所有问题元素及其逻辑联系。

  • 迭代细化过程:
    1. 基于意图的内容和提取的证据链输入到 CoE 法官代理。
    2. 评估内容是否完全包含所有证据节点及其关系。
    3. 若未覆盖,法官代理提供合并缺失元素的具体建议。
    4. 修订代理根据建议进行细化,直到确认证据链完整保存。

3. 权威内容生成

假设权威机构认可的内容加上最近的时间线陈述,可以有效将 LLM 注意力转向外部信息,减少对其内部知识的依赖。

  • 生成流程:
    1. 权威生成器代理分析基于意图的内容上下文,确定最合适的权威机构进行背书。
    2. 将机构支持与最近的时间线信息综合起来验证目标答案。
    3. 最终产生权威内容。
  • 整合:AuthChain 将 CoE 内容与权威内容整合,形成最终的中毒文档并注入知识库。

实验

数据集与配置

  • 数据集:NQ, MS-MARCO, HotpotQA
  • 检索器:Contriever (检索 top5 结果)
  • 大模型:gpt3.5, gpt4, gpt4o, llama3-8b, llama3-70b, deepseek-v3-0324
  • 攻击基线:PoisonedRAG, HijackRAG
  • 配置:使用 gpt4 作为意图代理、CoE 判断代理、审阅代理和权威内容代理的主干,温度设置 0.1

探究问题

  • RQ1:AuthChain 生成的单个中毒文档在操纵各种 LLM 的输出方面有多有效?
  • RQ2:AuthChain 在基于 RAG 的防御框架下逃避检测的效果如何?
  • RQ3:权威内容能否克服 LLM 的内部知识偏见,同时 CoE 与冲突文件进行有效竞争?

实验设计

  1. 单文档投毒攻击 (RQ1):每种方法针对每个目标问题构建并注入一个中毒文档。评估操纵 RAG 系统输出的有效性。
  • 防御框架评估 (RQ2):选择 InstructRAG 和 AstuteRAG 两个代表性防御框架。将所有攻击限制为只注入一个中毒文档,与干净设置比较。
  • 内部知识偏见与 CoE 竞争 (RQ3):
    • 权威设置:从 HotpotQA 抽取 600 个问答对,筛选出 GPT-3.5 能正确回答的问题(具备内部知识)。创建被污染文档,逐步引入包含正确答案的真实文档,测试不同正确文档比例 (CDP) 下的攻击有效性。
    • CoE 设置:识别包含正确答案证据但缺乏结构化证据链的支撑文档。使用 AuthChain 转换为 CoE 结构化文档。引入 GPT-4 生成的被污染文档,测试不同被污染文档比例 (PDP) 下的准确率。
  • 评估指标

    • 攻击成功率 (ASR):LLM 输出包含被污染目标文档答案的问题的比例。
    • 检索成功率 (RSR):在排名前 5 的文档中成功检索到的被污染目标文档的比例。
    • 困惑度 (PPL):衡量文本流畅度,值越高表示文本越不自然。
    • 准确率 (ACC):LLM 响应包含正确答案的问题的比例。

    结论

    AuthChain 通过提示词工程优化文本,保证了相似度与逻辑闭环。实验表明,单条精心构造的中毒文档能有效影响 RAG 系统的决策,甚至在对抗防御框架和内部知识偏见时表现出较强的鲁棒性。

    目录

    1. One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systems
    2. 背景
    3. AuthChain 方法
    4. 1. 基于意图的内容生成
    5. 2. 证据链内容生成 (CoE)
    6. 3. 权威内容生成
    7. 实验
    8. 数据集与配置
    9. 探究问题
    10. 实验设计
    11. 评估指标
    12. 结论
    • 免费图片AI生成工具免费生成了解详情
    • Magick API 一键接入全球大模型注册送1000万token查看
    • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
    • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
    • 100+免费在线小游戏爽一把
    极客日志微信公众号二维码

    微信扫一扫,关注极客日志

    微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

    更多推荐文章

    查看全部
    • 语言学习通用心法:享受过程、持续输入与词汇积累
    • 低成本运行 Claude Code:通过 LiteLLM 接入 GitHub Copilot Chat API
    • 智能梯控系统设计方案:跨品牌群控与 AI 调度架构解析
    • GESP C++ 一级真题解析:手机电量显示
    • Angular入门启蒙03,Angular 环境搭建全解析:Node.js、npm 与 Angular CLI 安装配置
    • C++ multiset 核心原理与实战指南
    • 绿联 NAS 配置 WebDAV 公网访问及 RaiDrive 挂载指南
    • Windows 本地部署 ComfyUI 运行 Qwen-Image 大模型详细步骤
    • Qwen3.5 开源详解:0.8B 至 397B 模型代际升级与选型指南
    • STM32 中__weak 弱定义函数核心总结
    • 第十五届蓝桥杯 Python B 组省赛真题解析
    • 磨损均衡算法介绍
    • OpenAI Whisper 语音识别与转录使用指南
    • VS Code 中 GitHub Copilot 安装配置与高阶使用指南
    • 自然科学领域机器学习与深度学习:从数据预处理到时空建模
    • 蓝桥杯 2025 省赛 Python B 组题目解析
    • WebP 图像格式:原理、特性与实战应用
    • Win10 升级后自动弹出 Copilot 窗口?彻底禁用与关闭指南
    • 微信小程序 WebView 与 H5 页面双向通信实战指南
    • VSCode Copilot 认证失败排查与修复指南

    相关免费在线工具

    • 加密/解密文本

      使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

    • RSA密钥对生成器

      生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

    • Mermaid 预览与可视化编辑

      基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

    • 随机西班牙地址生成器

      随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

    • Gemini 图片去水印

      基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

    • Base64 字符串编码/解码

      将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online