【论文笔记】Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval

优质文章学习记录

11 Apr 2026 — 5 min read

论文信息

论文标题： Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval - ICML 2025
论文作者： Taiye Chen , Zeming Wei , Ang Li , Yisen Wang - PKU
论文链接：http://arxiv.org/abs/2505.15753
关键词： LLM Safety, Jailbreaking, RAG

研究背景

尽管大语言模型（LLMs）经过了人类反馈强化学习（RLHF）等安全对齐技术处理，但仍易受到“越狱攻击”（Jailbreaking Attacks）的威胁，即通过精心设计的提示词诱导模型产生有害输出。存在以下痛点：

静态防御的局限性： 现有的过滤（Pre-processing）或提示词（Prompt-based）防御方案多为静态，难以应对“野外”（in-the-wild）不断演进的新型攻击（如密文攻击、心理诱导模板等）。
微调成本与遗忘： 现有的动态防御需频繁微调模型，成本高昂且可能导致“灾难性遗忘” 。

作者提出利用 检索增强生成（RAG） 的思路，通过动态检索针对性的“安全上下文”来增强模型的即时鲁棒性。

初步分析

在正式提出模型前，作者进行了两项关键预研：

样本需求量： 实验发现，仅需极少数（如 4 个）针对特定攻击模式的安全对齐样本，即可将 ASR（攻击成功率）显著降低至 10% 以下
检索准确性： 利用 RAG 机制从数万条数据的知识库中检索，即便只加入 8-16 条针对新型攻击的样本，其检索准确率也能迅速趋于 100% 。
结论： 检索少量相关的安全示例是应对未知攻击的一种高效且低成本的路径。

SCR 防御框架

SCR 框架分为两个主要阶段：

初始化安全库（Initialization）： 使用通用的有害请求及对应的安全拒绝回复（由 Oracle 安全模型生成）构建初始内存库 M M M 。
动态防御循环：
- 识别与更新（Identify & Defend）： 当检测到新型“野外”攻击 a i a_i ai 时，仅需自动生成数十个针对该攻击模式的安全样本并加入库中，无需微调模型。
- 推理防御（Inference）： 对于用户的任何输入查询 q q q，系统首先从库中检索出 K K K个最相关的安全上下文，将其作为提示词的一部分喂给模型。如果是正常查询，检索结果不会干扰模型性能;如果是攻击查询，检索到的针对性拒答示例将引导模型拒绝回答。

实验结果分析

论文在 Llama-3.1、Qwen2.5 和 Mistral 三个主流模型上进行了评估：

常规攻击防御： 在对抗 GCG-T（优化攻击）和 ICA（上下文攻击）时，SCR 将平均 ASR 从 34.9% 降至 2.5% 左右，显著优于 Self-reminder 和 ICD 。
“野外”攻击防御： 在面对 Skeleton Key 和 Renellm 等新型攻击时，SCR 展现了极强的可扩展性，ASR 降幅巨大（例如在某些模型上从 50% 以上降至接近 0%）。
无损性能（Harmlessness）： 在 HumanEval、GSM8K 和 MMLU 等通用任务测试中，引入 SCR 后的模型性能几乎没有波动，证明该防御机制不会损害模型的固有能力。
开销评估： 增加 4-shot 检索仅带来约 13.3 秒的额外推理延迟和可接受的 GPU 显存增长（主要来自检索模型），在安全与效率间取得了较好平衡。

总结

核心贡献： SCR 提供了一种模型无关（Model-agnostic）且即插即用的防御新范式。它避免了频繁微调的昂贵成本，通过“以例示警”的方式，让 LLM 在推理阶段能实时识别并抵御未知的越狱手段。

优势：

可扩展性（Scalability）： 防御能力随记忆库扩充线性增长。
模型无关（Model-agnostic）： 一个检索模块可同时保护多个不同的 LLM 实例。
即时补丁： 发现新攻击后，分钟级即可完成入库更新。

局限性：

防御效果高度依赖于安全示例库的质量和覆盖面。
对于高度复杂或模糊的输入，检索机制可能无法精确匹配最佳安全上下文。
引入检索模型会增加一定的计算开销，在高并发场景下需进一步优化。
论文假设“识别新攻击”是已发生的，但在现实中需要自动化手段检测概念漂移。
防御效果高度依赖检索模型 g g g的质量，若攻击者构造“检索规避”样本，系统可能失效。

【AIGC行业前沿】2026年2月AIGC行业模型发布以及主要前沿资讯

目录 1. 阿里Qoder发布Qwen-Coder-Qoder 2. Kimi与南大发布SimpleSeg赋能模型像素感知 3. 字节研究团队发布ConceptMoE提升AI推理 4. 阶跃星辰发布并开源模型Step 3.5 Flash 5. 智谱发布并开源OCR模型GLM-OCR 6. xAI正式发布Grok Imagine 1.0视频模型 7. 优必选开源具身智能大模型Thinker 8. 通义千问发布开源编程模型Qwen3-Coder-Next 9. OpenAI宣布GPT-5.2系列模型提速40% 10. OpenBMB发布多模态模型MiniCPM-o 4.5 11. ACE Studio与StepFun联合发布开源音乐模型ACE-Step 1.5 12. Ai2发布轻量级开源编码模型SERA-14B 13. 上海AI实验室推出万亿参数多模态科学推理模型Intern-S1-Pro 14. Mistral AI开源40亿参数实时语音模型Voxtral Mini 4B Realtime 2602 15. 快手可灵发布可灵3.0 1

Whisper-turbo保姆级教程：小白必看，云端免配置体验

Whisper-turbo保姆级教程：小白必看，云端免配置体验你是不是也遇到过这样的情况？孩子每天上网课，老师讲得快、内容多，你想帮孩子整理重点，但一听就是一两个小时的录音，手动记笔记根本跟不上节奏。更头疼的是，孩子自己也不愿意回听，知识点就这么悄悄溜走了。别急——现在有个“AI小助手”能帮你把网课录音自动转成文字，还能标出时间点、提取关键内容，就像有个贴心的家教在帮你做课堂笔记！而且，不需要你会编程，也不用买新电脑，哪怕你对“Python”“显卡”这些词一听就头大，也能轻松上手。这个神器就是 Whisper-turbo，它是目前最火的语音识别AI之一，由OpenAI开发，支持中文，准确率高，速度快，特别适合处理日常语音场景，比如网课、会议、讲座等。最关键的是，我们可以通过云端镜像一键部署，完全不用自己装软件、配环境，真正实现“打开就能用”。这篇文章就是为你量身打造的——一位对技术零基础的家庭主妇，也能从0开始，5分钟内启动Whisper-turbo，上传孩子的网课录音，

知网AIGC检测怎么过？2026最新降AI率全流程攻略

知网AIGC检测怎么过？2026最新降AI率全流程攻略今年答辩季最让人头疼的事，不是论文写不出来，而是写出来过不了AIGC检测。尤其是知网。 2026年知网的AIGC检测系统又升级了，身边好几个同学的论文，之前在其他平台检测AI率只有10%出头，结果到知网一测直接飙到40%以上。搞得整个宿舍楼都弥漫着一股焦虑的气息。我自己也经历了这个过程，最后顺利过了检测。今天把整个流程整理出来，从理解检测原理到实际操作步骤，争取让你看完就知道该怎么做。先搞懂：知网AIGC检测到底在查什么很多人一听"AI检测"就慌，但其实搞明白它的检测逻辑之后，你会发现它并没有那么神秘。知网的AIGC检测大致是从这几个维度来判断的：语言模型的困惑度。简单说就是，一段文字如果太"通顺"了，AI检测系统反而会觉得可疑。因为AI生成的文字有一个特点——它总是选择概率最高的下一个词。这就导致AI写的内容在语言模型看来"毫不意外"，困惑度很低。而人写的东西偶尔会蹦出一些意想不到的表达，困惑度相对高一些。文本的统计特征。包括词汇丰富度、句子长度分布、段落结构等。AI生成的文字在这些统计指标

VLM Unlearning 有关论文阅读总结与梳理

文章目录目录前言一、什么是 Unlearning 二、AUVIC 三、Neuron Pruning 四、 Neuron Path Editing 五、 MLLM Eraser 前言本文整理了当前多模态大模型（VLM）中常见的 Unlearning 技术路线，主要包括： * AUVIC * Neuron Pruning * Neuron Path Editing * MLLM Eraser 这些方法的核心目标都是：让模型“遗忘”指定知识，同时尽量不影响其它知识。一、什么是 Unlearning 在多模态大模型（Vision-Language Model / VLA）中，我们经常需要： * 删除隐私数据 * 移除不安全知识 * 删除特定人物或敏感概念