随着人工智能和大型模型技术的迅猛发展,检索增强生成(Retrieval-Augmented Generation, RAG)已成为大型语言模型生成文本的一种主要范式。这种技术的代表——检索增强的大型语言模型(Retrieval-Augmented Large Language Model, RALM)——能够直接利用检索得到的文档信息进行内容生成,无需进行额外的训练,这一优势使其在工业界得到了广泛应用,例如 New Bing 搜索引擎。
然而,自 2023 年起,RALM 在处理知识冲突方面面临的问题逐渐成为研究的焦点。知识冲突不仅严重影响了模型在知识密集型任务上的性能,也暴露了其在面对错误信息时的脆弱性,进而对模型的安全性构成威胁,尤其是在那些对事实准确性有着严格要求的应用场景中。知识冲突主要表现在模型内部的参数化知识与外部上下文信息之间,以及外部上下文信息内部的不一致性。此外,研究者还观察到模型内部参数化知识之间存在冲突,即出现自相矛盾的现象,这可能源于模型在预训练阶段学习到了相互矛盾的信息。
我们来看一个具体的例子:

在上面这个例子中,大模型接受了一个事实性问题:哪只队伍在世界杯中获得了最多次的冠军?对于这个问题,一个 RALM 可能会检索网络上、向量数据库内的文档,同时加上用户之前的提示语组成的历史对话记录,共同形成了上下文知识(Contextual Knowledge, Context,在上图用黄色予以标出);与此同时,大模型在预训练中也看到了关于解答这个问题的信息,这些信息构成了其参数化知识,又称模型的'记忆'(Parametric Knowledge, Memory,在上图用蓝色标出)。根据冲突两方信息的来源,我们便可'两两(可重)组合'划分为以下三个类别:
- Context-Memory Conflict 即上下文和参数知识之间的冲突。例子 1:模型通过 Web 检索获取的知识是即时的,但学到的知识已经'过气';例子 2:模型获得了错误的假信息,与参数知识发生了冲突。
- Inter-Context Conflict 即上下文知识内部的冲突。例子:通过 Web 检索,获得的信息因为发布的时间不同,或是混入了恶意的有误信息而自相冲突。
- Intra-Memory Conflict 即参数化知识内部的冲突。例子:对于事实性问答,模型在语义相同的提示一下被激发出不同结果的答案,产生出自相矛盾的效果。
知识冲突最早的文献可以追溯到 Longpre 等人在 EMNLP 2021 的文章:Entity-based knowledge conflicts in question answering。这篇文章通过命名实体替换的方法在开放域问答(Open-Domain Question Answering)构造了冲突的知识,并对当时的语言模型进行了评测。随着 2023 年大型语言模型的兴起和 RAG 范式在工业界广泛应用,知识冲突的研究热度逐渐升高,因其很大程度上降低了模型在关键任务上的表现,特别是对真实性有要求的任务。
近期,来自清华大学、剑桥大学、西湖大学、香港中文大学的研究者联合发布了一篇综述,从起因、表现以及解决方案三个方面,对三种不同的知识冲突类型进行详细探讨,帮助读者更好地理解和应对这一挑战。在我们看来,知识冲突既是导致各种模型下游表现的原因,也是从知识自身和模型知识学习中天然复杂性中呈现出的效果。
这篇综述:
首次系统性地总结了知识冲突领域的研究工作;
全面分析了三种大模型可能遭遇的冲突类型,特别是对参数化知识冲突进行讨论;
我们不仅探讨了每种冲突的分析,还从其'生命周期'的视角出发,审视了冲突的起因、表现以及可能的解决策略。
探索 Context-memory conflict:起因、表现与解决方案
起因
Context-Memory Conflict 的核心在于上下文信息与参数化知识之间的差异。这种冲突的起因主要分为两个方面:时间错位(Temporal Misalignment)和信息污染(Misinformation Pollution)。
- 时间错位(Temporal Misalignment)
时间错位是指模型在训练过程中使用的历史数据无法准确反映当前或未来的现实。这种现象在大语言模型中尤为明显,因为这些模型通常在大量静态数据上进行预训练,而这些数据可能在现实中已经过时。例如,一篇关于 2020 年奥运会的文章在 2024 年可能已经不再准确,然而,模型可能依然依赖这些过时的信息进行预测和回答问题。研究表明,语言模型的性能会随着时间的推移而下降,语言的使用方式、文化变化以及知识更新等都会影响模型对当前信息的处理能力。
- 信息污染(Misinformation Pollution)
信息污染是指外部信息中夹杂着错误或误导性的信息,这些不准确的数据会影响模型的判断和决策能力。这种情况在互联网时代尤为普遍,网络上充斥着各种虚假信息、谣言以及故意编造的假新闻。恶意用户可能通过在网络上发布虚假信息,干扰模型的判断。例如,恶意攻击者可以在社交媒体上发布虚假的医疗信息,从而误导依赖这些信息进行判断的模型。信息污染不仅会影响模型的准确性,还会破坏用户对模型的信任。研究表明恶意的虚假信息会显著削弱自动化事实核查系统和开放域问答系统的准确性。


