顶级大模型普遍经过知识蒸馏：研究揭示量化方法与影响

综述由AI生成中国科学院深圳先进技术研究院等机构的研究指出，除 Claude、豆包和 Gemini 外，多数知名闭源及开源大语言模型（如 Llama 3.1、Qwen-Max）存在高度知识蒸馏现象。研究通过响应相似度评估（RSE）和身份一致性评估（ICE）量化了蒸馏程度，发现过度蒸馏会导致模型同质化并损害处理复杂任务的能力。实验显示闭源模型及基础模型往往表现出更高程度的蒸馏痕迹，揭示了当前大模型训练生态中数据依赖的透明度问题。

GitMaster发布于 2025/2/6更新于 2026/6/223 浏览

顶级大模型普遍经过知识蒸馏：研究揭示量化方法与影响

除了 Claude、豆包和 Gemini 之外，知名的闭源和开源 LLM 通常表现出很高的蒸馏度。这是中国科学院深圳先进技术研究院、北大、零一万物等机构的研究者在一篇新论文中得出的结论。

背景与猜想

前段时间，一位海外技术分析师在一篇博客中提出了一个猜想：一些顶级的 AI 科技公司可能已经构建出了非常智能的模型，比如 OpenAI 可能构建出了 GPT-5，Claude 构建出了 Opus 3.5。但由于运营成本太高等原因，他们将其应用在了内部，通过蒸馏等方法来改进小模型的能力，然后依靠这些小模型来盈利。

当然，这只是他的个人猜测。不过，从新论文的结论来看，「蒸馏」在顶级模型中的应用范围确实比我们想象中要广。

具体来说，研究者测试了 Claude、豆包、Gemini、llama 3.1、Phi 4、DPSK-V3、Qwen-Max、GLM4-Plus 等多个模型，发现这些模型大多存在很高程度的蒸馏（Claude、豆包和 Gemini 除外）。比较明显的证据是：很多模型会在声明自己身份等问题时出现矛盾，比如 llama 3.1 会说自己是 OpenAI 开发的，Qwen-Max 说自己由 Anthropic 创造。

研究示意图

蒸馏固然是一种提升模型能力的有效方法，但作者也指出，过度蒸馏会导致模型同质化，减少模型之间的多样性，并损害它们稳健处理复杂或新颖任务的能力。所以他们希望通过自己提出的方法系统地量化蒸馏过程及其影响，从而提供一个系统性方法来提高 LLM 数据蒸馏的透明度。

实验结果概览