跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

FuseLLM:基于知识融合的大模型集成方法

FuseLLM 提出了一种针对大语言模型的知识融合方法,旨在降低多模型集成的初始化成本。该方法通过因果语言建模(CLM)将不同源模型的概率分布矩阵进行对齐与融合,利用最小编辑距离(MinED)策略解决分词器不一致导致的 Token 对齐问题,并采用 MinCE 或 AvgCE 策略整合知识。实验表明,该方式能有效提取多个模型的优势,提升目标模型性能,适用于大模型比赛及实际部署场景。

不羁发布于 2025/2/7更新于 2026/9/1055 浏览
FuseLLM:基于知识融合的大模型集成方法

FuseLLM:基于知识融合的大模型集成方法

前言

传统的模型融合方法主要分为集成方法和权重合并方法。这两种方法在以往的 NLP 比赛中非常常见,是提升性能的有效手段。然而,上述两种方法通常都需要对每个源模型进行预训练或微调,在大模型场景下,对每个源模型都进行初始化成本过高。

为了减少初始化源大语言模型(LLM)的成本,使集成后的模型能够受益于所有源 LLMs 的优势,本文介绍了一种基于知识融合的方法来进行大模型的融合。该方法旨在创建一个统一的 LLM,使其性能超越任何单一的源 LLM。

1. 背景与概念

1.1 因果语言建模(Causal Language Modeling, CLM)

因果语言建模是训练语言模型的一种核心目标,它旨在最小化模型预测下一个词的负对数似然。在传统的语言模型训练中,这个目标是通过比较模型生成的词概率分布与实际文本中的词(以 one-hot 编码表示)来实现的。

CLM 的训练目标可以形式化地表示为:

$$\mathcal{L}{CLM} = -\sum{i=1}^{T} \log P(y_i | y_{<i}; \theta)$$

其中 $P(y_i | y_{<i}; \theta)$ 是在模型参数 $\theta$ 下,第 $i$ 个词给定前一个词的预测概率。

1.2 概率分布矩阵

为了更一般地看待语言模型,我们将序列预测转换为概率分布矩阵。对于给定的文本序列,模型会生成一个概率分布矩阵 $P$,其中每一行 $p_i$ 代表模型对第 $i$ 个词的预测分布。这个矩阵可以看作是模型对词汇表 $V$ 中每个词的概率预测。

CLM 的训练目标可以重写为概率分布矩阵的形式,通过计算预测分布与真实标签分布之间的差异来衡量损失。这里使用 KL 散度(Kullback-Leibler Divergence)作为两个矩阵之间的差异度量。

$$\mathcal{L} = D_{KL}(P_{target} || P_{source})$$

其中 $P_{target}$ 是 one-hot 编码的标签矩阵,每一行对应于文本序列中的一个词;$P_{source}$ 是模型预测的概率分布矩阵。

小结:从知识融合的角度看,不同 LLMs 生成的概率分布矩阵可以反映它们对文本的理解和知识。因此,通过比较和融合这些概率分布矩阵,可以提取和整合多个模型的知识,从而提升目标模型的性能。

2. LLMs 融合方法

2.1 知识外化

不同的 LLMs 对同一文本生成的不同概率分布矩阵代表了这些模型嵌入的多样化知识。FUSELLM 方法通过概率建模来融合这些源 LLMs 的概率分布,目的是创建一个统一的 LLM,这个新模型能够超越任何单一的源 LLM。

2.2 训练目标

为了实现上述目标,FUSELLM 在与预训练数据集相似的原始文本语料库上对目标 LLM 进行轻量级持续训练。在训练过程中,FUSELLM 不仅依赖于因果语言建模(CLM)目标,还强调最小化目标 LLM 的概率分布与源 LLMs 的概率分布之间的差异。

融合损失函数定义为:

$$\mathcal{L}{fusion} = \sum{k} w_k D_{KL}(P_{target} || P_{source}^{(k)})$$

整体损失函数结合了 CLM 目标和融合损失:

$$\mathcal{L}{total} = \mathcal{L}{CLM} + \lambda \cdot \mathcal{L}_{fusion}$$

其中 $w_k$ 是各个源模型的权重,$\lambda$ 是平衡系数。

2.3 概率分布矩阵对齐

由于不同源 LLMs 可能使用不同的分词器(Tokenizer),它们生成的概率分布矩阵可能在词汇表和 Token 上存在对齐问题。为了解决这个问题,FUSELLM 采用了一种基于最小编辑距离(MinED)的策略来对齐这些矩阵,确保不同模型之间的分布矩阵可以正确对齐。

Token Alignment 的重要性

在 LLMs 融合的过程中,确保不同模型生成的标记对齐是至关重要的,因为这直接影响到概率分布矩阵的对齐和后续的知识融合效果。如果标记没有正确对齐,那么即使模型在理解文本方面有优势,也无法有效地将这些优势转移到目标模型中。

Token Alignment 包含两个维度:

  1. 文本维度:需要确保两个模型生成的标记序列在文本顺序上对齐。
  2. 分布维度:需要确保来自不同模型的分布值也对齐,即使它们可能对应不同的标记。
对齐策略

文章提到了两种主要的对齐策略:

  1. 动态规划对齐(EM)策略 这是一种基于动规划的方法来实现标记对齐。这种方法通过递归地最小化编辑序列的成本来对齐两个标记序列。编辑操作包括插入、删除和替换标记。如果两个标记相同,它们可以直接对齐;如果不同,则需要通过编辑操作来找到最佳的对齐方式。

  2. 最小编辑距离(MinED)策略 为了提高对齐的成功率并保留更多的有用信息,文章提出了一种基于最小编辑距离(MinED)的策略。这种方法相对于传统的精确匹配(Exact Matching, EM)策略,能够更灵活地处理标记之间的差异。MinED 策略通过计算两个标记之间的编辑距离来确定它们是否可以对齐,这通常比直接匹配更加宽松,因此能够减少对齐过程中的信息损失。

小结:标记对齐是 FUSELLM 方法中的关键步骤,它确保了不同模型生成的概率分布矩阵可以正确地融合在一起,从而实现有效的知识转移。MinED 策略提供了一种灵活的对齐方法,能够在保持信息完整性的同时,处理不同模型生成的标记差异。

2.4 融合策略

在对齐概率分布矩阵后,FUSELLM 采用两种融合策略来整合源 LLMs 的知识:

  • MinCE(最小交叉熵):选择具有最小交叉熵的分布矩阵。这种方法倾向于选择预测最准确的模型的分布,适用于某些特定任务表现优异的模型。
  • AvgCE(加权平均交叉熵):基于交叉熵得分的加权平均。这种方法为每个源模型的分布赋予不同的权重,权重由模型在预测时的交叉熵得分决定,能够综合多个模型的优势。

2.5 融合算法流程

  1. 初始化:初始化目标 LLM,可以选择其中一个源 LLM 作为起点。
  2. 分布计算:对于训练语料库中的每个文本,应用所有源 LLM 来计算概率分布矩阵。
  3. 矩阵对齐:使用 MinED 对齐这些概率分布矩阵,解决分词器不一致的问题。
  4. 知识融合:使用 MinCE 或 AvgCE 融合策略来融合这些对齐后的矩阵。
  5. 参数更新:更新目标 LLM 的参数,以最小化整体损失函数。

3. 总结

FUSELLM 提供了一种高效的 LLMs 集成方法,为大模型融合提供了一个实用的技术路径。通过知识融合而非简单的权重合并,该方法能够在降低初始化成本的同时,有效利用多个源模型的知识优势。未来在 LLM 竞赛或实际部署遇到性能瓶颈时,可以考虑尝试这种知识融合 Trick 来提升模型表现。

该方法的核心理念在于将不同模型的概率分布视为知识的载体,通过数学上的对齐与融合,实现 1+1>2 的效果。这对于资源受限但需要高性能模型的场景具有重要的参考价值。

目录

  1. FuseLLM:基于知识融合的大模型集成方法
  2. 前言
  3. 1. 背景与概念
  4. 1.1 因果语言建模(Causal Language Modeling, CLM)
  5. 1.2 概率分布矩阵
  6. 2. LLMs 融合方法
  7. 2.1 知识外化
  8. 2.2 训练目标
  9. 2.3 概率分布矩阵对齐
  10. Token Alignment 的重要性
  11. 对齐策略
  12. 2.4 融合策略
  13. 2.5 融合算法流程
  14. 3. 总结

更多推荐文章

查看全部
  • Python 构建 NLP 模型实战:从预处理到部署
  • OpenClaw:构建本地私有化 AI 助手与自动化工作流
  • Telegram 中文搜索机器人 @letstgbot 技术解析与开发实战
  • Java 后端面试备战:30 天系统梳理核心考点指南
  • OpenClaw 实战:统一接入飞书/钉钉/WhatsApp,打造 AI 指挥中心
  • 基于 Coze 平台的企业级 AI 客服机器人搭建实战
  • C 语言算法与数据结构实战:从数组到递归的避坑之旅
  • Kotlin 注解详解:声明、应用与元注解
  • 飞算 JavaAI 智能辅助开发功能评测
  • FastAPI:Python 高性能 Web 框架
  • AI Agent 架构:基础组成模块深度解析
  • 学习大语言模型 (LLM) 应从哪个开源模型入手?
  • 网络安全 SRC 漏洞挖掘实战指南与入门路径
  • FLUX.1-dev FP8 完整部署教程:6GB 显存运行 AI 绘画
  • 基于 AIGC 的销讲型直播内容 5 步策划法
  • Stable Diffusion WebUI 整合包安装与使用指南
  • Git 入门指南:安装配置与分支管理
  • OSCP 密码攻击实践:获取并破解 Net-NTLMv2 哈希(上)
  • OpenClaw-多飞书机器人与多Agent团队实战复盘
  • 基于动态反演和扩展状态观测器的无人机鲁棒反馈线性化自适应姿态控制器

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online