跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

Kimi2.5 核心技术:注意力残差

注意力残差是 Kimi 团队提出的架构创新,用可学习的注意力机制取代传统固定权重加法。该方案利用时间 - 深度对偶性,让模型每层智能选择信息源,解决残差连接的信息稀释与隐状态爆炸问题。工程上采用 Block AttnRes 分块策略降低开销。实测显示计算效率提升 1.25 倍,推理密集型任务如 GPQA 提升 7.5%,梯度分布更均匀,标志着大模型竞争转向架构创新驱动。

SparkGeek发布于 2026/4/8更新于 2026/7/2541 浏览

Attention Residuals 详解

Attention Residuals(注意力残差)是 Kimi 团队在 2026 年 3 月提出的一项突破性架构创新。它挑战了深度学习领域沿用十年的残差连接(Residual Connections)设计,用可学习的注意力机制取代了传统的固定权重加法,让模型的每一层都能智能地选择从前面的哪些层获取信息。

下面我从核心原理、生动举例和实际应用三个层面,为你系统拆解这项技术。

一、核心原理:为什么需要 Attention Residuals?

1. 传统残差连接的'隐痛'

自从 2015 年 ResNet 诞生以来,残差连接 y = x + f(x) 就成了几乎所有深度神经网络的标配。但它的信息聚合方式非常粗糙:把所有前面层的输出无差别地等权相加。

这带来了两个严重问题:

问题表现后果
信息稀释浅层特征在向深层传递时,其相对贡献随深度线性衰减第 50 层想用第 2 层的信息,但已被中间 48 层的信息层层冲淡
隐状态爆炸深层模块需要输出更大模长的激活值来维持信号强度数值不稳定,梯度分布不均,训练收敛困难

这就是论文中反复提到的 PreNorm 稀释问题(PreNorm dilution problem)。

2. 时间 - 深度对偶性:一个天才的类比

Kimi 团队发现了一个深刻的数学结构:网络的深度维度和序列的时间维度本质上是同构的。

'将注意力旋转 90°'——论文作者之一 Yulun Du

这句话的意思是:

  • 横轴(时间/序列):Transformer 用注意力机制让每个 token 去关注序列中任意位置的 token,解决了 RNN 的遗忘问题
  • 纵轴(深度):为什么不让每一层去关注前面任意层的输出,解决残差连接的稀释问题?

既然注意力机制在横向上解决了 RNN 的问题,旋转 90° 放到纵向上,同样有效。

3. Attention Residuals 的数学形式

在这里插入图片描述

4. Block AttnRes:工程落地的关键

Full AttnRes 理论上完美,但在大规模训练中面临内存和通信开销爆炸的问题——每一层都需要访问所有前面层的输出。

Kimi 团队的解决方案是 Block AttnRes:

策略做法效果
分块压缩将 L 层网络分成 N 个 Block(每个约 6 层),Block 内部沿用传统残差,Block 之间使用注意力内存开销从 O(L) 降至 O(N)
跨阶段缓存
在流水线并行中只传输新增的块数据
训练额外开销 < 4%
两阶段计算将块内所有层的查询打包成一次矩阵运算推理延迟增加 < 2%

实验发现,N ≈ 8 个块就能获得 Full AttnRes 绝大部分性能增益。

二、举例说明:用数学学习路径来类比

设想一个人的数学学习路径:

阶段册数内容
小学数学6 册加减乘除、分数小数
中学数学3 册代数、几何基础
高中数学3 册函数、解析几何
高等数学2 册微积分、线性代数

学习完成后,需要用全部 14 册的知识解决现实问题。

机制类比做法效果
Standard Residual把 14 册书的知识点等量混合后使用高等数学的重要知识被稀释,解决问题效果差
Full AttnRes按权重分配:高等数学最多,高中数学次之,小学最少解决问题时更多使用高等数学,效果更好
Block AttnRes先把每个阶段整理成摘要,再按权重使用各阶段的摘要既高效又保留关键信息

这个类比很直观地解释了:为什么让模型学会'选择性关注'比'照单全收'更有效。

三、应用场景与实测效果

1. 训练效率:1.25 倍计算杠杆

在 Kimi Linear 48B 模型上(总参数 48B,激活参数 3B),实验结果表明:

指标效果
计算效率同等验证损失下,Block AttnRes 相当于传统模型用 1.25 倍算力才能达到的效果
训练开销端到端训练耗时增加 < 4%
推理延迟增加 < 2%
2. 下游任务:推理密集型任务提升显著

在 15 项主流评测基准中,Block AttnRes 均达到或超过基线模型:

任务类型评测基准提升幅度
科学推理GPQA-Diamond+7.5%
数学推理Minerva Math+3.6%
代码生成HumanEval+3.1%
知识理解MMLU+1.1%

值得注意的是,推理密集型任务(GPQA、数学、代码)提升最显著——这正是需要模型'深挖'能力的地方,与 Attention Residuals 的设计目标高度吻合。

3. 训练稳定性:梯度分布更均匀

从训练过程观察:

现象传统残差Attention Residuals
输出量级随深度单调增长(逐层放大)在每个 Block 边界重置,呈周期性模式
梯度分布早期层梯度过大,分布极不均匀显著更均匀,更多层真正参与学习
4. 行业反响与未来方向

这项技术发布后,获得了多位 AI 领域顶尖人物的高度评价:

  • 马斯克:'Impressive work from Kimi'(令人印象深刻的工作)
  • Jerry Tworek(OpenAI o1 主要发明者):'深度学习 2.0 时代即将到来'
  • Andrej Karpathy(OpenAI 创始成员):'我们对'Attention is All You Need'的理解还是片面了'

从更宏观的视角看,Kimi 创始人杨植麟在 GTC 2026 演讲中指出:'行业目前普遍使用的很多技术标准,本质上是八九年前的产物,正逐渐成为 Scaling 的瓶颈。' Attention Residuals 正是对残差连接这一'祖传地基'的重构,标志着大模型竞争正从数据与算力驱动,转向架构创新驱动的新阶段。

总结:Attention Residuals 核心价值一览

维度核心突破
原理用可学习的 Softmax 注意力权重,取代传统残差的固定等权加法
创新发现'时间 - 深度对偶性',将注意力机制'旋转 90°'应用到深度轴上
工程Block AttnRes 分块策略,将开销控制在训练 <4%、推理 <2%
效果1.25 倍计算效率提升,推理密集型任务(GPQA)提升 7.5%
意义撬动了深度学习沿用十年的'祖传地基',开启架构创新新阶段

目录

  1. Attention Residuals 详解
  2. 一、核心原理:为什么需要 Attention Residuals?
  3. 1\. 传统残差连接的“隐痛”
  4. 2\. 时间 - 深度对偶性:一个天才的类比
  5. 3\. Attention Residuals 的数学形式
  6. 4\. Block AttnRes:工程落地的关键
  7. 二、举例说明:用数学学习路径来类比
  8. 三、应用场景与实测效果
  9. 1\. 训练效率:1.25 倍计算杠杆
  10. 2\. 下游任务:推理密集型任务提升显著
  11. 3\. 训练稳定性:梯度分布更均匀
  12. 4\. 行业反响与未来方向
  13. 总结:Attention Residuals 核心价值一览
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • VS Code 集成 GitHub Copilot 使用指南
  • Le Git Graph 浏览器扩展:GitHub 提交历史可视化指南
  • AI 智能体 Coze 知识库:从入门到实战
  • Whisper-base.en:74M 轻量模型英文语音识别
  • OpenClaw Gateway 部署故障排查:systemctl --user unavailable 问题解析
  • 递归算法入门:汉诺塔与合并有序链表实战解析
  • 在 Windows 上本地运行 DeepSeek 的三步指南
  • 基于腾讯云轻量应用服务器部署 OpenClaw 并接入 QQ 与飞书机器人
  • 深入理解 Claude Skills:架构、特性与实战
  • Python JSON 模块详解
  • AIGC 产品经理:定义、核心职责与 AI 产品经理的区别
  • AI 时代如何提前预见未来:技术人的前瞻性思维与职业策略
  • Java 7 32 位与 64 位 Windows 安装包下载
  • Windows 安装 Ubuntu-20.04 操作超时解决方法
  • 国内主流 AI 工具对比:豆包、元宝、千问、Kimi、DeepSeek、MiniMax、GLM
  • 宇树 G1 机器人强化学习训练配置与奖励函数解析
  • ToDesk 集成 AI 助手 ToClaw:零门槛接入工作流
  • 基于 LLama-Factory 微调大模型生成合规隐私政策
  • 轻小说机翻机器人:基于 Kotlin 与 Vue3 的开源翻译方案
  • OpenDroneMap 无人机影像处理与地理数据生成指南

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online