跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

Qwen2.5 技术报告详解:架构、训练与长文本能力

详细解读了阿里发布的 Qwen2.5 技术报告。文章涵盖了研究动机、核心创新点、模型架构、训练方法及实验结论。Qwen2.5 将预训练数据扩展至 18 万亿词元,支持从 0.5B 到 72B 的多种模型规模,并引入 MoE 架构。关键技术包括 YARN 和双块注意力(DCA)以支持长达 100 万词元的上下文,以及 DPO 和 GRPO 强化学习策略。实验显示 Qwen2.5-72B 在多项任务上超越 Llama-3-405B,Turbo 版本在长文本处理上表现优异。此外,文章还探讨了模型部署优化建议及常见问题解答。

GopherDev发布于 2025/2/7更新于 2026/9/358 浏览
Qwen2.5 技术报告详解:架构、训练与长文本能力

Qwen2.5 技术报告详解

TL;DR

研究动机:构建更强大、更通用、更易用的 LLM,克服现有模型在规模、数据质量、长文本处理等方面的局限。

核心创新:

  • 预训练数据扩展:将高质量预训练数据从 7 万亿词元扩展到 18 万亿,增强模型的常识和专业知识。
  • 数据质量提升:严格数据过滤,加入数学、编程等专业领域数据,生成高质量合成数据,优化数据混合策略。
  • 模型规模多样化:提供从 0.5B 到 72B 参数的模型,包括密集模型和 MoE 模型,满足不同资源和应用需求。
  • 后训练强化:实施精细的监督微调(超百万样本)和多阶段强化学习(DPO 和 GRPO),提升指令遵循、逻辑推理等能力。
  • 长文本能力增强:引入 YARN 和双块注意力(DCA)技术,支持最长 100 万词元的上下文处理,特别是 Qwen2.5-Turbo。
  • 易用性改进:提升最大生成长度至 8K,增强结构化数据支持,简化工具使用。

主要内容

1. 作者和团队信息

  • 作者:Qwen Team(通义千问团队),阿里巴巴集团旗下的 AI 团队,专注于大语言模型及相关技术的研究和开发。

2. 背景和动机

研究问题:如何构建更强大、更通用、更易用的大语言模型(LLMs)。

问题背景:

  • AGI 的快速发展:大型语言模型在语言理解、生成和推理等方面展现出强大的能力,激发了人们对通用人工智能(AGI)的期望。
  • 开源 LLM 的兴起:Llama、Mistral 和 Qwen 等开源模型的出现,降低了 LLM 的使用门槛,促进了 AI 技术在各个领域的普及。

现有模型的局限性:

  • 模型尺寸和参数量需要进一步探索。
  • 预训练和微调数据质量需要进一步提升。
  • 长文本生成、结构化数据分析和工具使用等能力有待加强。

3. 相关研究

  • 模型和数据扩展:通过增加模型参数量或预训练数据量来提升模型性能。
  • 预训练 + 微调:在海量无标注数据上进行预训练,在高质量标注数据上进行监督微调(SFT),并通过人类反馈进行强化学习(RLHF)。
  • 长文本处理:位置编码(RoPE, ALiBi)、注意力机制优化(GQA, 窗口注意力)、上下文扩展(YARN, DCA)。

4. 核心思路

Qwen2.5 的核心思路是全面提升预训练和后训练阶段,以构建在规模、数据质量和易用性方面更优异的 LLM。其创新之处包括:

  1. 预训练数据扩展:将高质量预训练数据从 7 万亿词元扩展到 18 万亿。
  2. 数据质量提升:通过更严格的数据过滤、引入专业领域数据、生成高质量的合成数据,以及优化数据混合策略。
  3. 多样化的模型规模:提供从 0.5B 到 72B 参数的模型,包括密集模型和专家混合(MoE)模型。
  4. 后训练强化:实施精细的监督微调和多阶段强化学习,包括离线学习 DPO 和在线学习 GRPO。
  5. 长文本能力增强:通过引入 YARN 和双块注意力(DCA)等技术,支持更长的上下文长度。
  6. 易用性改进:解决前代模型在使用上的限制,如将最大生成长度从 2K 增加到 8K。

5. 方案与技术

模型架构
  • Dense 模型:基于 Transformer 的 Decoder 架构,采用 GQA、SwiGLU、RoPE、QKV bias 和 RMSNorm 等组件。
  • MoE 模型:将 FFN 层替换为 MoE 层,采用细粒度专家分割和共享专家路由。
Tokenizer
  • 采用 byte-level BPE(BBPE)算法,词汇表扩展到 151,643 个标记。
  • 增加了更多的控制标记,增强一致性和兼容性,支持工具调用等功能。
预训练
  • 数据准备:使用 Qwen2-Instruct 模型进行高质量数据过滤;引入 Qwen2.5-Math 和 Qwen2.5-Coder 的数据;使用 Qwen2-72B-Instruct 和 Qwen2-Math-72B-Instruct 模型生成高质量合成数据。
  • 超参数优化:基于 Scaling Law 推导模型超参数,如 batch size 和 learning rate。
  • 长文本预训练:两阶段训练(初始 4,096 长度,扩展 32,768 长度)。Qwen2.5-Turbo 采用渐进式上下文长度扩展策略,经过多阶段扩展到 262,144,并配合 RoPE 频率调整(ABF 技术)。
后训练
  • 监督微调(SFT):使用超过 100 万的样本进行微调,涵盖长文本生成、数学、代码、指令遵循等任务。
  • 离线强化学习(Offline RL):使用 DPO 算法训练模型,提升数学、代码、指令遵循和逻辑推理等能力。
  • 在线强化学习(Online RL):使用 GRPO 算法训练模型,使其生成更符合人类偏好的结果。
长文本微调
  • 针对 Qwen2.5-Turbo,使用长文本 SFT 数据进行微调,提升模型在长文本任务中的性能。
  • 在 SFT 阶段,结合短文本和长文本数据进行混合训练;在 RL 阶段,仅使用短文本数据进行训练。

6. 实验与结论

评估方法:使用多种公开数据集和内部数据集进行评估,包括自然语言理解、推理、数学、代码、人类偏好等。

实验结果:

  • Base 模型:Qwen2.5-72B 在各项任务上都表现出色,可以媲美 Llama-3-405B,在很多任务上甚至超越了 Llama-3-405B。
  • Instruction 模型:Qwen2.5-72B-Instruct 在多个任务上超越了 Llama-3.1-405B-Instruct。Qwen2.5-Turbo 在多个任务上与 GPT-4o-mini 表现出了竞争力。
  • 长文本能力:Qwen2.5 模型在 RULER、LV-Eval 和 LongBench-Chat 等长文本评估任务上取得了显著的性能提升,特别是 Qwen2.5-Turbo 在 100 万 token 上取得了优秀的 passkey retrieval 性能。
  • Reward 模型:Qwen2.5-RM-72B 在 PPE 和 Human-Preference-Chinese 评估中表现最佳。

主要结论:

  • Qwen2.5 系列模型在各项任务上都取得了显著的性能提升。
  • Qwen2.5-72B-Instruct 的性能可以媲美甚至超越了更大的 Llama-3-405B-Instruct 模型。
  • Qwen2.5-Turbo 在长文本处理和推理方面具有突出优势。

7. 贡献

  • 模型性能:在多个评测基准上取得了领先的性能,尤其是在长文本处理、数学推理和代码生成等领域。
  • 模型多样性:提供了多种模型大小和配置,满足不同场景的需求。
  • 开源社区:开放模型权重和 API,促进了 AI 技术在学术界和工业界的普及。

未来启示:

  • 数据质量和规模仍然是提升模型性能的关键因素。
  • 预训练和微调方法需要不断优化和探索。
  • 长文本处理仍然是当前 LLM 发展的重要方向。

8. 不足

  • 文化理解:在捕捉文化细微差别方面,仍有进一步改进的空间。
  • 奖励模型评估:当前奖励模型的评估方法不完善,无法准确预测 RL 模型在下游任务中的表现。
  • 开源细节:没有开源代码和数据,更多的技术细节只能推测。

QA

Q1: Qwen2.5 相比于 Qwen2,最大的改进是什么?

  • 数据规模与质量:预训练数据从 7 万亿 tokens 扩展到 18 万亿 tokens,引入了数学、代码等高质量领域数据。
  • 训练方法:采用了多阶段的预训练和后训练方法,包括使用 Scaling Law 优化超参数,采用两阶段预训练,使用 SFT、DPO 和 GRPO 等多阶段强化学习。
  • 模型能力:显著提升了长文本生成和处理能力,更好地支持结构化数据分析、工具使用和指令遵循。

Q2: 这篇报告中多次提到'Scaling Law',这个概念是什么?

  • 定义:描述的是模型性能随着模型参数量、训练数据量和计算资源的增加而变化的规律。
  • 角色:指导模型超参数选择(避免盲目实验),预测模型性能(比较不同大小的 dense 模型和 MoE 模型的表现)。

Q3: 预训练数据中的'合成数据'是如何生成的?

  • 过程:使用大型模型生成文本、代码或数学题解 -> 通用奖励模型初步筛选 -> 专业奖励模型精细过滤 -> 人工审核关键领域数据。
  • 作用:补充高质量数据,增加数据多样性,增强模型特定能力。

Q4: 报告中提到的'GQA'、'SwiGLU'和'RoPE'等技术,它们各自的作用是什么?

  • GQA (Grouped Query Attention):提高 KV cache 的利用率,降低计算和内存开销,特别是在长文本处理时。
  • SwiGLU:一种激活函数,替代 ReLU,具有更好的非线性特性,能够捕捉复杂模式。
  • RoPE (Rotary Positional Embeddings):用于在 Transformer 模型中引入位置信息,使模型能够理解词语之间的相对位置关系。

Q5: 什么是 DPO 和 GRPO?为什么同时使用它们?

  • DPO (Direct Preference Optimization):离线强化学习算法,直接优化模型策略,适用于有标准答案但难以评估的任务。
  • GRPO (Group Relative Policy Optimization):在线强化学习算法,关注同一 query 下不同 responses 的相对好坏,适用于可评估但需要优化人类偏好的任务。
  • 互补性:DPO 擅长处理客观性较强的任务,GRPO 擅长处理主观性较强的任务,协同提升模型性能。

Q6: 为了增强模型的长文本处理能力,Qwen2.5 使用了哪些技术?

  • 渐进式上下文长度扩展:逐步增加模型处理的最大上下文长度。
  • RoPE 基频调整:确保模型在长序列中能够正确地编码位置信息。
  • YARN:位置编码外推方法,扩展 RoPE 的有效范围。
  • 双块注意力(DCA):将长序列分块处理,降低计算复杂度,优先关注核心 chunk。

Q7: 什么是专家混合(MoE)架构?

  • 定义:包含多个专家子网络,路由器确定每个输入应由哪些专家来处理。
  • 优势:计算效率高(每次只激活部分专家),能力专长(不同专家专注不同任务),可扩展性强。

Q8: 为什么目前的 reward model 的评估方法并不能准确预测 RL 模型的最终表现?

  • 过拟合评估基准:奖励模型可能在基准上表现良好,但在实际应用中不佳。
  • 目标不一致:奖励模型的设计目标与 RL 训练的最终目标可能存在差异。
  • 固有局限性:当前的奖励模型可能无法准确评估一些复杂任务。

Q9: Qwen2.5 的模型规模从 0.5B 到 72B 不等,分别适合什么场景?

  • 资源受限场景:小模型(0.5B-3B)适用于移动设备、嵌入式系统。
  • 成本敏感场景:中等模型(7B-32B)在性能和成本之间取得平衡。
  • 性能要求高场景:大模型(>32B)适用于复杂的 NLP 任务、复杂推理或数学计算。

Q10: 对比一下 Qwen2.5 系列各个模型的特点?

模型名称参数量是否开源模型类型适用场景Context Length
Qwen2.5-0.5B0.5B是Dense边缘设备32K
Qwen2.5-7B7B是Dense通用用途128K
Qwen2.5-72B72B部分开源Dense研究应用128K
Qwen2.5-Turbo未明确否MoE云端高效应用1M

部署与优化建议

在实际部署 Qwen2.5 系列模型时,除了关注模型本身的性能指标,还需考虑以下工程化实践以确保生产环境的稳定性和效率:

  1. 量化与压缩:对于资源受限的边缘设备或低成本推理场景,建议使用 INT4 或 INT8 量化技术。Qwen2.5 的模型结构对量化具有良好的兼容性,可在保持精度损失极小的情况下显著降低显存占用。
  2. 推理加速框架:推荐使用 vLLM 或 TGI(Text Generation Inference)作为推理后端。这些框架针对 Transformer 架构进行了深度优化,支持连续批处理(Continuous Batching)和高吞吐量并发请求,特别适合 Qwen2.5 的大上下文场景。
  3. 显存管理:在处理 100 万 token 的超长上下文时,注意 KV Cache 的显存占用。启用 Flash Attention 2 和 PagedAttention 技术可以有效缓解显存峰值压力。
  4. API 服务封装:对于专有模型(如 Turbo/Plus),建议通过阿里云百炼平台或官方 API 接入,利用其自动扩缩容能力应对流量波动。开源模型则需自行搭建负载均衡集群。
  5. 监控与日志:建立完善的推理链路监控,记录延迟、Token 生成速率及错误率。针对长文本任务,特别关注首字延迟(TTFT)和整体响应时间,以便及时调整 Batch Size 或模型配置。

通过上述优化措施,可以充分发挥 Qwen2.5 的技术优势,在不同业务场景中实现高性能、低成本的 AI 落地。

目录

  1. Qwen2.5 技术报告详解
  2. TL;DR
  3. 主要内容
  4. 1. 作者和团队信息
  5. 2. 背景和动机
  6. 3. 相关研究
  7. 4. 核心思路
  8. 5. 方案与技术
  9. 模型架构
  10. Tokenizer
  11. 预训练
  12. 后训练
  13. 长文本微调
  14. 6. 实验与结论
  15. 7. 贡献
  16. 8. 不足
  17. QA
  18. Q1: Qwen2.5 相比于 Qwen2,最大的改进是什么?
  19. Q2: 这篇报告中多次提到“Scaling Law”,这个概念是什么?
  20. Q3: 预训练数据中的“合成数据”是如何生成的?
  21. Q4: 报告中提到的“GQA”、“SwiGLU”和“RoPE”等技术,它们各自的作用是什么?
  22. Q5: 什么是 DPO 和 GRPO?为什么同时使用它们?
  23. Q6: 为了增强模型的长文本处理能力,Qwen2.5 使用了哪些技术?
  24. Q7: 什么是专家混合(MoE)架构?
  25. Q8: 为什么目前的 reward model 的评估方法并不能准确预测 RL 模型的最终表现?
  26. Q9: Qwen2.5 的模型规模从 0.5B 到 72B 不等,分别适合什么场景?
  27. Q10: 对比一下 Qwen2.5 系列各个模型的特点?
  28. 部署与优化建议

更多推荐文章

查看全部
  • 基于 Python Django 与 Neo4j 的电影知识图谱推荐问答系统
  • VSCode Copilot 接入智谱 GLM-5.1 实战指南
  • AIGC 技术在元宇宙与虚拟世界中的应用与实现
  • Python 数据分析核心第三方扩展库详解
  • Windows 版 Stable Diffusion WebUI 快速搭建指南
  • 面试题 17.19 消失的两个数字:位运算实战解析
  • C++ 异常处理机制详解
  • Trae + Git 本地仓库离线管理指南
  • Stable Diffusion v1.5 风格迁移实战:照片转油画/水彩/像素风
  • 3661 可以被机器人摧毁的最大墙壁数目 - 离散化线段树二分查找
  • 非关系型数据库 Redis 简介及 Linux 环境下安装部署
  • Kiro 工具实测:前端代码生成验证与调整
  • OpenClaw AI Agent 框架本地部署全流程与安全建议
  • 前端自动化部署流程与最佳实践
  • Trae AI IDE 实战指南:从零开发 ChatBot 应用
  • 基于 DDPG 算法的电力市场博弈仿真与 Agent 建模研究
  • OpenClaw安全AI助理从零搭建实战教程
  • MiniCPM-V-2_6 数字孪生:工厂实景图识别与 IoT 数据关联可视化
  • 数据产品经理与AI产品经理的核心区别与联系
  • 基于 ESP32-S3 的蓝牙/有线双模智能家居键盘控制器设计详解

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online