跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

大模型训练数据白皮书发布:大模型是数据要素价值释放的最短路径

大模型训练数据白皮书于第七届数字中国峰会发布,指出大模型是数据要素价值释放的最短路径。文章分析了训练数据类型、高质量数据标准、合成数据方案及治理思路。强调通过政府与社会力量协同构建数据生态,解决数据供给不足问题,推动人工智能健康发展。

KernelLab发布于 2025/2/6更新于 2026/9/950 浏览
大模型训练数据白皮书发布:大模型是数据要素价值释放的最短路径

5 月 24 日,由阿里研究院牵头,阿里巴巴集团、数字中国研究院(福建)、阿里云智能集团联合编写的《大模型训练数据白皮书》在第七届数字中国峰会期间正式发布。该白皮书深入探讨了大模型训练所需的数据类型、质量评估标准及合成数据应用方案,为人工智能发展提供了重要的理论支撑与实践指导。

自《中共中央国务院关于构建数据基础制度更好发挥数据要素作用的意见》发布以来,我国数据要素建设不断深入。在国家数据局等 17 部门联合印发的《'数据要素×'三年行动计划(2024—2026 年)》中,明确提出了'建设高质量语料库和基础科学数据集,支持开展人工智能大模型开发和训练'的目标。通过数据要素建设推动人工智能大模型发展,可以有效解决我国人工智能特别是大模型研发所面临的数据瓶颈,进一步发挥大模型对于世界知识数据的汇集和处理能力,创造更大的生产力,助力我国从数据经济走向智能经济新发展模式。

大模型是数据要素价值释放的最短路径。通过理解其训练所使用的数据类型,可以更好理解大模型发挥价值的内在机制。促进高质量训练数据的建设,需要综合利用政府、企业、社会等各方资源推动数据的开放共享和开发利用;需要构建共享、共创、共赢的合作生态和更开放的环境,不囿于版权等制度所存在的争议;需要给技术的发展预留空间,并相信随着技术的日益成熟,相应的商业模式和制度设计也都会逐步完善。作为支撑大模型发展的三大基石之一,我们希望中国的大模型发展,可以在数据方向上有所突破,助力我国在国际竞争中取得优势地位。

本白皮书首先分析了大模型训练所需的数据类型,并从产业实践出发破解了对训练数据的常见迷思和误解。在上述基础上,本书进而对训练数据的质量和规模进行讨论,发现高质量数据应在实践中检验效果,而难以用前置的客观标准衡量。同时,本书探讨了合成数据作为解决高质量训练数据供给不足的新方案,及其在大模型训练中的潜力。在训练数据合规方面,针对模型训练的特点,本书提出顺应模型发展的数据治理思路。最后,本书论述构建政府和社会力量协同的数据生态对满足大模型训练数据需求的重要性,并以阿里巴巴的实践为案例做说明和阐述。

大模型训练数据白皮书发布现场

白皮书核心观点图示

01 训练数据对大模型发展的重要性

算法、算力与数据,是支撑大模型发展的三大基石。更高质量、更丰富的数据是以 GPT 为例的生成式人工智能大模型成功的驱动力。随着模型规模的扩大,数据的质量与多样性对模型性能的影响愈发显著。数据不仅是模型的燃料,更是决定模型上限的关键因素。

数据驱动模型演进

02 模型训练所需的数据类型

数据作为大模型训练的基础,提供了大模型所必需的知识和信息。区别于以往搜索系统、个性化推荐等所需的大量用户行为和偏好数据,随着技术的演进,大模型所需的数据是对知识性内容有强需求,是一种新的类型。

1. 训练大语言模型的数据

大语言模型所需要的数据内容与质量将根据训练的阶段有所不同,包括预训练(Pre-training)、监督微调(SFT)、基于人类反馈的强化学习(RLHF)三个阶段,三个阶段分别需要的语料特征可以概括为'广'、'齐'和'专'。

  • 预训练阶段:需要海量、多样化的通用文本数据,覆盖互联网公开内容、书籍、代码等,旨在让模型掌握语言规律和世界知识。
  • 监督微调阶段:需要高质量的指令 - 回答对数据,用于教会模型遵循人类指令,提升任务完成能力。
  • 强化学习阶段:需要人类偏好数据,用于对齐模型输出与人类价值观,减少有害或无意义内容的生成。

2. 训练多模态模型的数据

多模态模型则模拟人类大脑处理信息的方式,把各种感知模态结合起来,以更全面、综合的方式理解和生成信息,其在训练阶段更多地需要大量图像 - 文本对、视频 - 文本对等有标注数据集。

3. 训练数据的常见疑问和误解

本书认为,大模型训练数据主要对语料库等知识性内容有强烈需求,大模型训练并不依赖用户个人信息;中文语料短缺不是制约我国大模型发展的重要因素,但中式价值观类语料的短缺可能会成为制约我国大模型发展的短板。

数据需求误区解析

03 科学理解高质量数据的含义与作用

在生成式人工智能时代,模型训练的成功与否与所依赖的数据质量息息相关。模型的能力很大程度上可以反映出其训练数据的质量,这也无疑凸显了高质量数据在大模型训练和应用中不可替代的重要性。

1. 高质量数据的重要性

高质量数据可以更好地模拟客观世界,将其作为训练数据可增强模型能力。从模型能力表现来看,一是高质量数据可以提升模型的准确性和稳定性,二是高质量数据具有多样性,可以降低模型对特定数据集的依赖,提升鲁棒性和泛化能力。

2. 高质量数据的标准

高质量数据的类型具有三重不确定性,包括所需的语料种类的不确定性、语料形态演化的不确定性以及不同数据类型之间有效搭配的不确定性。而其评判具体标准需依据模型需求、训练阶段及目标任务多维度动态界定。

数据质量标准

04 合成数据作为解决训练数据供给不足的新方案

合成数据是通过算法和数学模型创建的,可用以补充或替代真实数据进行模型训练。合成数据作为应对训练数据短缺的新方案,将有利于平衡数据需求与合规要求,推动 AI 技术的可持续发展。

1. 训练数据供给不足带来的思考

人们正在积极探索新数据源,以缓解训练语料可能面临不足的问题。而利用模型或算法批量生成新数据,比如合成数据,并作为训练数据供给不足的新方案,则获得大量讨论。

2. 合成数据的定义

合成数据是通过算法和数学模型创建的。首先建模真实数据的分布,然后在该分布上进行采样,创建出新数据集,模拟真实数据中的统计模式和关系。

3. 合成数据的必要性

需要合成数据的本质原因是真实世界中获取数据遇到困难,表现在真实世界中难以观测,数据获取的成本高,以及数据获取和处理涉及到真实世界中的个信等方面。

4. 合成数据的生成方法及分类

根据是否基于实际数据集生成,合成数据生成方法主要分为基于真实数据集构建,和通过使用现有模型或者人类专业背景知识来创建等两类。根据用于训练的 AI 类型,可以将合成数据分为应用于生成式 AI 和判别式 AI 训练两类。

5. 合成数据在大模型训练中的作用

合成数据作为真实数据的一种替代,未来发展潜力巨大,可作为一个'新物种'密切关注;此外,目前合成数据可被应用于提升对齐阶段的数据获取效率。

6. 解决训练数据供给不足的新方案

合成数据为模型数据供给提供了新的技术方案,帮助解决高质量训练数据供给不足的问题,包括拓展训练数据的多样性、提高模型的安全性和可靠性、用户隐私保护和数据获取合规性等方面。

7. 在发展中治理的合成数据

相比于对合成数据量的扩增,在应用中要更重视质的提升;合成数据本身具备良好的安全性,在后续使用中较为可靠;对合成数据仍需设置相应的安全管控策略,确保模型整体的安全性不会因为合成数据的使用而受到影响。

合成数据技术架构

05 对大模型训练数据治理的思考

对大模型训练数据的治理思考集中于如何科学构建高质量数据生态,以及确保数据的公平性、多样性和真实性。大模型训练数据的治理是一个动态平衡、多方协作过程,需在技术创新与制度建设间寻找最优解,以促进人工智能的健康发展。

1. 大模型对训练数据的使用特点

大模型在使用训练数据时展现出以下特点:大模型训练数据在训练阶段并不依赖个人信息,而更侧重于全球知识与高质量语料;对于版权类数据主要采取了转换性使用,更偏向于合理使用或法定许可。

2. 大模型训练数据合规的治理之智

基于大模型对训练数据的使用特点,应构建顺应模型发展的新时代的数据治理制度,包括重视数据的可及性,提升模型安全训练数据的供给,以及应用新技术以提升训练数据的合规性和安全性等方面。

数据治理框架

06 政府与社会力量协同的训练数据生态

通过中美对比,我们倡导政府与社会力量的协同,共同推动数据要素的有效流通与应用,为大模型的训练提供充足、高质量的数据支持,进而促进人工智能技术的健康发展与广泛应用。

1. 美国的现状

美国在获取大模型数据方面的现状体现了政府与社会力量的紧密合作。美国联邦政府发挥了 AI 训练数据'汇聚融合'的角色,而美国社会力量则整合了政府数据与网络公开数据,并形成高质量训练语料。

2. 中国的现状

我国尚未形成对大模型提供有效供给的数据资源生态。我国的公共数据覆盖范围比美国更广,但在开放共享和开发利用程度上仍有不足;我国的社会力量则主要是结合海外优质开源数据集及中文语料,产出训练数据集。

中美数据生态对比

07 阿里巴巴集团在大模型训练与应用的案例

阿里巴巴集团在大模型的训练与应用探索中,展现出多方位的创新实践:在探索不同数据类型之间的有效搭配时,阿里巴巴达摩院在语料学习顺序中进行了'数据课程'的设计;在处理个人信息方面,采取严格措施,减少个人信息收集;在合成数据的探索和应用方面,在电商场景尝试通过合成数据实现 LLM 与推荐系统结合,更好地推理用户真实需求。这些系列举措体现了阿里巴巴集团在大模型领域的深度布局与全面实践。

阿里大模型实践

08 以更开放和务实的方式解决高质量训练数据供给

解决高质量训练数据供给问题,需采取务实、多元、开放策略,理解模型数据需求,协调政府与社会资源,构建共赢生态。制度设计应为技术进步留空间,优先考虑数据可及性,适度放松输入端管控并以事后监管应对风险,鼓励合理使用版权数据与合成数据。实践中,政府应推动公共数据开放,企业则积极探索数据构建方法,借助市场机制评判数据价值。

数据供给解决方案

未来展望

目录

  1. 01 训练数据对大模型发展的重要性
  2. 02 模型训练所需的数据类型
  3. 1. 训练大语言模型的数据
  4. 2. 训练多模态模型的数据
  5. 3. 训练数据的常见疑问和误解
  6. 03 科学理解高质量数据的含义与作用
  7. 1. 高质量数据的重要性
  8. 2. 高质量数据的标准
  9. 04 合成数据作为解决训练数据供给不足的新方案
  10. 1. 训练数据供给不足带来的思考
  11. 2. 合成数据的定义
  12. 3. 合成数据的必要性
  13. 4. 合成数据的生成方法及分类
  14. 5. 合成数据在大模型训练中的作用
  15. 6. 解决训练数据供给不足的新方案
  16. 7. 在发展中治理的合成数据
  17. 05 对大模型训练数据治理的思考
  18. 1. 大模型对训练数据的使用特点
  19. 2. 大模型训练数据合规的治理之智
  20. 06 政府与社会力量协同的训练数据生态
  21. 1. 美国的现状
  22. 2. 中国的现状
  23. 07 阿里巴巴集团在大模型训练与应用的案例
  24. 08 以更开放和务实的方式解决高质量训练数据供给

更多推荐文章

查看全部
  • MiniMax 海螺 AI 视频:图片与文本生成高质量视频
  • AI 时代如何提前预见未来:技术人的前瞻性思维与职业策略
  • 大厂面试流程解析与核心技术考点汇总
  • OpenViking 字节跳动开源 AI 代理上下文数据库部署实战
  • artTemplate 模板语法中多余空格导致渲染为空的问题分析
  • 单链表应用:经典算法题与通讯录实现
  • 阿里巴巴开源推理模型 Marco-o1 与多模态 MoE 大模型 Awaker2.5-VL 解析
  • LFM2.5-1.2B-Thinking-GGUF 模型部署与 llama.cpp 运行原理详解
  • 修复 Linux 无法开机 VFS Unable to mount root fs on unknown-block 错误
  • 基于ROS与Ego-Planner的无人机动态避障仿真实现
  • 大模型推理框架选型入门:Ollama、llama.cpp 与 vLLM 对比
  • 哈希表的C语言简单实现
  • 基于 DeepFace 与 OpenCV 的实时情绪分析器
  • SpringBoot 源码解析:AnnotationConfigServletWebServerApplicationContext 构造流程
  • Java 面试场景题解析与代码示例
  • Eclipse IDE Java 注解处理器 AnnotationMirror 示例
  • GitHub Copilot Agent Skills:打造跨项目 AI 专属工具箱
  • C++ STL 容器详解:unordered_map 与 unordered_set 实战指南
  • 通过 Vue 实例劫持突破 Web 编辑器粘贴限制
  • Amazon SageMaker 部署 AIGC 应用:从训练到 Web 集成的实战

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online