跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
Python

理解大语言模型原理的 10 篇核心论文

从 Transformer 的注意力革新到 ChatGPT 的对话涌现,大模型技术历经了从架构创新到对齐优化的关键演进。以 GPT 系列为代表的模型,依托 Transformer 解码器逐步扩容参数,实现了少样本学习能力;而 RLHF、Prompt 工程与 In-Context Learning 等技术的加入,让模型从'懂语言'走向'懂人类意图'。梳理支撑 ChatGPT 的核心论文与技术脉络…

Tesfly发布于 2026/3/30更新于 2026/7/2251K 浏览
理解大语言模型原理的 10 篇核心论文

从 Transformer 的注意力革新到 ChatGPT 的对话涌现,大模型技术历经了从架构创新到对齐优化的关键演进。以 GPT 系列为代表的模型,依托 Transformer 解码器逐步扩容参数,实现了少样本学习能力;而 RLHF、Prompt 工程与 In-Context Learning 等技术的加入,让模型从'懂语言'走向'懂人类意图'。本文梳理支撑 ChatGPT 的核心论文与技术脉络,为读者呈现大模型从基础构建到对齐落地的完整技术图谱。

一、Transformer

ChatGPT 使用的预训练模型 GPT,是在 Transformer 的 Decoder 基础上进行改造的。

论文标题:《Attention Is All You Need》
论文链接:Attention Is All You Need
摘要:占主导地位的序列转导模型是基于复杂的递归或卷积神经网络,包括一个编码器和一个解码器。性能最好的模型还通过注意力机制将编码器和解码器连接起来。本文提出了一种全新的简单网络架构——Transformer,它完全基于注意力机制,摒弃了递归和卷积结构。在两个机器翻译任务上的实验表明,该模型在质量上更胜一筹,同时更易于并行化,训练时间大幅缩短。在 WMT 2014 英德翻译任务中,模型达到了 28.4 BLEU,比现有最佳结果提高了 2 BLEU 以上。在 WMT 2014 英法翻译任务中,模型在 8 个 GPU 上训练 3.5 天后,取得了 41.0 的单模型最佳 BLEU 得分,训练成本仅为文献中最佳模型的一小部分。

二、GPT-3

GPT 家族与 BERT 模型均为知名的 NLP 预训练模型,皆基于 Transformer 技术。GPT-1 仅包含 12 个 Transformer 层,而 GPT-3 已扩展至 96 层。

论文标题:《Language Models are Few-Shot Learners》
论文链接:Language Models are Few-Shot Learners
摘要:近期研究表明,通过在大型文本语料库上预训练,再针对特定任务微调,可在多项 NLP 任务上获得显著提升。尽管该方法在结构上通常与任务无关,但仍需特定任务的微调数据集(包含数千至数万个样本)。相比之下,人类通常仅需少量示例或简单指令即可完成新语言任务,而现有 NLP 系统在此方面仍显不足。本文证明,扩大语言模型规模可大幅改善任务无关的少样本性能,有时甚至媲美最先进的微调方法。具体而言,我们训练了 GPT-3,一个拥有 1750 亿参数的自回归语言模型,参数量是此前非稀疏模型的 10 倍,并测试了其少样本性能。在所有任务中,GPT-3 无需梯度更新或微调,仅通过文本交互指定任务和少量演示即可运行。GPT-3 在翻译、问答、完形填空及需要即时推理或领域适应的任务(如词义解读、新词造句、三位数算术)上表现强劲。同时,我们也发现部分数据集上 GPT-3 的少样本学习仍较困难,且面临与大规模网络语料训练相关的方法学问题。此外,GPT-3 生成的新闻文章样本已难以被人类评估者区分。本文探讨了该发现及 GPT-3 的广泛社会影响。

三、InstructGPT

ChatGPT 的训练流程主要参考 InstructGPT,可视为其改进版本。

论文标题:《Training language models to follow instructions with human feedback》
论文链接:Training language models to follow instructions with human feedback
摘要:单纯扩大语言模型规模并不意味着其能更好地遵循用户意图。例如,大型语言模型可能生成不真实、有害或无用的输出,即未与用户意图对齐。本文展示了一种通过人类反馈微调(RLHF)使语言模型在广泛任务中与用户意图对齐的路径。我们从标注员编写的提示词及 OpenAI API 提交的提示词出发,收集了标注员演示的理想模型行为数据集,并利用监督学习对 GPT-3 进行微调。随后,我们收集模型输出的排序数据集,利用基于人类反馈的强化学习进一步微调该监督模型,最终得到 InstructGPT。在人类评估中,尽管参数量仅为 GPT-3 的 1/100,1.3B 参数的 InstructGPT 输出仍比 175B 的 GPT-3 更受青睐。此外,InstructGPT 在真实性上有所改善,有害输出减少,且在公共 NLP 数据集上的性能回退极小。尽管 InstructGPT 仍会犯简单错误,但结果表明,利用人类反馈微调是使语言模型与人类意图对齐的可行方向。

四、Sparrow

DeepMind 的 Sparrow 发表时间略晚于 InstructGPT,技术思路与三阶段框架相似,但在人工标注质量与工作量上不及 InstructGPT。不过,Sparrow 将奖励模型拆分为两个独立 RM 的思路在理论上更具优势。

论文标题:《Improving alignment of dialogue agents via targeted human judgements》
论文链接:Improving alignment of dialogue agents via targeted human judgements
摘要:本文提出 Sparrow,一个以信息获取为目标的对话代理。与提示基线语言模型相比,Sparrow 经过训练后更具帮助性、准确性与安全性。我们使用基于人类反馈的强化学习训练该模型,并引入两项新机制辅助人类评分:首先,为提升帮助性与安全性,我们将良好对话的要求拆解为代理需遵循的自然语言规则,并让评分者逐条评估。该拆解使我们能收集更具针对性的人类判断,并训练更高效的规则条件奖励模型。其次,代理在收集对模型声明的偏好判断时,会提供支持事实性要求的来源证据。针对事实性问题,Sparrow 提供的证据在 78% 的情况下支持采样回复。Sparrow 比基线更受青睐,且对人类对抗性探测更具韧性,被探测时违反规则的概率仅 8%。广泛分析表明,尽管模型学会了遵循规则,但仍会表现出分布外偏差。

五、RLHF

InstructGPT/GPT-3.5(ChatGPT 前身)与 GPT-3 的核心区别在于引入了 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)。该范式增强了人类对模型输出的调节能力,并对结果进行了更具语义理解的排序。

论文标题:《Augmenting Reinforcement Learning with Human Feedback》
论文链接:Augmenting Reinforcement Learning with Human Feedback
摘要:随着计算代理越来越多地应用于研究实验室之外,其成功将取决于学习新技能与适应动态复杂环境的能力。若不具备编程技能的人类用户能将任务知识转移给代理,学习过程将大幅加速,减少昂贵的试错成本。TAMER 框架旨在指导代理设计,使其行为可通过人类的批准与不批准信号进行塑造,这是一种自然的人类反馈形式。近期引入的 TAMER+RL 使人类反馈能够增强传统强化学习(RL)代理(该代理从马尔可夫决策过程 MDP 的奖励信号中学习)。通过重新实现 TAMER 与 TAMER+RL,我们解决了先前工作的局限性,并在两个关键方向做出贡献:首先,我们在第二个任务上测试了先前 TAMER+RL 工作中结合人类强化与 RL 的四种成功技术,并分析了其对参数变化的敏感性,得出更具普适性与规范性的结论,以指导后续研究。其次,TAMER+RL 此前仅限于顺序设置(即从 MDP 奖励学习前完成训练)。我们修改了顺序算法,使其能同时从两个来源学习,使人类反馈可在 RL 过程任意阶段介入。为实现同步学习,我们引入新技术,合理确定人类模型在整个时间与状态-动作空间中对 RL 算法的影响程度。

六、TAMER

注:原文标题误写为 TATAMER,已更正。 TAMER(Training an Agent Manually via Evaluative Reinforcement,通过评估式强化手动训练代理)框架将人类标注者引入智能体学习循环,通过人类提供奖励反馈指导智能体训练,从而快速达成任务目标。

论文标题:《Interactively Shaping Agents via Human Reinforcement》
论文链接:Interactively Shaping Agents via Human Reinforcement
摘要:随着计算学习代理进入可能产生实际成本的领域(如自动驾驶或金融投资),有必要在避免大量高成本试错的情况下学习优质策略。降低学习任务样本复杂度的一个有效途径是将人类知识转移给代理。理想情况下,该转移方法应适用于任何具备任务知识的人,无论其编程或 AI 专业背景如何。本文聚焦于允许人类训练师通过强化信号交互式地塑造代理策略。具体而言,本文介绍了'通过评估式强化训练代理'(TAMER)框架,以实现此类塑造。与以往交互式塑造方法不同,TAMER 代理会对人类的强化信号进行建模,并通过选择预期获得最多强化的动作来利用该模型。两个领域的实验结果表明,非专业人员无需定义环境奖励函数(如 MDP)即可训练 TAMER 代理,且该框架下的人类训练能比自主学习算法显著降低样本复杂度。

七、PPO

PPO(Proximal Policy Optimization,近端策略优化)是 ChatGPT 训练第三阶段采用的强化学习算法。

论文标题:《Proximal Policy Optimization Algorithms》
论文链接:Proximal Policy Optimization Algorithms
摘要:本文提出了一类新的强化学习策略梯度方法,通过在环境交互中进行数据采样与使用随机梯度上升优化'代理'目标函数之间交替进行。标准策略梯度方法对每个数据样本仅执行一次梯度更新,而本文提出了一种新目标函数,支持多次小批量更新。我们提出的近似策略优化(PPO)方法兼具信任区域策略优化(TRPO)的部分优势,但实现更简单、通用性更强,且具有更优的样本复杂度(经验上)。我们在模拟机器人运动与 Atari 游戏等一系列基准任务上测试了 PPO。结果表明,PPO 优于其他在线策略梯度方法,并在样本复杂度、实现简单性与计算壁垒之间取得了良好平衡。

八、In-Context Learning

ChatGPT 的认知能力并非完全源于语料统计,还具备临场学习能力,即 In-Context Learning(上下文学习)。学术界对该能力的底层机制仍在持续探索中。

8.1 Why Can GPT Learn In-Context

论文标题:《Why Can GPT Learn In-Context? Language Models Secretly Perform Gradient Descent as Meta-Optimizers》
论文链接:Why Can GPT Learn In-Context?
摘要:大型预训练语言模型展现出惊人的上下文学习(ICL)能力。仅需少量示范输入-标签对,即可预测未见输入的标签,无需额外参数更新。尽管性能卓越,ICL 的工作机制仍是开放问题。为深入理解 ICL,本文将语言模型解释为元优化器,并将 ICL 视为一种隐式微调。理论上,我们阐明了 Transformer 注意力机制具有基于梯度下降优化的对偶形式。基于此,我们对 ICL 的理解如下:GPT 首先根据示范实例生成元梯度,随后将这些元梯度应用于原始 GPT,构建 ICL 模型。实验中,我们综合对比了 ICL 与真实任务显式微调的行为,为上述理解提供经验证据。结果证明,ICL 在预测层面、表征层面与注意力行为层面均与显式微调相似。此外,受元优化理解启发,我们通过与动量梯度下降算法类比,设计了基于动量的注意力机制。该机制持续优于标准注意力,从另一角度佐证了我们的理解,并展示了利用该理解指导未来模型设计的潜力。

8.2 What learning algorithm is in-context learning

论文标题:《What learning algorithm is in-context learning? Investigations with linear models》
论文链接:What learning algorithm is in-context learning?
摘要:神经序列模型(尤其是 Transformer)展现出显著的上下文学习能力。它们可从输入标记示例序列 (x, f(x)) 中构建新预测器,无需进一步更新参数。我们验证了如下假设:基于 Transformer 的上下文学习者通过在激活中编码较小模型,并在上下文出现新示例时更新这些隐式模型,从而隐式执行标准学习算法。以线性回归为原型问题,我们为该假设提供三项证据:首先,通过构造证明 Transformer 可实现基于梯度下降与闭式岭回归的线性模型学习算法。其次,训练后的上下文学习者与梯度下降、岭回归及精确最小二乘回归计算的预测器高度匹配,随 Transformer 深度与数据集噪声变化在不同预测器间过渡,并在大宽度与大深度下收敛至贝叶斯估计器。第三,初步证据表明上下文学习者与这些预测器共享算法特征:学习者的后期层非线性编码权重向量与矩矩阵。结果表明,上下文学习在算法层面是可解释的,且(至少在线性情形下)学习者能重新发现标准估计算法。

九、Prompt

ChatGPT 训练时的输入采用 Prompt 形式。Prompt 是研究者为下游任务设计的输入模板,能协助预训练模型'回忆'预训练阶段习得的知识。

论文标题:《Pre-train, Prompt, and Predict: A Systematic Survey of Prompting Methods in Natural Language Processing》
论文链接:Pre-train, Prompt, and Predict
摘要:本文调查并梳理了自然语言处理中的新范式——'基于 Prompt 的学习'。与传统监督学习(训练模型接受输入 x 并预测输出 y 为 P(y|x))不同,基于提示的学习直接对文本概率进行建模。为执行预测任务,原始输入 x 通过模板修改为含未填充槽位的文本字符串 Prompt x',语言模型概率性填充槽位得到完整字符串,进而推导最终输出 y。该框架优势显著:允许语言模型在海量原始文本上预训练,并通过定义新 Prompt 函数实现少样本甚至零样本学习,快速适应标记数据稀缺的新场景。本文介绍了该范式的基本原理,提出一套统一数学符号以涵盖现有工作,并从预训练模型选择、Prompt 设计与调整策略等维度进行系统分类。为便于初学者入门,本文不仅系统回顾了现有工作,还对 Prompt 概念进行了高度结构化分类,并配套发布了持续更新的调查网站与论文清单等资源。

总结

本文系统梳理了 ChatGPT 背后的核心技术论文:从 Transformer 奠定注意力架构,到 GPT-3 实现大模型少样本能力,再经 InstructGPT、Sparrow 引入 RLHF 完成人类意图对齐,辅以 TAMER、PPO 完善强化学习流程,同时覆盖 Prompt 工程与 In-Context Learning 的机制探索。这些技术共同构建了大模型从预训练到对齐的完整体系,为理解大语言模型的能力来源与演进逻辑提供了清晰参考。

目录

  1. 一、Transformer
  2. 二、GPT-3
  3. 三、InstructGPT
  4. 四、Sparrow
  5. 五、RLHF
  6. 六、TAMER
  7. 七、PPO
  8. 八、In-Context Learning
  9. 8.1 Why Can GPT Learn In-Context
  10. 8.2 What learning algorithm is in-context learning
  11. 九、Prompt
  12. 总结
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • B站:从二次元社区到AI创新孵化器的转型
  • Eel 框架快速构建 Python 桌面 GUI 应用
  • 网络爬虫全景:技术体系、反爬对抗与全链路成本分析
  • Spring Boot 4 集成 OpenTelemetry 实现可观测性(Metrics/Traces/Logs)
  • OpenClaw 本地部署飞书机器人配置指南
  • 产品经理理解前端后端数据库——用产品语言解析技术架构
  • AIGC 时代:利用大模型辅助编程入门与实践
  • 运维人员学习 Python 的必要性及语言对比分析
  • 源码运行 RagFlow 实现 AI 搜索与智能体编排
  • ChatTTS WebUI 界面定制:修改主题、快捷键与配置导出
  • 使用 Linux 命名管道 (FIFO) 实现无血缘关系进程间通信
  • 傅里叶变换:FFT 与 DFT 原理及算法
  • Qwen3.5-4B 微调实战:基于 LLaMA-Factory 构建医疗 AI 助手
  • JavaScript 中 array.map() 的实战用法:数据转换、异步处理与 DOM 操作
  • Cursor 配置 Java 环境与创建 Spring Boot 项目
  • F5 刷新时浏览器前端发生了什么
  • FAST_LIO 与 FAST_LIO2 算法复现指南
  • 零代码上手!用 Rokid 灵珠平台,5 步搭建专属旅游 AR 智能体
  • 在 IntelliJ IDEA 中使用飞算 AI 的实操记录
  • 哈希表核心原理:冲突处理与 C++ 实战实现

相关免费在线工具

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online

  • Base64 文件转换器

    将字符串、文件或图像转换为其 Base64 表示形式。 在线工具,Base64 文件转换器在线工具,online

  • Markdown转HTML

    将 Markdown(GFM)转为 HTML 片段,浏览器内 marked 解析;与 HTML转Markdown 互为补充。 在线工具,Markdown转HTML在线工具,online

  • HTML转Markdown

    将 HTML 片段转为 GitHub Flavored Markdown,支持标题、列表、链接、代码块与表格等;浏览器内处理,可链接预填。 在线工具,HTML转Markdown在线工具,online

  • JSON 压缩

    通过删除不必要的空白来缩小和压缩JSON。 在线工具,JSON 压缩在线工具,online