跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

大语言模型人类对齐五大核心算法:SFT、RLHF、DPO、PPO、GRPO

大语言模型人类对齐涉及 SFT、RLHF、PPO、DPO、GRPO 五种核心算法。SFT 是基础,通过指令微调建立指令遵循能力。RLHF 是经典框架,包含奖励模型与强化学习(PPO),效果极致但成本高。DPO 作为 RLHF 替代方案,直接优化偏好数据,流程简单且成本低,成为主流选择。GRPO 则是 PPO 的改进版,提升训练稳定性。文章对比了各算法的定位、步骤及优缺点,建议中小团队采用 SFT+DPO,头部厂商追求极致可选 RLHF 框架。

Stephaine Walsh发布于 2026/3/24更新于 2026/7/2540 浏览

大语言模型对齐核心算法浅析:SFT、RLHF、DPO、PPO、GRPO

这些算法均是大语言模型人类对齐阶段的核心方法,核心目标是让预训练大模型的输出贴合人类偏好、遵循自然语言指令、符合伦理规范与事实逻辑。其中SFT 是所有对齐的基础,RLHF 是经典对齐框架,PPO 是 RLHF 的核心强化学习组件,DPO 是 RLHF 的极简替代方案,GRPO 是 PPO 的改进版,彼此存在明确的层级和技术承接关系。

一、SFT:监督微调(Supervised Fine-Tuning)

核心定位

大模型人类对齐的第一步,所有后续对齐算法的基础。无 SFT 的基础模型,后续 RLHF/DPO/PPO/GRPO 的对齐都是空中楼阁。

核心原理

用高质量人类标注的指令 - 回答成对数据,在大模型预训练的基础上做小幅度微调,让模型学习人类的指令理解逻辑、基础回答范式和语言表达习惯,把预训练阶段'无目标的语言建模'转化为'有目标的指令遵循'。

核心步骤
  1. 构建高质量数据集:整理多样化指令库(覆盖日常对话、专业任务、逻辑推理等),由人类标注对应的优质回答,保证数据的准确性和多样性;
  2. 轻量化微调:为防止灾难性遗忘(丢失预训练的通用语言能力),通常冻结模型底层的大部分参数,仅微调上层的注意力层/全连接层,或采用 LoRA/QLoRA 等高效微调方法;
  3. 评估与筛选:通过自动指标(如 BLEU、CHRF)+ 人工抽样评估,筛选出指令理解能力最优的 SFT 模型,作为后续对齐的初始模型。
优缺点
  • 优点:实现简单、训练稳定、工程成本低,能快速让模型具备基础的指令遵循能力;
  • 缺点:依赖高质量人类标注,无法解决人类偏好的细粒度差异(如两个回答都正确,哪个更简洁/更贴合语境/更有深度),泛化性有限,对未见过的指令处理能力弱。
适用场景

所有大模型的对齐前置步骤,是中小规模大模型'轻量对齐'的可选终方案(若对偏好对齐要求不高,仅需基础指令遵循,SFT 即可满足)。

二、RLHF:人类反馈的强化学习(Reinforcement Learning from Human Feedback)

核心定位

OpenAI 提出的大模型经典对齐框架,行业内首个实现'细粒度人类偏好对齐'的方案,GPT-3.5/Claude 早期版本均基于此,并非单一算法,而是SFT+ 人类偏好标注 + 奖励模型 + 强化学习的组合体系。

核心原理

把人类主观偏好转化为模型可量化的奖励信号,以 SFT 模型为初始策略,通过强化学习算法优化模型参数,让模型生成'人类认为更优'的回答,核心是'用人类反馈指导模型的迭代方向'。

核心三步法(经典流程)
  1. 基础 SFT:训练得到具备基础指令遵循能力的 SFT 模型(同上文);
  2. 奖励模型(RM)训练:让 SFT 模型对同一指令生成多个不同回答,由人类对这些回答进行排序/评分(标注偏好),用这些带偏好标签的数据训练奖励模型,RM 的核心输出是奖励值,奖励值越高代表回答越符合人类偏好;
  3. 强化学习微调:以 SFT 模型为初始策略,以 RM 为奖励函数,用强化学习算法(核心是 PPO)优化模型,让模型生成的回答能获得 RM 的高奖励,同时加入KL 散度约束,限制模型与 SFT 模型的分布差异,防止丢失基础能力。
优缺点
  • 优点:对齐效果极致,能精准捕捉人类的细粒度偏好(如简洁性、逻辑性、友好度),是大模型对齐的'行业标杆';
  • 缺点:流程极其复杂(三步均需独立训练和调参)、工程成本极高(大量人类偏好标注)、训练稳定性差(强化学习阶段易出现模式崩溃)、样本效率低,普通团队难以落地。
  • 适用场景

    追求极致对齐效果的超大规模大模型研发,如头部厂商的旗舰级大模型(GPT 系列、文心一言、通义千问旗舰版)。

    三、PPO:近端策略优化(Proximal Policy Optimization)

    核心定位

    并非独立的对齐框架,是 RLHF 框架中第三步强化学习微调的核心算法,也是目前大模型强化学习对齐中应用最广泛的策略优化器,替代了传统强化学习(如 TRPO、DDPG)在大模型上的落地难题。

    核心原理

    针对传统强化学习算法计算复杂、训练慢、策略更新步长不可控的问题,PPO 通过裁剪的目标函数限制模型策略的更新步长,让每次参数更新都在'近端'(即策略的微小变化),防止策略突变导致训练崩溃;同时结合 RLHF 的 KL 散度约束,平衡'人类偏好对齐'和'模型基础能力保留'。

    核心改进(相比传统 RL)

    把 TRPO 的复杂数学约束转化为简单的裁剪损失函数,无需计算复杂的二阶导数,实现难度低、训练速度快,且能通过调整裁剪系数灵活控制策略更新的幅度,是为'工程落地'优化的强化学习算法。

    在 RLHF 中的作用

    作为策略优化器,接收 RM 输出的奖励信号,通过迭代更新模型参数,最大化模型生成高奖励回答的概率,是连接'奖励模型'和'最终对齐模型'的核心桥梁。

    优缺点
    • 优点:相比传统 RL 更稳定、易实现、工程落地性强,是 RLHF 的标配算法;
    • 缺点:仍存在样本效率低、调参难度大(裁剪系数、KL 权重需反复调试)、长期训练易出现模式崩溃(模型生成的回答趋同、缺乏多样性)的问题。
    适用场景

    RLHF 框架的强化学习阶段,是大模型强化学习对齐的'基础算法'。

    四、DPO:直接偏好优化(Direct Preference Optimization)

    核心定位

    2023 年提出的RLHF 极简替代方案,目前行业主流的大模型对齐算法,Llama 2、Mistral、通义千问轻量版、文心一言轻量版均基于此,核心是'跳过 RM 和 RL,直接用人类偏好数据优化模型'。

    核心原理

    基于对比学习的思想,摒弃 RLHF 的'奖励模型训练 + 强化学习微调'两步,直接用人类标注的成对偏好数据((指令,优回答 A, 差回答 B))构建偏好损失函数,让模型生成优回答 A 的概率远大于差回答 B 的概率,同时通过正则化项约束模型与 SFT 模型的偏离程度,实现'一步对齐'。

    核心步骤
    1. 训练基础 SFT 模型(同上文);
    2. 收集人类成对偏好数据(仅需标注'哪个回答更好',无需排序/评分,标注成本远低于 RLHF);
    3. 用 DPO 专属损失函数直接微调 SFT 模型,一步得到对齐模型。
    优缺点
    • 优点:流程极简单(仅两步)、无需训练奖励模型、无需强化学习框架、训练超稳定、样本效率高、标注和工程成本低,对齐效果无限接近调优后的 RLHF;
    • 缺点:对齐效果略逊于极致调参的 RLHF,对超大规模模型(千亿参数以上)的细粒度偏好对齐效果仍在持续验证,对偏好数据的多样性要求较高。
    适用场景

    中小规模大模型对齐、大模型的快速迭代研发、成本敏感的企业级大模型落地,是目前90% 以上大模型研发团队的首选对齐算法。

    五、GRPO:广义近端策略优化(Generalized Proximal Policy Optimization)

    核心定位

    PPO 的改进版,针对 PPO 在大模型对齐中存在的训练不稳定、KL 散度约束难调参、样本效率低等问题做了泛化优化,仍属于强化学习算法,可替代 PPO 应用于 RLHF 框架。

    核心原理

    在 PPO 的基础上重新设计了策略更新的目标函数,核心改进点有三:

    1. 将 PPO 的裁剪损失和 KL 散度约束进行深度融合,而非简单的加权求和,让策略更新更平滑;
    2. 引入自适应 KL 权重:根据训练过程中的模型分布变化动态调整 KL 权重,替代 PPO 的固定值,解决

    目录

    1. 大语言模型对齐核心算法浅析:SFT、RLHF、DPO、PPO、GRPO
    2. 一、SFT:监督微调(Supervised Fine-Tuning)
    3. 核心定位
    4. 核心原理
    5. 核心步骤
    6. 优缺点
    7. 适用场景
    8. 二、RLHF:人类反馈的强化学习(Reinforcement Learning from Human Feedback)
    9. 核心定位
    10. 核心原理
    11. 核心三步法(经典流程)
    12. 优缺点
    13. 适用场景
    14. 三、PPO:近端策略优化(Proximal Policy Optimization)
    15. 核心定位
    16. 核心原理
    17. 核心改进(相比传统 RL)
    18. 在 RLHF 中的作用
    19. 优缺点
    20. 适用场景
    21. 四、DPO:直接偏好优化(Direct Preference Optimization)
    22. 核心定位
    23. 核心原理
    24. 核心步骤
    25. 优缺点
    26. 适用场景
    27. 五、GRPO:广义近端策略优化(Generalized Proximal Policy Optimization)
    28. 核心定位
    29. 核心原理
    • 免费图片AI生成工具免费生成了解详情
    • Magick API 一键接入全球大模型注册送1000万token查看
    • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
    • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
    • 100+免费在线小游戏爽一把
    极客日志微信公众号二维码

    微信扫一扫,关注极客日志

    微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

    更多推荐文章

    查看全部
    • Tomcat 安装与配置指南
    • AI 如何革新 PCB 设计:PADS 软件智能辅助功能解析
    • 如何选择不同版本的 Python
    • Ubuntu 20.04 安装 Ollama 及 Open WebUI 部署大模型教程
    • LLaMA 大模型 LoRA 微调实践与部署指南
    • Vheer:免费免登录的 AI 绘画与视频生成工具
    • Python 爬虫实战:爬取网易云热歌榜歌曲
    • Java 大数据在智能家居能源消耗趋势预测与节能策略优化中的应用
    • AirSim 无人机仿真环境部署与配置指南
    • 大模型幻觉纠正与知识蒸馏新进展:HalluEditBench 与 SIKeD 研究解读
    • 在 OpenClaw 中安装百度网页搜索技能
    • 3661 可以被机器人摧毁的最大墙壁数目:离散化与线段树解法
    • PaddleOCR 文本矫正与排序算法解析
    • VS Code 集成 GitHub Copilot 使用指南
    • Le Git Graph 浏览器扩展:GitHub 提交历史可视化指南
    • AI 智能体 Coze 知识库:从入门到实战
    • Whisper-base.en:74M 轻量模型英文语音识别
    • OpenClaw Gateway 部署故障排查:systemctl --user unavailable 问题解析
    • 递归算法入门:汉诺塔与合并有序链表实战解析
    • 在 Windows 上本地运行 DeepSeek 的三步指南

    相关免费在线工具

    • 加密/解密文本

      使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

    • RSA密钥对生成器

      生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

    • Mermaid 预览与可视化编辑

      基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

    • 随机西班牙地址生成器

      随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

    • Gemini 图片去水印

      基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

    • curl 转代码

      解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online