跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客GitHub 精选镜像AI 生图工具UI配色美学隐私政策关于联系
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
PythonAI算法

批判微调 CFT:以 1/140 成本实现媲美 DeepSeek-R1 的数学推理能力

批判微调 CFT 是一种受人类批判性思维启发的新范式,旨在让模型学习对有噪声的回答进行批判而非简单模仿。在 Qwen2.5 等基础模型上,CFT 在六个数学基准测试中较 SFT 平均提升 4-10%。该方法仅需在 8 块 H100 GPU 上训练 1 小时,计算成本减少 144 倍,性能可匹敌基于强化学习的 DeepSeek-r1 复制模型。通过构建包含 5 万样本的 WebInstruct 数据集并利用 GPT-4o 生成批评数据,CFT 有效增强了模型的深度分析和细致理解能力,解决了标准 SFT 忽视批判性思维的问题。

LinuxPan发布于 2025/2/6更新于 2026/7/2244 浏览
批判微调 CFT:以 1/140 成本实现媲美 DeepSeek-R1 的数学推理能力

批判微调 CFT:低成本媲美 DeepSeek-R1,超越传统 SFT 数学推理

DeepSeek R1/R1-Zero 让强化学习(RL)在大型语言模型领域大火,但这是否意味着监督微调(SFT)已无用?滑铁卢大学与卡内基梅隆大学联合提出了一种全新范式——批判微调(CFT: Critique Fine-Tuning,已开源)。该方法的核心在于让模型学习对有噪声的回答进行批判,而不是简单地模仿正确的回答。

在 Qwen2.5、Qwen2.5-Math 和 DeepSeek-Math 等不同基础模型上,CFT 在六个数学基准测试中相较于 SFT 平均提高了 4-10%。这一成果表明,通过引入批判性思维机制,可以在极低计算成本下获得接近甚至超越基于强化学习复现模型的性能。

CFT 核心原理

CFT受到强调批判性思维的人类学习过程的启发,鼓励模型进行更深入的分析和细致的理解。这些特质通常被标准的 SFT 所忽视。标准 SFT 仅关注输入到输出的映射,而 CFT 引入了中间环节的评估机制,迫使模型识别错误并修正逻辑。

数据集构建

为了训练 CFT 模型,研究团队从 WebInstruct 数据集中构建了一个包含 50,000 个样本的数据集。使用 GPT-4o 作为'教师'模型来生成 Critique(批评),形式为([问题;有噪声的回答],批评)。这种构造方式模拟了人类在学习过程中发现错误并纠正的过程。

图 1:CFT 数据集构建流程

模型训练目标

CFT 的目标是训练模型对给定的查询 - 回答对进行批判,最大化生成批判的概率 $P(c|[x;y])$,其中 $c$ 是查询 - 回答对 $[x;y]$ 的标注批判。这意味着模型不仅要学会回答问题,还要学会判断回答的质量。

图 2:CFT 训练目标示意图

实验对比分析

为了评估 CFT 的有效性,在三个 7B 参数规模的基础模型上,使用数学推理基准测试将其与各种 SFT 方法进行比较。所有实验均使用 WebInstruct 子集进行训练。CFT 在六个数学基准测试中相较于 SFT 平均提高了 4-10%。

SFT 与 CFT 性能对比

在 WebInstruct 的 50,000 个样本上,CFT 与 SFT 的比较显示显著优势。SFT-verified 表示在经过 GPT-4o 验证的回答上进行的 SFT 训练,SFT-GPT4o 表示在 GPT-4o 生成的回答上进行的 SFT 训练。CFT 在 GPT-4o 提供的批评上进行训练,展现了更强的鲁棒性。

图 3:CFT 与 SFT 性能对比

小模型与大模型的较量

将 7B 参数规模的 CFT 模型与其他不同规模的竞争模型进行比较。扩展了评估基准,以涵盖更广泛的 STEM 主题。Qwen2.5-Math-CFT 模型仅需在 8 块 H100 GPU 上训练 1 小时,即可在大多数基准测试中与使用超过 200 万样本训练的强大竞争对手 Qwen2.5-Math-Instruct 相媲美,甚至超越它们。

图 4:Qwen2.5-Math-CFT 与其他模型对比

与强化学习(RL)方法的对比

比较了不同基于强化学习的方法在数学推理中的效率和性能:

  • CFT 在计算成本上减少了 144 倍,还能与 SimpleRL 相匹配。SimpleRL 是基于 DeepSeek-r1 复制的模型。
  • 在 Minerva-Math 和 AMC23 等严格的数学测试中表现出色。

图 5:CFT 与 RL 方法效率对比

案例研究

案例 1:连续分数运算

CFT 模型保持精确的逐步计算,显示每个中间分数。原始模型采用正确的方法,但在最后几步中出现计算错误。CFT 在追踪和计算连续分数乘法方面表现出更强的能力,这得益于其批判机制对每一步计算的自我校验。

图 6:连续分数运算案例

案例 2:几何面积问题

尽管两种模型都正确地应用了勾股定理,但它们在组合面积的方法上存在显著差异。CFT 模型正确识别出五边形是正方形和三角形面积的总和。SFT 模型在概念上犯了一个关键错误,错误地减去而不是加上面积。这表明 CFT 在空间推理和逻辑一致性上优于传统 SFT。

图 7:几何面积问题案例

案例 3:工人效率问题

CFT 模型始终保持对问题核心概念(工作效率和时间)的清晰关注。SFT 模型在问题解读和解决方案方法上表现出显著的混乱。CFT 在处理涉及不同类型工人的多步率问题方面表现出更强的能力,能够准确提取变量关系。

图 8:工人效率问题案例

图 9:综合案例展示

技术深度解析

为什么 CFT 有效?

传统的 SFT 假设训练数据是完美的,模型只需拟合分布。然而,真实世界的数据往往包含噪声或次优解。CFT 通过引入批判信号,实际上是在训练一个判别器(Discriminator)与生成器(Generator)协同工作。当模型面对有噪声的回答时,它必须生成一段批判文本,这段文本隐含了对正确路径的推导。这种隐式的推理过程增强了模型内部的知识表征。

计算成本优势

强化学习(如 PPO、DPO)通常需要大量的采样和奖励模型交互,计算开销巨大。CFT 本质上仍是一个监督学习任务,只需要一次前向传播来计算损失。这使得它在资源受限的场景下极具吸引力。对于 7B 模型,CFT 的训练时间仅为数小时,而同等性能的 RL 方法可能需要数天。

泛化能力

由于 CFT 训练的是批判能力而非特定答案,这种能力具有更好的泛化性。模型学会了如何思考问题的正确性,而不仅仅是记忆正确答案的模式。这在处理未见过的复杂数学问题时尤为明显,模型能够自主发现逻辑漏洞。

结论

批判微调(CFT)提供了一种高效且低成本的替代方案,用于提升大模型的推理能力。它证明了在不依赖昂贵强化学习的情况下,通过改进训练范式同样可以逼近甚至达到 SOTA 水平。未来,结合 CFT 与 RL 可能成为进一步提升模型智能的关键方向。

目录

  1. 批判微调 CFT:低成本媲美 DeepSeek-R1,超越传统 SFT 数学推理
  2. CFT 核心原理
  3. 数据集构建
  4. 模型训练目标
  5. 实验对比分析
  6. SFT 与 CFT 性能对比
  7. 小模型与大模型的较量
  8. 与强化学习(RL)方法的对比
  9. 案例研究
  10. 案例 1:连续分数运算
  11. 案例 2:几何面积问题
  12. 案例 3:工人效率问题
  13. 技术深度解析
  14. 为什么 CFT 有效?
  15. 计算成本优势
  16. 泛化能力
  17. 结论
  • 免费图片AI生成工具免费生成了解详情
  • Magick API 一键接入全球大模型注册送1000万token查看
  • 免费图片视频在线生成30秒,将你的创意变成现实开始设计
  • X/Twitter免费视频下载器免登陆无限额度免费视频解析下载了解详情
  • 100+免费在线小游戏爽一把
极客日志微信公众号二维码

微信扫一扫,关注极客日志

微信公众号「极客日志V2」,在微信中扫描左侧二维码关注。展示文案:极客日志V2 zeeklog

更多推荐文章

查看全部
  • 人工智能赋能传统医疗设备改造:路径、挑战与展望
  • 人工智能多模态模型开发与应用:文本图像语音融合实践
  • 多模态模型开发实战:文本、图像与语音融合应用
  • 多模态模型开发实战:文本、图像与语音的融合应用
  • 多模态模型开发实战:文本、图像与语音融合指南
  • 多模态模型开发实战:文本、图像与语音融合应用指南
  • Python 基础语法核心要点
  • Linux 序列化与反序列化原理及自定义协议实现
  • 人工智能:多模态大模型原理与跨模态应用实战
  • 多模态大模型原理与跨模态应用实战
  • AI 鉴伪技术解析:人脸视频、AIGC 图像及文档篡改检测
  • Deepseek 与 Kimi 联动:构建智能 PPT 创作工作流
  • 人工智能:大语言模型(LLM)原理与应用实战
  • 大语言模型(LLM)原理与 LoRA 微调实战
  • 人工智能大模型应用开发:从微调适配到场景落地
  • Agent Skills 设计详解
  • 大模型高效推理与部署技术实战
  • 大模型高效推理与部署技术实战
  • 大模型高效推理与部署技术实战
  • 大模型分布式训练与高效调参技术实战

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • curl 转代码

    解析常见 curl 参数并生成 fetch、axios、PHP curl 或 Python requests 示例代码。 在线工具,curl 转代码在线工具,online