跳到主要内容
极客日志极客日志面向AI+效率的开发者社区
首页博客我的书AI学习GitHub 精选镜像AI 生图工具UI配色美学关于
搜索内容 / 工具 / 仓库 / 镜像...⌘K搜索
注册
博客列表
编程语言AI算法

MiniMax-M2.5 开源模型发布:编程与智能体性能评测

MiniMax-M2.5 是一款在编程、智能体工具使用及搜索任务上达到业界顶尖水平的开源模型。该模型基于数十万复杂现实场景强化学习训练,支持十余种编程语言,具备架构规划能力。SWE-Bench Verified 通过率达 80.2%,推理速度比前代快 37%。成本方面,以每秒 100 token 运行一小时仅需 1 美元。此外,模型在办公场景、搜索工具调用及强化学习框架 Forge 等方面均有显著优化,适合构建高经济价值的智能体应用。

zhang发布于 2026/3/26更新于 2026/9/1092 浏览
MiniMax-M2.5 开源模型发布:编程与智能体性能评测

MiniMax-M2.5 模型发布

MiniMax-M2.5 在数十万复杂现实场景中通过强化学习进行广泛训练,在编程、智能体工具使用与搜索、办公及一系列高经济价值任务上达到业界顶尖水平。其 SWE-Bench Verified 通过率 80.2%、Multi-SWE-Bench 51.3%、BrowseComp(含上下文管理)76.3% 的表现尤为亮眼。

经过高效推理与任务分解优化训练,M2.5 执行复杂智能体任务时展现惊人速度,完成 SWE-Bench Verified 评估比 M2.1 快 37%,与 Claude Opus 4.6 速度持平。

M2.5 是首个让用户无需顾虑成本的尖端模型,真正实现'智能廉价如水电'的承诺。以每秒 100 token 的速度持续运行一小时仅需 1 美元。若降至每秒 50 token,成本可低至 0.3 美元。

编程表现

在编程评估中,MiniMax-M2.5 相较前代取得显著进步,达到业界顶尖水准。其多语言任务表现尤为突出。

编程能力对比

相较于前代模型的显著提升在于,M2.5 具备了建筑师般的思维规划能力。该模型在训练过程中展现出编写技术方案(Spec)的倾向:在编写任何代码之前,M2.5 会主动从资深软件架构师视角对项目的功能模块、结构设计和界面交互进行拆解规划。

M2.5 基于 20 余万真实开发环境数据训练,支持包括 Go/C/C++/TypeScript/Rust/Kotlin/Python/Java/JavaScript/PHP/Lua/Dart/Ruby 等 10 余种编程语言。其能力远不止于修复 BUG,而是在复杂系统开发全周期均展现出可靠表现:从 0 到 1 的系统设计与环境搭建,1 到 10 的系统开发,10 到 90 的功能迭代,直至 90 到 100 的完整代码审查与系统测试。涵盖 Web/Android/iOS/Windows 等多平台全栈项目,包含服务端 API/业务逻辑/数据库等完整模块。

为评估这些能力,我们还将 VIBE 基准测试升级为更具挑战性的 Pro 版本,大幅提升任务复杂度、领域覆盖度和评估精准度。总体而言,M2.5 表现与 Opus 4.5 相当。

VIBE-Pro 对比

我们重点关注了模型在分布外测试框架上的泛化能力。通过不同编程代理框架在 SWE-Bench Verified 评估集上测试性能表现:

  • Droid 框架:79.7 分 (M2.5 模型) > 78.9 分 (Opus 4.6 模型)
  • OpenCode 框架:76.1 分 (M2.5 模型) > 75.9 分 (Opus 4.6 模型)

搜索和工具调用

搜索与工具调用

有效的工具调用和搜索是模型自主处理更复杂任务的前提。在 BrowseComp、Wide Search 等基准测试中,M2.5 都实现了业界领先的性能表现。同时模型的泛化性也有所提升——M2.5 在面对不熟悉的脚手架环境时展现出了更稳定的性能。

在专业人类专家执行的研究任务中,使用搜索引擎只是流程中的一小部分;大部分工作需要在信息密集的网页中进行深度探索。为此我们构建了 RISE(Realistic Interactive Search Evaluation)来测量模型在真实专业任务中的搜索能力。结果显示 M2.5 在真实场景的专家级搜索任务中表现卓越。

相较于前代模型,M2.5 在处理智能体任务时也展现出更优的决策能力:它学会了用更精准的搜索轮次和更好的 token 效率来解决问题。例如在 BrowseComp、Wide Search 和 RISE 等多个智能体任务中,M2.5 都用更少的轮次取得了更好的结果,相比 M2.1 减少了约 20% 的轮次使用量。

办公场景

M2.5 被训练为能在办公场景中产出真正可交付的成果。为此我们与金融、法律、社会科学等领域的资深专家展开了深度合作。他们设计需求、提供反馈、参与标准制定,并直接参与数据构建,将行业内的隐性知识带入了模型的训练流程。基于此,M2.5 在 Word、PPT、Excel 财务建模等高价值工作场景中实现了显著的能力提升。

在评估侧,我们构建了内部协作智能体评估框架(GDPval-MM),通过成对比较同时评估交付物的质量和智能体轨迹的专业性,同时监控全流程的 token 开销来估算模型在现实场景中的生产力收益。与其他主流模型的对比中取得了 59.0% 的平均胜率。

办公场景评估

效率

现实世界充满截止日期与时间限制,任务完成速度是实际刚需。模型完成任务耗时取决于其任务分解效能、token 利用效率和推理速度。M2.5 原生服务速率达每秒 100 个 token,是其他前沿模型的近两倍。此外,我们的强化学习机制激励模型进行高效推理与最优任务分解。基于这三大因素,M2.5 在复杂任务中能实现显著的时间节省。

以 SWE-Bench Verified 测试为例,M2.5 平均每个任务消耗 352 万 token,而 M2.1 消耗 372 万 token。得益于并行工具调用等能力提升,端到端运行时间从平均 31.3 分钟降至 22.8 分钟,提速 37%。该运行时间与 Claude Opus 4.6 的 22.9 分钟持平,而单任务总成本仅为后者的 10%。

成本

我们设计 M2 系列基座模型的目标是实现复杂智能体应用无需顾虑成本。M2.5 已接近达成该目标。我们发布 M2.5 和 M2.5-Lightning 两个版本,能力相同但速度有别。M2.5-Lightning 稳态吞吐达每秒 100token,比其他前沿模型快两倍,输入 token 百万成本 0.3 美元,输出 token 百万成本 2.4 美元。吞吐 50token/秒的 M2.5 成本减半。两版本均支持缓存,按输出价格计算,M2.5 成本仅为 Opus、Gemini 3 Pro 和 GPT-5 的十分之一至二十分之一。

以每秒 100 输出 token 计算,M2.5 连续运行一小时成本 1 美元;50TPS 时价格降至 0.3 美元。换言之,1 万美元可维持 4 个 M2.5 实例全年不间断运行。

进化速率

从去年 10 月下旬至今的三个半月里,我们相继发布 M2、M2.1 和 M2.5,模型进化速度超出最初预期。在备受推崇的 SWE-Bench Verified 基准测试中,M2 系列的进步速度显著快于 Claude、GPT 和 Gemini 等同类模型家族。

进化速率

强化学习的规模化发展

上述进展的核心驱动力之一在于强化学习的规模化应用。随着模型训练过程的推进,我们也在持续收获其能力提升带来的效益。目前公司内部绝大多数任务与工作场景均已转化为强化学习的训练环境,此类环境数量迄今已达数十万量级。与此同时,我们在智能体强化学习框架、算法设计、奖励信号机制及基础设施工程等领域开展了系统性工作,以支撑强化学习训练的持续规模化扩展。

Forge——原生智能体强化学习框架

我们自主研发的原生智能体强化学习框架 Forge,通过引入中间层实现了底层训练 - 推理引擎与智能体的完全解耦。该架构既能支持任意智能体的集成,又能优化模型在智能体框架与工具间的泛化能力。为提升系统吞吐量,我们优化了异步调度策略以平衡系统吞吐与样本非策略性,并创新设计了树状结构训练样本合并策略,最终实现约 40 倍的训练加速效果。

Forge 架构

智能体强化学习算法与奖励设计

在算法层面,我们延续使用了去年初提出的 CISPO 算法,以确保混合专家模型在大规模训练中的稳定性。针对智能体推演中长上下文带来的信用分配难题,我们引入了过程奖励机制,实现对生成质量的端到端监控。此外,为深度契合用户体验,我们通过智能体轨迹评估任务完成时长,实现了模型智能度与响应速度的最优平衡。

奖励设计

本地化部署指南

从 HuggingFace 仓库下载模型:https://huggingface.co/MiniMaxAI/MiniMax-M2.5

推荐使用以下推理框架(按字母顺序排列)部署模型:

SGLang 框架

建议使用 SGLang 框架部署 MiniMax-M2.5 模型。

vLLM

推荐使用 vLLM 来部署 MiniMax-M2.5。

Transformers

推荐使用 Transformers 来部署 MiniMax-M2.5。

KTransformers

推荐使用 KTransformers 来部署 MiniMax-M2.5。

ModelScope

你也可以从 modelscope 获取模型权重。

推理参数

推荐使用以下参数以获得最佳性能:temperature=1.0,top_p = 0.95,top_k = 40。默认系统提示:

You are a helpful assistant. Your name is MiniMax-M2.5 and is built by MiniMax.

附录

M2.5 的更多基准测试结果:

BenchmarkMiniMax-M2.5MiniMax-M2.1Claude Sonnet 4.5Claude Opus 4.5Claude Opus 4.6Gemini 3 ProGPT-5.2 (thinking)
AIME2586.383.088.091.095.696.098.0
GPQA-D85.283.083.087.090.091.090.0
HLE w/o tools19.422.217.328.430.737.231.4
SciCode44.441.045.050.052.056.052.0
IFBench70.070.057.058.053.070.075.0
AA-LCR69.562.066.074.071.071.073.0

评估方法说明:SWE 基准测试使用 Claude Code 作为脚手架进行测试,覆盖默认系统提示词,结果取 4 次运行平均值。Terminal Bench 2 统一沙箱规格至 8 核 CPU 和 16GB 内存,超时 7,200 秒。VIBE-Pro 为内部基准,使用自动化验证程序交互逻辑。BrowseComp 和 Wide Search 采用 WebExplorer 智能体框架。RISE 为内部基准,评估复杂网络交互场景下的多步信息检索与推理能力。GDPval-MM 基于开源 GDPval 测试集,由 LLM-as-a-judge 对完整轨迹进行判断。MEWC 基于 Excel 电竞比赛赛题构建。AIME25 ~ AA-LCR 基于 Artificial Analysis 智能指数排行榜公开评测集及评测方法获得。

目录

  1. MiniMax-M2.5 模型发布
  2. 编程表现
  3. 搜索和工具调用
  4. 办公场景
  5. 效率
  6. 成本
  7. 进化速率
  8. 强化学习的规模化发展
  9. Forge——原生智能体强化学习框架
  10. 智能体强化学习算法与奖励设计
  11. 本地化部署指南
  12. SGLang 框架
  13. vLLM
  14. Transformers
  15. KTransformers
  16. ModelScope
  17. 推理参数
  18. 附录

更多推荐文章

查看全部
  • Llama-2-7b在昇腾NPU上的六大核心场景性能基准
  • Python 副业渠道推荐与接单注意事项
  • 二叉树算法实战:美国血统重建与深度宽度计算
  • 接口测试全流程自动化:基于 AI 的实战方案
  • 多款常用 C++ 在线编译与运行平台对比
  • Ubuntu 25.04 安装向日葵远程桌面详细教程
  • Claude Code macOS 安装与配置指南
  • 利用 LangChain 与大模型自动化生成测试用例
  • 适合 Java 算法刷题的优质网站推荐
  • Agentic AI 学习笔记:智能体原理与工作流设计
  • Linux System V 标准简介
  • Docker Desktop 启动报错虚拟化支持未检测到的解决方法
  • 原生多模态 AI 架构:统一训练、跨模态推理与性能优化
  • 基于西门子 TIA、PLCSIM Advanced 与 Kepware 的 Fanuc 机器人虚拟仿真调试
  • Ubuntu 20.04 安装 Ollama 及 Open WebUI 部署 LLM 指南
  • BeyondMimic 人形机器人舞蹈训练及 rl_sar 部署实践
  • C++ 高精度时间库 chrono 详解
  • ToDesk、顺网云与海马云部署 DeepSeek 模型横向评测
  • SQL Server 配置管理器无法打开的解决方法
  • C++ 高精度时间库 chrono 详解

相关免费在线工具

  • 加密/解密文本

    使用加密算法(如AES、TripleDES、Rabbit或RC4)加密和解密文本明文。 在线工具,加密/解密文本在线工具,online

  • RSA密钥对生成器

    生成新的随机RSA私钥和公钥pem证书。 在线工具,RSA密钥对生成器在线工具,online

  • Mermaid 预览与可视化编辑

    基于 Mermaid.js 实时预览流程图、时序图等图表,支持源码编辑与即时渲染。 在线工具,Mermaid 预览与可视化编辑在线工具,online

  • 随机西班牙地址生成器

    随机生成西班牙地址(支持马德里、加泰罗尼亚、安达卢西亚、瓦伦西亚筛选),支持数量快捷选择、显示全部与下载。 在线工具,随机西班牙地址生成器在线工具,online

  • Gemini 图片去水印

    基于开源反向 Alpha 混合算法去除 Gemini/Nano Banana 图片水印,支持批量处理与下载。 在线工具,Gemini 图片去水印在线工具,online

  • Base64 字符串编码/解码

    将字符串编码和解码为其 Base64 格式表示形式即可。 在线工具,Base64 字符串编码/解码在线工具,online