
MiniMax 这次正式发布 MiniMax-M2.5。如果只看一句话,重点不是'又上了一个新模型',而是它把编程、工具调用、搜索、办公这几条线一起往智能体方向推进了。官方给出的几个结果挺醒目:SWE-Bench Verified 80.2%、Multi-SWE-Bench 51.3%、BrowseComp(含上下文管理)76.3%。这类成绩放在一起看,比单独拿一两个榜单更能说明问题。
速度也是这次发布里绕不开的一部分。M2.5 在 SWE-Bench Verified 上比 M2.1 快 37%,耗时和 Claude Opus 4.6 基本持平。对智能体来说,速度不是锦上添花,慢几分钟就可能把一次多轮任务拖成半天,成本也会跟着涨。
成本侧的数字更直接。官方的说法是,M2.5 试图把高强度智能体调用的门槛压到'可以随手开'的程度:每秒 100 token 持续运行一小时约 1 美元,如果降到 50 token/s,还会继续便宜一些。这个量级不一定适合所有场景,但至少说明它不是按'只跑少量高价值请求'的思路设计的。
编程能力
M2.5 的编程能力不是单纯补全代码那一路。它更强调先把需求拆开,再进入实现阶段,训练过程中也明显偏向先写 Spec、再动手写代码。这个顺序看着多一步,做复杂项目时反而更稳,尤其是要同时顾到模块划分、接口和交互的时候。

MiniMax 说 M2.5 基于 20 余万真实开发环境数据训练,覆盖 Go/C/C++/TypeScript/Rust/Kotlin/Python/Java/JavaScript/PHP/Lua/Dart/Ruby 等语言。它面向的也不是只修 bug 的场景,而是从 0 到 1 的系统设计、1 到 10 的开发、10 到 90 的迭代,直到最后的代码审查和测试。Web、Android、iOS、Windows 这些平台都在范围里,后端 API、业务逻辑和数据库也都覆盖到了。
文中把 VIBE 基准升级成了 Pro 版本,任务更难,覆盖更广。结果上,M2.5 的整体表现和 Opus 4.5 接近。这里我更在意的是跨框架表现:在 Droid 和 OpenCode 两套编程代理框架里,M2.5 在 SWE-Bench Verified 上都略高于对比模型。真正落地时,模型能不能适配不同脚手架,比榜单上多零点几分更重要。

搜索和工具调用
工具调用和搜索决定了智能体能不能真正往前推进,而不是卡在'会说不会做'。M2.5 在 BrowseComp、Wide Search 这些基准上表现不错,面对不熟悉的脚手架环境时也更稳定。这个进步不算花哨,但很实用,因为真实任务里出问题的地方常常不是答案本身,而是中间流程。
MiniMax 还做了一个叫 RISE(Realistic Interactive Search Evaluation) 的内部基准,用来测真实专业任务里的搜索能力。它针对的不是简单检索,而是在信息密集的网页里持续追踪、筛选和推理。官方结论是,M2.5 在这类专家级任务里表现更好。
还有一个更具体的变化:在 BrowseComp、Wide Search、RISE 这些任务上,M2.5 用的轮次更少,较 M2.1 约减少 20%。少一轮不只是省一点 token,很多时候意味着少一次误导和重试。







