编程 SOTA:SWE-Bench Verified 80.2%、Multi-SWE-Bench 领先
Agent 工具调用与搜索:BrowseComp 等基准突出
办公场景交付:Word / PPT / Excel 金融建模
高吞吐低成本:100 TPS,输出价约为同级的 1/10–1/20
权重开源(HuggingFace / GitHub),支持私有化部署
原生 Spec 能力:编码前主动拆解架构与规划
📋 编辑总结
MiniMax M2.5 是 MiniMax 于 2026 年 2 月发布的「原生 Agent 生产级」大语言模型,在编程(SWE-Bench Verified 80.2%)、工具调用与搜索、办公等场景达到 SOTA,主打高吞吐低成本,权重已开源,适合接进 Agent 与工具链落地。 定价:API 输入 $0.3 / 输出 $2.4 每百万 token;权重开源免费。编辑评分:⭐ 4.5。
MiniMax M2.5 是 MiniM 是什么?
MiniMax M2.5 是 MiniMax 于 2026 年 2 月发布的大语言模型,主打在编程、Agent 工具调用与搜索、办公等真实生产力场景里达到 SOTA,同时把吞吐和成本压到对开发者友好的水平,定位是"既强又能用得起"。
核心功能
编程是它最亮眼的维度:在 SWE-Bench Verified 上取得 80.2% 的成绩,并在 Multi-SWE-Bench 上位列第一,意味着它能真正改仓库、跑测试、修 bug,而不只是聊代码。Agent 工具调用与搜索能力同样突出,BrowseComp 达到 76.3%,在需要多轮检索、调用外部工具的复杂任务上表现稳健,更像一个能自己查资料、自己动手的同事。办公场景里,它能产出 Word、PPT、Excel 金融建模这类可用交付物,而不只是给建议,贴近真实的业务产出。
价格与平台
效率上,M2.5 提供 100 TPS 的高吞吐版本,输出价格约为同级别模型的 1/10–1/20,对需要大规模调用的业务很关键,推理成本不再成为上线的拦路虎。API 定价为输入 $0.3/百万 token(100 TPS 版)、输出 $2.4/百万 token;50 TPS 版本更低,给预算更紧的场景留了余地。权重已开源(HuggingFace / GitHub),可借助 vLLM、SGLang 做私有化部署,兼顾成本与数据可控。
你可以通过 API 或 MiniMax Agent 平台使用它。对既要强编程与 Agent 能力、又在意部署成本和自主性的团队,M2.5 是一个"能干活、也花得起"的选项。
从定位看,M2.5 更偏向"能执行任务的工程模型",而不是闲聊模型——它在 SWE-Bench、BrowseComp 这类需要动手和检索的基准上突出,正说明它适合接进 Agent 和工具链里干活。若你只是想要一个对话助手,它的优势未必完全发挥;但若你在做编程助手、研究 Agent、办公自动化,它的性价比值得认真评估。开源权重则给"必须私有化、不能出网"的场景留了退路,让企业在合规前提下也能用上同等能力。选它,本质上是在为"能落地"而不是"能聊天"付费。
最终结论
从工作流角度,M2.5 最适合接进"需要动手的 Agent"里:写代码、跑检索、填表格,而不是当闲聊框。但它的强项在工程和检索,纯创意写作未必比通用模型突出。建议把它接到你的开发工具链或 MiniMax Agent,用具体任务验证吞吐与成本;对预算敏感又想私有化的团队,开源权重是值得认真评估的退路。
🆚 MiniMax M2.5 竞品对比
| 工具 | 编辑评分 | 价格 | 核心功能 | 平台 |
|---|
| MiniMax M2.5 | ⭐ 4.5 | API 输入 $0.3 / 输出 $2.4 每百万 token;权重开源免费 | 编程 SOTA:SWE-Bench Verified 80.2%、Multi-SWE-Bench 领先、Agent 工具调用与搜索:BrowseComp 等基准突出、办公场景交付:Word / PPT / Excel 金融建模 | Web, API, 开源(本地部署) |
| Gemini | ⭐ 5.0 | 免费版 + Google AI Pro $19.99/月 | 多模态对话(文本/图像/视频/音频/代码)、超长上下文(1M tokens,输入100万/输出6.5万)、最新模型 Gemini 3.7 Flash(2026-08-13 发布):编程/智能体/复杂工作流向,DeepSWE v1.1 65.3%、FrontierCode 1.1 Main 43.6%(大幅超越 3.6 Flash) | Web |
| ChatGPT | ⭐ 4.9 | 免费版(GPT-5.6 Luna 无限文本聊天)+ Go $8/月 + Plus $20/月 + Pro $200/月;API:Astra $10/$50、Sol $5/$30(促销 $4/$20)、Terra $2/$12、Luna $0.2/$1.2 | GPT-6 Astra 旗舰(2026-09-03):约 105 万 token 上下文、12.8 万最大输出,计算机操作、端到端长任务与文档/表格/演示产出能力最强,首个达「Critical」网络安全评级、GPT-5.6 三档模型(Sol 旗舰 1M 上下文 / Terra 中端 / Luna 轻量快速)、免费用户默认 GPT-5.6 Luna + 无限文本聊天(2026-08-06 官方宣布)+ Think 按钮按需深度推理 | Web / iOS / Android |
| 360智脑 | ⭐4.9(aitoollab 编辑评分) | 免费版 + 标准版 ¥49/月 + 专业版 ¥99/月 | 智能对话与知识问答、AI 搜索与文档分析、文本与代码生成 | 本地部署 / Web |
MiniMax M2.5 与 Gemini、ChatGPT、360智脑 同属AI对话赛道:MiniMax M2.5 的 编程 SOTA:SWE-Bench Verified 80.2%、Multi-SWE-Bench 领先 是亮点,价格 API 输入 $0.3 / 输出 $2.4 每百万 token;权重开源免费;竞品各有侧重,可按预算与功能需求选择。
* 对比基于已核查的同赛道竞品数据, 编辑评分代表本站对该工具受欢迎度/实用度的评定。