美团 LongCat-2.5-Preview 中秋夜上线:参数持平 2.0、场景转向 Agent,这次连跑分都不发了

⚡ TL;DR
美团 9 月 25 日发布 LongCat-2.5-Preview:1.6 万亿参数 MoE、约 48B 激活、100 万上下文、原生多模态,官方点名终端、浏览器、GUI、电子表格等自主操作场景。参数规模与 LongCat-2.0 持平,变化在多模态进基座与 Agent 定位;限时定价输入 0.3 美元、输出 1.2 美元每百万 Token,本次未公布 benchmark。

9 月 25 日中秋夜,美团 LongCat 系列新模型 LongCat-2.5-Preview 上线:总参数 1.6 万亿(MoE,激活约 48B),100 万 Token 上下文,原生多模态,官方将其定位为长流程 Agent 模型,点名支持终端、浏览器、GUI、电子表格与设计工具等自主操作场景。限时 API 定价为输入 0.3 美元、输出 1.2 美元、缓存输入 0.006 美元每百万 Token,老用户另获 500 万免费 Token。与上一代最大的不同:这次没有公布任何跑分。

LongCat 官方对话站首页,已集成深度思考、图片与视频生成等能力

参数和上一代一样,变的到底是什么?

把规格表与 LongCat-2.0 并排看,会发现 1.6 万亿总参数、约 480 亿激活、100 万上下文三项与 2.0 完全持平。真正变化在两点:一是原生多模态进入基座本体(2.0 时代的美团把视频、图像、语音拆成 LongCat-Video、LongCat-Image 等独立开源仓库);二是定位从 Agentic Coding 扩展到「自主操作软件」——不只是写代码,而是让模型直接驱动浏览器、表格和设计工具完成长链条任务。

这与中国大模型行业 9 月的整体动作吻合:阿里 Qwen3.8-Max 强调 16 天自主写出 Agent 框架,DeepSeek 在 9 月 10 日发布主打 Agent 场景的 V4.1 Flash,Kimi 的 K3 系列也把 Agent 与多智能体协作列为标配。模型能力的叙事正从「跑分」迁往「连续干完活」。

不发跑分,是回避还是成熟?

LongCat-2.0 发布时曾宣称对标业界最优,但部分独立开发者在其后的小规模测试中质疑实际效果,这次 2.5-Preview 干脆不附 benchmark,海外开发者第一时间注意到了这一点(有人直言「这次他们不报跑分了」)。两种解读并存:回避审视,或是吸取上次「宣称与实测脱节」的教训、把判断权交还用户。本文不下结论,以官方后续技术报告与第三方实测为准。

怎么用、多少钱?

  • 获取:longcat.chat 对话端已集成图片生成、视频生成、深度研究等入口;GitHub 的 meituan-longcat 组织(38 个仓库)暂未出现 2.5 仓库,开源计划官方未披露。
  • 价格:限时每百万 Token 输入 0.3 美元、输出 1.2 美元、缓存输入 0.006 美元;现有用户一次性获赠 500 万 Token。
  • 门槛:Preview 阶段稳定性和兼容性可能调整,生产环境建议观望。
信息图:LongCat-2.5-Preview 与 LongCat-2.0、DeepSeek V4.1 Flash 关键维度对比
美团 LongCat-2.5-Preview 中秋夜上线:参数持平 2.0、场景转向 Agent,这次连跑分都不发了 - 数据对比信息图
美团 LongCat-2.5-Preview 中秋夜上线:参数持平 2.0、场景转向 Agent,这次连跑分都不发了 · 核心数据一览

meituan-longcat 的 GitHub 组织页:全模态开源矩阵与 2.0 仓库

一个做外卖的公司,为什么要自研大模型?

美团 2025 年 9 月首次发布 LongCat,一年内累计推出 12 个模型,覆盖文本、图像、语音、视频;上一代 2.0 全程基于国产算力(昇腾 910B)训练,并已开源。此前多家媒体报道美团收紧了对豆包等外部大模型的使用,把核心业务迁向自研体系。对美团而言,模型不是售卖品,而是支撑海量订单调度、客服与商家工具的成本项——2.5 把多模态与 Agent 揉进基座,受益方首先是自己的业务链路,其次才是 API 市场。

对外部用户,这次发布的实际价值是一张低价的 Agent 试验门票:0.3 美元的输入价与 100 万上下文,足够把一段长流程任务完整跑通。它能不能「连续跑几十步还记得最初目标」,要等实测说话。

❓ 常见问题

LongCat-2.5-Preview 的参数规模有多大?

总参数 1.6 万亿(MoE 架构,激活约 48B),支持 100 万 Token 上下文,原生多模态。参数规模与上一代 LongCat-2.0 持平,差异在于多模态并入基座、以及面向终端/浏览器/GUI/电子表格等长流程 Agent 场景的定位。

LongCat-2.5-Preview 的 API 定价是多少?

限时定价为每百万 Token 输入 0.3 美元、输出 1.2 美元、缓存输入 0.006 美元;现有用户另获 500 万免费 Token 用于评测。官方提示 Preview 阶段稳定性与兼容性可能调整。

LongCat-2.5-Preview 开源了吗?

截至 2026 年 9 月 26 日,官方未披露开源计划;meituan-longcat 的 GitHub 组织(38 个仓库)中暂未出现 2.5 相关仓库。上一代 LongCat-2.0 已开源,对话端可在 longcat.chat 直接体验。

为什么这次没有公布跑分?

官方未解释原因。上一代 LongCat-2.0 发布时曾宣称对标业界最优,但部分独立开发者在小规模测试后质疑实际效果;本次 2.5-Preview 未附任何 benchmark,实际能力建议以官方后续技术报告与第三方实测为准。

关于作者:本文由 AI工具宝箱编辑组 撰写,团队持续追踪并实测主流 AI 工具,月均订阅支出 $200+,所有评测基于真实长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。