# 美团 LongCat-2.5-Preview 中秋夜上线：参数持平 2.0、场景转向 Agent，这次连跑分都不发了

9 月 25 日中秋夜，美团 LongCat 系列新模型 LongCat-2.5-Preview 上线：总参数 1.6 万亿（MoE，激活约 48B），100 万 Token 上下文，原生多模态，官方将其定位为长流程 Agent 模型，点名支持终端、浏览器、GUI、电子表格与设计工具等自主操作场景。限时 API 定价为输入 0.3 美元、输出 1.2 美元、缓存输入 0.006 美元每百万 Token，老用户另获 500 万免费 Token。与上一代最大的不同：这次没有公布任何跑分。

![LongCat 官方对话站首页，已集成深度思考、图片与视频生成等能力](https://www.aitoollab.cn/images/articles/meituan-longcat-2-5-preview-agent-2026/longcat-home.png)

## 参数和上一代一样，变的到底是什么？

把规格表与 [LongCat-2.0](/tools/longcat20/) 并排看，会发现 1.6 万亿总参数、约 480 亿激活、100 万上下文三项与 2.0 完全持平。真正变化在两点：一是原生多模态进入基座本体（2.0 时代的美团把视频、图像、语音拆成 LongCat-Video、LongCat-Image 等独立开源仓库）；二是定位从 Agentic Coding 扩展到「自主操作软件」——不只是写代码，而是让模型直接驱动浏览器、表格和设计工具完成长链条任务。

这与中国大模型行业 9 月的整体动作吻合：阿里 [Qwen3.8-Max](/tools/qwen3-8-max/) 强调 16 天自主写出 Agent 框架，[DeepSeek](/tools/deepseek/) 在 9 月 10 日发布主打 Agent 场景的 V4.1 Flash，[Kimi](/tools/kimi/) 的 K3 系列也把 Agent 与多智能体协作列为标配。模型能力的叙事正从「跑分」迁往「连续干完活」。

## 不发跑分，是回避还是成熟？

LongCat-2.0 发布时曾宣称对标业界最优，但部分独立开发者在其后的小规模测试中质疑实际效果，这次 2.5-Preview 干脆不附 benchmark，海外开发者第一时间注意到了这一点（有人直言「这次他们不报跑分了」）。两种解读并存：回避审视，或是吸取上次「宣称与实测脱节」的教训、把判断权交还用户。本文不下结论，以官方后续技术报告与第三方实测为准。

## 怎么用、多少钱？

- 获取：longcat.chat 对话端已集成图片生成、视频生成、深度研究等入口；GitHub 的 meituan-longcat 组织（38 个仓库）暂未出现 2.5 仓库，开源计划官方未披露。
- 价格：限时每百万 Token 输入 0.3 美元、输出 1.2 美元、缓存输入 0.006 美元；现有用户一次性获赠 500 万 Token。
- 门槛：Preview 阶段稳定性和兼容性可能调整，生产环境建议观望。

> 信息图：LongCat-2.5-Preview 与 LongCat-2.0、DeepSeek V4.1 Flash 关键维度对比

![meituan-longcat 的 GitHub 组织页：全模态开源矩阵与 2.0 仓库](https://www.aitoollab.cn/images/articles/meituan-longcat-2-5-preview-agent-2026/github-org.png)

## 一个做外卖的公司，为什么要自研大模型？

美团 2025 年 9 月首次发布 LongCat，一年内累计推出 12 个模型，覆盖文本、图像、语音、视频；上一代 2.0 全程基于国产算力（昇腾 910B）训练，并已开源。此前多家媒体报道美团收紧了对豆包等外部大模型的使用，把核心业务迁向自研体系。对美团而言，模型不是售卖品，而是支撑海量订单调度、客服与商家工具的成本项——2.5 把多模态与 Agent 揉进基座，受益方首先是自己的业务链路，其次才是 API 市场。

对外部用户，这次发布的实际价值是一张低价的 Agent 试验门票：0.3 美元的输入价与 100 万上下文，足够把一段长流程任务完整跑通。它能不能「连续跑几十步还记得最初目标」，要等实测说话。