DeepSeek V4.1 Flash 发布:552B 最小尺寸反超旗舰 V4 Pro、升级还降价,9月14日起 V4 Pro 正式下线
2026年9月10日 DeepSeek 发布 V4.1 Flash:552B MoE 非对称架构,输入只激活 8B、输出激活 16B,1M 上下文原生多模态,在性能/费用/速度上全面超越 V4 Pro。本文拆解新架构、基准数据、API 定价与 9月14日 V4 Pro 重路由的迁移要点。
2026 年 9 月 10 日,DeepSeek 发布 DeepSeek-V4.1-Flash,官方标题只有八个字:「更强、更快、更普惠」。但真正值得注意的不是这句宣传语,而是同一份公告里出现的三件不太寻常的事——最小尺寸的模型全面超越自家旗舰、旗舰被安排下线、价格还往下调。
先把结论摆在前面:DeepSeek 这次不是新增了一条产品线,而是用一次发布把整条 API 阵容换掉了。旧的 V4 Flash 与 V4 Flash Vision Exp 已经下线,V4 Pro 从 9 月 14 日起不再以独立模型提供服务、只保留模型名做路由。对任何正在用 DeepSeek API 的项目来说,这是一次必须在几天内处理完的变更。
一、三个关键事实
1. 它最小,但它最强
V4.1 Flash 是 DeepSeek 全新模型结构系列中尺寸最小的一款,却具备原生多模态视觉理解能力,并且在官方口径与多方测试中都全面超越包括 DeepSeek-V4-Pro 在内的一众旗舰模型。在 Agentic Benchmark 等测试里,它还超过了 智谱 GLM 5.3、Kimi K3 等前沿模型。
2. 老模型被「退役」,而不是「保留」
V4 Flash 与 V4 Flash Vision Exp 直接下线。出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会暂时路由到 V4.1 Flash——你的旧调用不会报错,但底层换人了。
3. 旗舰 V4 Pro 被安排下线
这是最重的一刀。公告原文是:「经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 DeepSeek V4 Pro,因此我们计划有序下线 V4 Pro 模型。」北京时间 2026 年 9 月 14 日 12:00 之后,直到未来的 V4.1 Pro 上线之前,所有访问 deepseek-v4-pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 的单价计费。
翻译成不那么官方的说法:你还在用 Pro,但从周日中午开始,你实际上在用 Flash,只是请求里的模型名没变。对绝大多数人是好事——单价掉下来了;但如果你的业务依赖 Pro 的特定行为(输出风格、知识深度、拒绝边界),这就是一次静默的模型替换,必须自己跑回归。
二、架构拆解:552B 参数,输入只激活 8B
V4.1 Flash 的参数结构是这次发布里最反直觉的部分。
它总参数 552B,属于 MoE(混合专家)架构,但采用了全新的 Causal Encoder–Decoder 结构,输入与输出非对称:处理输入(prefill)时只激活 8B 参数,生成输出(decode)时激活 16B。
这个设计的商业含义很直接。Prefill 阶段决定「读长文档、吃大上下文」的成本,8B 激活意味着可以把很长的上下文塞进去而不至于成本爆炸;decode 阶段决定「写出来」的质量,16B 激活保留了这个环节的表达能力。同一个模型,读写两侧用不同的算力预算——这就是「更少成本、更多智能」的工程落点。
配套的第二个优化是 KV Cache 压缩。相比上一代,V4.1 Flash 的 KV cache 只需要:
- 约 1/4 的 HBM(显存)占用;
- 约 1/8 的 SSD 存储占用。
这一点对做 Agent 的人尤其关键。DeepSeek 在公告里直接点明:缓存命中费用往往占据 Agent 成本的很大一块,把缓存压下来,等于把单个任务的成本直接压下来。如果你的系统里有一个不变的长系统提示词、一份反复引用的知识库文档,这部分开销的下降会非常直观。
上下文能力同步升级:1M token 上下文,最大输出 384K token,原生支持图像输入(单张图片按官方文档上限折算为输入 token)。
三、基准数据:反超了多少,哪里还落后
DeepSeek 这次公布了与 V4 Pro 的直接对比,几条关键的如下:
| 基准 | DeepSeek V4.1 Flash | DeepSeek V4 Pro |
|---|---|---|
| DeepSWE v1.1(真实软件工程) | 74.2 | 62.7 |
| Terminal-Bench 2.1(终端 Agent) | 90.6 | 87.9 |
| HLE(人类最后考试 · 知识密集型) | 36.8 | 42.7 |
需要说清楚的是:不是所有维度都赢。在部分知识密集型基准上,V4.1 Flash 仍然落后于 V4 Pro(例如 HLE 约 36.8 对 42.7)。这符合「小激活参数 + 强 Agent 能力」的技术取向——它被优化成一个能长时间跑工具调用的执行者,而不是一部百科全书。对做 Agent、写代码、跑工作流的人是净收益;对纯知识问答类场景,反而不构成升级。
四、定价:一次罕见的「升级还降价」
模型升级通常伴随涨价,而 V4.1 Flash 是每一条都比上一代便宜。人民币计价(每百万 token),新价格已于 2026 年 9 月 10 日 12:00 生效:
| 计费项 | 闲时 | 高峰 |
|---|---|---|
| 输入 · 缓存命中 | 0.02 元 | 0.04 元 |
| 输入 · 缓存未命中 | 1.0 元 | 2.0 元 |
| 输出 | 4.0 元 | 8.0 元 |
- 峰时窗口:周一至周五 9:00–12:00 与 14:00–18:00(北京时间);其余时间包括整个周末都按闲时计费。
- 闲时价格恰为高峰的一半。
三个值得注意的算术:
- 缓存命中价只有未命中的 1/50(闲时 0.02 元 vs 1.0 元)。任何有固定系统提示词、固定文档上下文的业务,都应该先把缓存打好,这一条比换模型省得多。
- 输出比输入贵 4 倍(闲时输入 1.0 元、输出 4.0 元)。控制生成长度、让模型少说废话多调用工具,是第二个省钱杠杆。
- 错峰能省一半。批处理、离线索引、夜间数据清洗全部挪到闲时,账面直接腰斩。
另外,V4.1 Flash 已在 Hugging Face 开源权重并发布技术报告。但自托管门槛被抬高了:checkpoint 体积约为 V4 Flash 的 3 倍(FP8 约 510GB),实际起步是 8 卡节点,官方提到大规模部署需要 2000 卡 GPU 加存储集群的量级。换句话说,权重是开放的,但「便宜」这件事眼下主要在 API 侧成立。
五、9 月 14 日之前,开发者该做的四件事
- 换模型名:新调用统一用
deepseek-flash。继续用deepseek-v4-flash虽然暂时能通,但那是一条兼容路由,不是长期契约。 - 回归测试 V4 Pro 依赖项:9 月 14 日 12:00 后 Pro 的请求会被静默换到 Flash。凡是依赖 Pro 特定输出风格、知识深度、拒绝边界的业务,现在就要跑一遍新旧对照。
- 重估多模态链路:V4.1 Flash 原生支持图像输入。原来走「视觉模型 + 文本模型」两段串联的项目,可以评估合并成一次调用,省掉一次网络往返和一份上下文拼接成本。
- 重算成本模型:把缓存命中率、输入输出比例、可错峰比例三个参数代进新价格表。多数业务的结论会是「成本下降」,但降幅取决于你的缓存设计,而不是模型名。
生态侧也有信号:DeepSeek 公告点名 WorkBuddy(含 CodeBuddy)与 OpenCode 作为官方合作伙伴,已全量接入 V4.1 Flash。对国内开发者来说,这意味着在中文 Agent 工具链里调用 Flash 的链路已经铺好,不必自己折腾适配。如果你通过聚合平台调用,SiliconFlow(硅基流动)、OpenRouter 这类网关通常会在一两天内跟进,但要注意它们的价格未必等于官方价。
六、和 V4 Pro、GLM 5.3 放在一起看
下面这张信息图,把 DeepSeek V4.1 Flash、即将退出服务的 V4 Pro 与国产旗舰智谱 GLM 5.3 放在同一组维度上做了对比,可以一眼看出这次换代到底改变了什么。
几个判断可以直接给:
- 如果你现在用 V4 Pro:不用抢时间迁移,9 月 14 日之后会被自动迁过去,价格还降了。但要提前做一次回归,别等线上出问题才发现行为变了。
- 如果你在挑国产开源模型:V4.1 Flash 现在是「Agent 长任务 + 原生多模态 + 低单价」这一格里的强候选,尤其适合需要 1M 上下文、需要长时间跑工具循环的场景。
- 如果你在意纯知识问答精度:注意 HLE 这类基准上它仍落后 Pro,选型要按自己的评测集说话,不要只看「全面超越」四个字。
横向看国产同代模型:GLM 5.3 在中文理解与办公场景打磨得更细,Kimi K3 走「超大参数 + 开源权重」路线,Qwen3.8-Max 坚持 2.4 万亿参数的超大杯方向,腾讯混元 Hy4 押注 1M 上下文与 770B 规模。DeepSeek 这次选的是最反直觉的一条:把总参数写大、把激活参数写小、把价格写低,然后用「下线自家旗舰」来证明这条路有效。
七、这件事真正的意义
过去两年,行业默认的叙事是「更强的模型 = 更多的参数 + 更多的算力」。V4.1 Flash 给出的替代叙事是:同样的智能,可以装在更小的激活预算里跑出来。
背后有两层推动力。一层是技术:MoE 路由、非对称 encoder-decoder、KV cache 压缩,让「总参数大、激活参数小」从理论变成可交付。另一层是商业:Agent 是 2026 年最主要的 token 消耗方,而 Agent 的特征是长上下文 + 高频工具调用 + 反复重放同样的前缀——这恰好是缓存、prefill 成本、吞吐量最敏感的工作负载。谁把这三件事做便宜,谁就拿走 Agent 市场。
对普通用户和中小团队的直接影响是:AI 应用的单位成本会继续快速下降。当一个能跑 1M 上下文、能看图、能连续调几百轮工具的模型,价格跌到每百万输出 token 4 元人民币,很多以前「算不过来」的产品形态会突然成立——全量文档索引、长期记忆 Agent、批量自动化流程都会重新变得可行。
对国产大模型格局的影响同样明确:DeepSeek、千问、讯飞星火、豆包、腾讯混元 已经集体进入「效率竞赛」阶段。比的不再是谁先摸到参数天花板,而是谁能在同等成本下多产出多少可用智能。这对开发者是绝对利好,对靠「堆规模讲故事」的厂商则是一次压力测试。
三句话总结
- V4.1 Flash 是「最小尺寸反超旗舰」的样本:552B 总参数、8B/16B 非对称激活、1M 上下文、原生多模态。
- 9 月 14 日 12:00 起 V4 Pro 请求全部路由到 V4.1 Flash 并按 Flash 单价计费——在用 Pro 的项目请提前回归测试。
- 价格是罕见的「升级还降价」,但真正的省钱杠杆在缓存设计、输出长度控制与错峰执行,不在模型名。
以上信息整理自 DeepSeek 官方公告、官方技术报告与公开报道,具体接口参数、计费规则与模型生命周期请以 DeepSeek 官网为准。