Step 3.7 Flash 是阶跃星辰(StepFun)于 2026 年 5 月发布并开源的旗舰级多模态推理模型,专为生产级 Agent 打造。采用稀疏 MoE 架构,总参数约 198B(含 1.8B 视觉编码器),每次推理仅激活 11B,最高速度 400 tokens/s,上下文窗口与最大输出均达 256K,以 Apache 2.0 在 GitHub、Hugging Face、ModelScope 同步开源并提供按量计费 API。 定价:输入 $0.20/百万 tokens,输出 $1.15/百万 tokens,缓存读取 $0.04/百万 tokens(模型权重开源免费)。编辑评分:⭐ 4.6。
Step 3.7 Flash 是什么?
Step 3.7 Flash 是阶跃星辰(StepFun)于 2026 年 5 月 28/29 日发布并开源的旗舰级多模态推理模型,定位非常清晰:专门为生产级 Agent 打造。它采用稀疏 MoE 架构,总参数约 198B(其中视觉编码器 1.8B),每次推理仅激活 11B,因此在保持大模型能力的同时把推理成本和延迟压了下来。官方给出的速度上限是 400 tokens/s,上下文窗口 256K,最大输出也达到 256K。模型以 Apache 2.0 协议在 GitHub、Hugging Face 和 ModelScope 同步开源,并提供按量计费的 API,开发者既可以本地部署,也可以直接调用云端。
核心功能
- 高速多模态推理:稀疏 MoE 让 11B 激活参数跑出接近旗舰的体验,最高 400 tokens/s,特别适合高频、多轮的 Agent 场景。
- 原生视觉理解:能直接读取产品 UI、文档、图表、表格和自然场景,并基于看到的内容写代码或调用工具;内置 Python 工具可在任务中途裁剪、缩放、标注图像。
- 三档推理强度:支持 low/medium/high 推理强度,按任务复杂度灵活切换成本与质量。
- 高可靠工具调用:在长程多轮工作流中稳定调用 API、浏览器、终端、Office 与外部系统,降低跑偏与失败概率。
- 主动搜索验证:把搜索当作推理的一部分,信息不确定时主动发起检索做交叉验证。
版本/套餐对比
模型权重本身开源免费;API 按 token 计费,输入 $0.20/百万 tokens,输出 $1.15/百万 tokens,缓存读取 $0.04/百万 tokens,无订阅门槛,用量越大边际成本越低。
值不值得用?
如果你在搭 Agent,Step 3.7 Flash 很值得试。它的核心卖点不是参数规模,而是以小博大——用约十分之一于主流旗舰的参数,在 SWE-Bench Pro(56.3%)、Terminal-Bench 2.1、τ-bench Telecom(98%+)等 Agent 基准上拿到媲美更大模型的成绩,且速度与成本明显占优。对成本敏感、又需要稳定工具调用的团队尤其合适。
使用建议
- 优先通过 OpenClaw、Claude Code、Hermes Agent 等已适配框架接入,省去自己写工具编排。
- 高频短任务用 low/medium 强度控成本,复杂推理再切 high。
- 本地部署需准备足够显存与算力;轻量验证建议先走 API。
适合谁用?(三档)
- 重度用户:做生产级 Agent、需要稳定工具调用与长上下文的团队,直接上 API 或本地部署。
- 中度用户:个人开发者想把多模态能力塞进工作流,先用免费开源权重跑通 Demo。
- 轻度用户:偶尔需要视觉理解或文档处理的普通用户,用第三方封装的聊天入口即可。