Qwen3.8-Max 发布:2.4万亿参数首次开源「超大杯」、16天自主写出一个Agent框架——国产大模型从"会写代码"跨进"会交付项目"(2026年8月)
2026年8月3日阿里发布Qwen3.8-Max:2.4万亿总参数、95B激活、1M上下文、原生视觉,Max级旗舰首次开源权重;同日千问办公QwenWork公测。最硬的证据是它连续自主编程约16天、留下265次提交,自己搓出一个可用的Agent框架。本文拆解规格、跑分真信号、开源意义与四强选型。
先说结论:如果你只想记住一件事,那就是"16天"——Qwen3.8-Max 从一个空文件夹开始,在没有人干预的情况下连续运行约16天,自主搭出了一个真实可用的自进化智能体框架,并在 GitHub 上留下了265次提交。这不是"补全代码",是"交付项目"。国产大模型的能力叙事,在这一天换了一个量级。
2026年8月3日上午,阿里云千问团队正式发布新一代基座大模型 Qwen3.8-Max:总参数量 2.4 万亿(2.4T),单次激活 95B,上下文长度 100 万 tokens,原生支持视觉理解。同一天,阿里旗下企业级 Agent 产品「千问办公」(QwenWork)开启公测。资本市场反应直接:阿里巴巴港股当日收涨 7.01% 报 125.2 港元,成交 239 亿港元;美股盘中涨超 5%。
把时间线拉长一点看,这一周实在太密:7月31日,字节 Seedance 2.5 把单次视频生成拉到 30 秒,MiniMax H3 开源多模态生成模型登顶视频编辑榜,DeepSeek V4-Flash 正式版 API 同日公测;8月3日,阿里 Qwen3.8-Max 压轴。四家国产厂商,三天之内把"参数、开源、Agent、价格"四张牌全打了一遍。
我们此前分别写过 DeepSeek V4-Flash 的后训练暴涨 和 MiniMax H3 与 Seedance 2.5 的视频双响炮。这一篇专门拆 Qwen3.8-Max:它的三件真正值得关注的事、跑分里哪些是真信号、以及它和 Claude Fable 5、Kimi K3、DeepSeek V4 摆在一起该怎么选。
二、Qwen3.8-Max 是什么:2.4T 参数、95B 激活、1M 上下文
先把规格摆清楚,避免被"2.4万亿"这个数字带偏。
| 规格项 | Qwen3.8-Max |
|---|---|
| 总参数量 | 2.4 万亿(2.4T) |
| 单次激活参数 | 95B |
| 架构 | 基于 Qwen3.5 架构,稀疏 MoE + 混合注意力机制联合优化 |
| 上下文窗口 | 1M tokens |
| 多模态 | 原生视觉理解(非外挂 OCR/描述) |
| 开源计划 | 预计下周开源 Max 权重 + Qwen3.8-27B |
| API 定价(国内) | 输入 ¥12/百万 tokens,输出 ¥36/百万,隐式缓存命中 ¥1.5 |
| API 定价(国际) | 输入 $2/百万,输出 $6/百万,缓存 $0.25 |
关键在"2.4T 总参数但只激活 95B"这个比例。 稀疏度接近 1:25,意味着推理时真正参与计算的只有约 4% 的参数。这条路线的取舍很清楚:用极大的参数容量装知识和技能,用极小的激活量控制单次推理成本与延迟。这也是为什么它敢把国内输出价定在 ¥36/百万——如果是稠密 2.4T,这个价格根本跑不出来。
对比一下就更直观:DeepSeek V4 走的是 1.6T 总参数 + 峰谷定价路线,Kimi K3 是 2.8 万亿参数(目前全球最大开源权重之一),Qwen3.8-Max 的 2.4T 卡在中间,但它多了一件别人暂时没做的事:Max 级旗舰第一次开源权重。
三、真正的硬货:16 天、265 次提交、AI 自己搓出一个 Agent 框架
跑分可以刷,Demo 可以剪,但"连续跑16天"这种事很难演。
阿里公布的这个案例是这样的:工程师只给了一句指令——"创建一个自进化的智能体 Harness"。Qwen3.8-Max 从零开始,自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取和执行任务,人类工程师可以通过钉钉给它提新要求。约16天后,它产出了一个 Hermes Agent 级别的、真实可用的自进化智能体框架 oh-my-cli,GitHub 上留下 265 次 commits,整个过程完全公开可查,项目已开源。
这件事为什么重要?因为它切中了当前 AI 编程最难的那一环:长程一致性(long-horizon coherence)。
写一个函数,模型只需要维持几百 token 的上下文;写一个能跑16天的项目,模型要在成千上万次交互中记住自己的架构决策、不推翻昨天的设计、不在第 200 次提交时把第 10 次的接口改崩。过去两年里,绝大多数"AI 自主编程"的翻车都翻在这里——前三天惊艳,第五天开始自我矛盾,第七天代码库变成废墟。
除了 oh-my-cli,阿里还放了几组长周期任务数据,这些比单点跑分更能说明问题:
- 科研复现:连续自主工作约 125 小时,复现 AI Reasoning 相关论文并进行四轮自我进化探索,使其在 AIME24 基准上的得分再提升 2.7 分;
- 竞赛实战:在阿里云天池平台 WWW2025 多模态对话意图识别挑战赛中,24 小时内击败 458 支人类参赛队伍;
- 芯片设计:在沙箱内经历约 500 轮交互,把硬件门数从 8,298 门精简至 678 门;
- 经营模拟:在 365 天长周期电商经营模拟基准 E-Commerce Bench 中,以 416,252 元总资金(4.16 倍回报)取得第一;
- 法务场景:一小时内完成数百份文档、1,284 条条款的标注;
- 量化投研:调度约 330 个子智能体,完成约 6,000 次因子回测。
注意这些任务的共同点:它们都不是"一问一答",而是"派个活,过几天来收"。 这正是 Claude Code、Cursor、OpenClaw 这一批 Agent 工具在 2026 年集体追赶的方向,只不过这一次,能力被压进了基座模型本身,而不是靠外层脚手架硬撑。
四、跑分怎么看:哪些是真信号,哪些是噪音
Qwen3.8-Max 这次的成绩单相当密集,但不是每一项都同等重要。我按"信号强度"排一下。
强信号(值得当真):
| 评测 | Qwen3.8-Max | 参照 | 说明 |
|---|---|---|---|
| PaperBench(科研复现) | 93.0 分 | Fable 5 为 88.8;较上代 +28.2 分 | 长程执行力的直接体现,涨幅异常大 |
| IFBench(指令遵循) | 82.8 分 | Fable 5 为 63.5 | 差距接近 20 分,工程可用性关键项 |
| OSWorld-Verified(电脑操作) | 86.1 分 | 主流模型首位 | GUI Agent 能力,落地价值极高 |
| Arena Frontend Code | 与 Claude Opus 5 High 仅差 1 分 | — | 匿名 PK 榜,人为刷分难度大 |
中等信号(有参考价值,别过度解读):
- TextArena 排名第五(阿里表述为"实验室维度全球第二,仅次于 Anthropic",这两个说法口径不同,别混为一谈);
- VisionArena 排名全球第二;
- CodeArena 全球第四(部分媒体报道为第三,以官方口径为准);
- GPQA Diamond 92.6 分,BabyVision 无工具条件下 82.0 分。
要打问号的: 所有"击败人类队伍""4.16 倍回报"这类叙事型成绩,都是厂商自选场景下的结果,缺乏第三方复现,只能当能力上限的展示,不能当稳定表现的承诺。
我个人最看重的是 IFBench 那 82.8 分。 指令遵循听起来朴素,但它是 Agent 能不能真正干活的地基——一个模型再聪明,如果你说"输出 JSON、不要解释"它偏要写三段前言,那它在自动化流水线里就是不可用的。82.8 对 63.5 这个差距,比任何编程榜单排名都更影响真实工程体验。
五、Max 级首次开源:这一步的分量比参数大
Qwen3.8-Max 预计下周开源权重,同时开源 Qwen3.8-27B。这是千问 Max 级别(俗称"超大杯")模型第一次面向社会开源。
过去几年国内开源模型的惯例是"开源中杯、闭源大杯"——最强的那个留着卖 API,开源出来的是次一档。阿里这次把最强的那个也放了出来,逻辑其实不难推:
- 锁定私有化部署市场。 金融、政务、大型制造这类客户天然要求本地化,模型不开源就进不了门。开源 Max 权重,等于把这块市场的门槛主动拆掉。
- 对冲地缘风险。 2026 年 7 月 阿里已全面禁用 Claude 全系模型,中美 AI 供应链的隔离在加深。此时开源,是给国内生态一个明确的"可自主可控"信号。
- 抢开发者心智。 千问系列本就是全球下载量最大的开源模型族之一,Max 开源会进一步扩大衍生模型和微调生态,反过来给云上 API 导流。
对国内团队的实际影响是:如果你之前因为"最强的用不了"而在开源方案上妥协,下周开始这个理由不成立了。 当然,2.4T 参数的本地部署门槛依然极高,绝大多数团队真正会用的是 27B 版本——而 27B 这个尺寸,恰好是单机多卡可承载的甜点区间,参考我们此前对 本地部署大模型的横评。
六、价格:把"相近智能"卖到 Opus 5 的四折
定价这块阿里给得很直白:
- 国内:输入 ¥12/百万 tokens,输出 ¥36/百万,隐式缓存命中 ¥1.5/百万;
- 国际:输入 $2/百万,输出 $6/百万,缓存 $0.25/百万;
- 官方口径:国际输入、输出价格分别为 Claude Opus 5 的 40% 和 24%。
结合上个月 AI 模型价格战总决战 的走势看,格局已经很清楚了:头部模型的竞争,正在从"谁最强"变成"同等智能谁最便宜"。 DeepSeek V4-Flash 把 ¥1/¥2 的地板价钉死在中低端,Qwen3.8-Max 则在旗舰档位上把 Opus 5 的价格砍掉六成。中间那个"性能一般但价格不便宜"的地带,正在被两头挤压到消失。
隐式缓存命中 ¥1.5 这个数尤其值得注意。对于 Agent 类应用——系统提示词长、工具定义多、多轮反复调用同一批上下文——缓存命中率往往能到 60% 以上。真实账单可能比标价低不少。
七、千问办公 QwenWork:模型发布配一个 Agent 产品,阿里在下什么棋
同日公测的「千问办公」(qwenwork.cn)比模型本身更值得琢磨。它整合了 QoderWork、MuleRun、悟空三款产品,官方称是业内首款同时支持桌面端 Agent、云端 Agent 和企业协同 Agent 的产品,网页版和 PC 客户端已开放,钉钉 PC 端与手机端入口近期开放,后续将出独立 App 和国际版。
它跟市面上多数 Agent 产品的差别在于定位:不是帮个人提效,是帮组织提效。
官方举的例子很具体:一家 20 人的律师事务所,资深律师用千问办公多轮交互完成首份并购尽调报告后,把全过程一键沉淀为"组织级 Skill",向全团队共享。新人接到同类案件,不用逐项请教资深律师,直接调用该 Skill 并选定执行路径即可产出报告。
这个设计的巧妙之处在于,它把"个人的隐性经验"转成了"组织的显性资产"。过去企业上 AI,最大的阻力从来不是模型不够强,而是每个员工都在各自和 AI 单聊,经验无法沉淀、质量无法统一、流程无法复用。组织级 Skill 是对这个痛点的正面回应。
配合打通钉钉 IM、后续连接企业数据库与真实工作流,阿里的意图很明显:用最强模型当矛,用办公入口当盾,把 Token 消耗绑进企业日常工作流。 参考财务侧数据——截至 2026 年 3 月财季,阿里云收入同比增长 38%,AI 相关产品收入连续 11 个季度三位数增长,占外部云收入比重已达 30%,百炼平台客户数同比增长 8 倍;AI MaaS 业务 ARR 在 6 月季度突破 100 亿元,目标年底 300 亿元;今年 5-6 月的 API Token 需求较去年 11-12 月增长超 10 倍。Qwen3.8-Max 的发布,本质是在加速 Token 变现。
这条路和 扣子Coze、Dify智能体 这类偏开发者的 Agent 编排平台不同,也和 ChatGPT 走的个人订阅路线不同——它更像是把 通义灵码 在编码场景里验证过的"嵌入工作流"打法,复制到了全部办公场景。
八、四强横评:Qwen3.8-Max / Claude Fable 5 / Kimi K3 / DeepSeek V4
把当下四个最值得考虑的旗舰摆在一起:
| 维度 | Qwen3.8-Max | Claude Fable 5 | Kimi K3 | DeepSeek V4-Flash |
|---|---|---|---|---|
| 总参数 / 激活 | 2.4T / 95B(稀疏 MoE) | 未公开 | 2.8T(开源权重) | 284B / 13B |
| 上下文 | 1M tokens | 长上下文(未公开具体) | 长上下文 | 长上下文 |
| 原生多模态 | ✅ 视觉理解(VisionArena 全球第二) | ✅ | 部分 | ❌ 纯文本为主 |
| 长程自主交付 | ★★★★★(16天/265 commits 实证) | ★★★★★(11天迁移75万行代码案例) | ★★★★ | ★★★★(后训练 Agent 能力涨 7.5 倍) |
| 指令遵循 IFBench | 82.8 | 63.5 | — | — |
| 科研复现 PaperBench | 93.0 | 88.8 | — | — |
| 开源 | ✅ 下周开源 Max 权重 + 27B | ❌ 闭源 | ✅ 开源权重 | ✅ MIT 协议 |
| 国内 API 价格(输入/输出,元/百万 tokens) | 12 / 36(缓存 1.5) | 不直接面向国内 | 中高档 | 1 / 2(缓存 0.02) |
| 国内可用性 | ✅ 千问 AI 平台 | ⚠️ 受限(阿里已全面禁用) | ✅ | ✅ |
| 最适合 | 企业级长程任务、多模态 Agent、私有化部署 | 极限编程与超大规模重构 | 开源自研底座 | 高频调用、成本敏感场景 |
选型建议(我的实际判断):
- 要在国内做企业级 Agent、且涉及视觉/文档/GUI 操作 → Qwen3.8-Max。OSWorld 86.1 和 1M 上下文这两项,目前国内没有更好的组合。
- 只做纯文本高频调用、预算是第一约束 → DeepSeek V4-Flash。¥1/¥2 的价格摆在那,Qwen3.8-Max 贵一个数量级。
- 要自己微调、做私有底座 → 下周的 Qwen3.8-27B 或 Kimi K3 开源权重,看你的显卡预算。
- 做海外业务、极限编程场景 → Claude Fable 5 依然是天花板,但国内合规与可用性风险要自己扛。
如果你还在犹豫,先用 千问 的免费网页版把典型任务跑一遍,再决定要不要上 API——这是最省钱的验证方式。
九、三类人怎么用:具体到动作
开发者 / 独立工程师:
- 先在千问 AI 平台申请 API,用 1M 上下文做一次"整仓库读入"的实验——把你项目的全部源码塞进去让它出重构方案,这是过去做不到的事;
- 关注下周开源的 Qwen3.8-27B,单机多卡可跑,适合做私有微调底座;
- 长程任务别一次性发指令就撒手,设置阶段性 checkpoint 让它自己汇报,成本更可控。可搭配 Qwen-Agent 或 Qwen3-Coder-Next 做编排。
企业 IT / 数字化负责人:
- 千问办公公测期是低成本试水窗口,先挑一个流程标准化程度高的部门(法务合同审查、财务对账、客服工单)做试点;
- 重点验证"组织级 Skill"的沉淀质量——如果资深员工的流程封装后新人复用效果差,说明流程本身没标准化,这是组织问题不是 AI 问题;
- 数据出境合规先过一遍,尤其是有欧盟业务的团队,参考我们对 欧盟 AI 法案 8 月生效 的合规拆解。
内容 / 办公场景使用者:
- 最直接的收益点是长文档与长视频理解——200 页财报 PDF、100 小时以上的会议录像,这类"人看不完"的素材现在可以一次性喂进去;
- 别把它当搜索引擎用,它的价值在"处理你已有的东西",不在"告诉你不知道的东西";
- 和 豆包、智谱清言、腾讯混元 并行用一周,对同一批任务做横向对照,比看任何评测都准。
十、三个必须说清楚的边界
边界一:跑分领先 ≠ 日常体感领先。 PaperBench 93.0、IFBench 82.8 这些数字对应的是特定基准下的表现。真实工作中的模糊指令、脏数据、多轮纠偏,任何榜单都测不出来。Fable 5 在某些主观体验维度依然被很多重度用户认为更"懂人话"。
边界二:"16 天自主编程"是精心设计的展示场景。 项目开源可查是加分项,但这不代表你随手派一个任务它就能跑16天不崩。长程任务的成功率、失败时的 token 浪费、中途纠偏的成本,官方都没给数据。在生产环境里,务必先做小规模长程试跑再放大。
边界三:开源权重不等于能用得起。 2.4T 参数的本地部署对绝大多数团队都是天文数字,真正落地的会是 27B。而 27B 和 Max 之间的能力差距有多大,要等下周权重放出后由第三方评测给答案——历史经验是,小尺寸版本通常只能继承旗舰 60-75% 的综合能力。
十一、拐点判断:从"模型竞赛"到"交付竞赛"
把 7 月 31 日到 8 月 3 日这四天连起来看,一个趋势非常清楚:
2024-2025 年,大模型比的是"参数和跑分";2026 年,比的是"能不能自己把活干完"。
DeepSeek V4-Flash 证明了参数不变、纯靠后训练能把 Agent 能力拉高 7.5 倍;MiniMax H3 证明了开源能在视频编辑上登顶;Qwen3.8-Max 则证明了模型可以连续工作 16 天交付一个真实项目。三件事指向同一个方向——模型正在从"回答问题的工具"变成"承接任务的角色"。
对从业者的含义是现实的:过去你的竞争力是"会用 AI 写代码",接下来是"会设计能让 AI 独立跑完的任务"。 任务拆解、边界定义、验收标准、异常处理——这些以前属于项目管理的技能,正在变成 AI 时代的核心工程能力。
至于阿里这一步能走多远,下周开源权重放出、千问办公公测数据出来之后,会有更靠谱的判断。但至少在 2026 年 8 月这个时点,国产旗舰第一次在"长程自主交付"这条最难的赛道上,给出了可公开验证的证据。
常见问题(FAQ)
Q1:Qwen3.8-Max 和 Qwen3.8 是同一个东西吗? Qwen3.8 是这一代模型系列的统称,Qwen3.8-Max 是其中尺寸最大、性能最强的旗舰版本(2.4T 参数)。同期还有将要开源的 Qwen3.8-27B 小尺寸版本。媒体报道中两个名称经常混用,看到"2.4 万亿参数"时指的都是 Max。
Q2:现在就能用上吗?在哪里用? API 已于 8 月 3 日上线千问 AI 平台,全球开发者可直接调用。普通用户可通过千问办公官网 qwenwork.cn 体验(网页版与 PC 客户端已开放,钉钉入口近期上线),或使用 千问 网页版。
Q3:开源权重什么时候放出?普通人能本地跑吗? 官方口径是"预计下周"开源 Qwen3.8-Max 权重及 Qwen3.8-27B。2.4T 的 Max 版本对个人几乎不可能本地部署;27B 版本在单机多卡(或量化后单卡大显存)条件下有机会跑起来,是普通开发者更现实的选择。
Q4:它比 DeepSeek V4-Flash 强吗?该选哪个? 两者定位不同。Qwen3.8-Max 强在多模态、超长上下文和长程自主任务,价格 ¥12/¥36;DeepSeek V4-Flash 强在极致性价比(¥1/¥2)和纯文本 Agent 能力。高频调用、成本敏感选后者;复杂长程、需要视觉理解选前者。
Q5:企业接入千问办公需要什么条件? 公测期个人和企业用户均可通过官网体验,已初步打通钉钉 IM。企业级深度集成(连接内部数据库与工作流)需要跟阿里云侧对接。建议先用标准化程度高的单一流程做试点,验证"组织级 Skill"的复用效果后再扩大范围。
Q6:跑分说它超过了 Claude Fable 5,是真的吗? 部分指标是真的——PaperBench 93.0 对 88.8、IFBench 82.8 对 63.5,这两项 Qwen3.8-Max 确实领先。但 TextArena 综合排名仍在 Anthropic 系列之后,Arena Frontend Code 与 Claude Opus 5 High 相差 1 分。准确的说法是"在部分维度达到或超过,整体处于同一梯队",而不是全面超越。