📋 编辑总结
Qwen3.8-Max 是阿里巴巴 2026 年 8 月 3 日发布的旗舰大模型,也是通义千问家族迄今尺寸最大、性能最强的一款:总参数 2.4 万亿,采用稀疏 MoE 架构与混合注意力机制,单次推理激活约 950 亿参数,支持最长 100 万 Token 上下文并原生集成多模态视觉理解。它同时是 Qwen Max 级旗舰史上首次开放权重,权重于 8 月 10 日当周上架 Hugging Face 与 ModelScope,并同步开源 Qwen3.8-27B。 定价:API 国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中 1.5 元;海外每百万 Tokens 输入 2 美元、输出 6 美元,隐式缓存命中 0.25 美元;权重开源可自行部署。编辑评分:⭐ 4.8。

Qwen3.8-Max是什么?

Qwen3.8-Max 是阿里巴巴 2026 年 8 月 3 日正式发布的旗舰大模型,通义千问家族迄今尺寸最大、性能最强的一款(预览版此前于 7 月 19 日在 Token 计划、Qcoder 及 QcoderWork 平台露面)。

硬指标先摆出来:总参数 2.4 万亿,采用稀疏混合专家(MoE)架构,单次推理仅激活约 950 亿参数;引入混合注意力机制,支持最长 100 万 Token 上下文窗口;原生集成多模态视觉理解能力。

但这次发布真正的信号不在参数。Qwen Max 系列此前一直走「只给 API、不开放权重」的闭源路线,是通义千问产品线中级别最高的旗舰。这次破例开源——权重于 8 月 10 日当周上架 Hugging Face 与 ModelScope,同时开源轻量版 Qwen3.8-27B。这是 Qwen Max 级旗舰史上第一次开放下载。发布当天阿里港股一度上涨,市场读到的正是这个信号:阿里在用旗舰级产品争夺开源生态的话语权。

核心功能

  • 稀疏 MoE 加混合注意力:2.4 万亿总参数但只激活约 95B,这是它能把 API 价格压到这个水平的架构原因。
  • 百万级上下文与原生视觉:长文档、长代码库和图像理解不需要再额外拼管线。据百度百科,它在 Vision Arena 榜单排名第二。
  • 长周期自主执行:这是阿里发布会花时间最多的部分。官方称模型在编程实测中连续独立运行约 16 天、无人工干预,在 GitHub 上产出 265 次提交,自主搭建出一套可自我迭代的智能体框架。
  • 科研与工程复现:科研场景中连续自主工作约 125 小时复现了一篇 AI Reasoning 领域论文的核心实验,过程中完成四轮自我进化;在长程复杂任务上还独立完成了一款 GCD/RSA 密码硬件加速器设计,无参考设计、无人类干预,单次不间断运行历经约 500 轮交互、71 次评估、13 个关键里程碑,把设计从首个跑通的 8298 门优化到 678 门。
  • 评测成绩:据阿里官方与媒体报道,PaperBench 93.0(较上代提升 28.2)、OSWorld-Verified 86.1(主流模型第一)、CodeArena 全球第四。办公场景的对比数据也被反复引用——一支法务团队一周才能在数百份法律文档中完成的千余个条款标注,模型一小时完成。

版本/套餐对比

API 定价:国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中 1.5 元;海外每百万 Tokens 输入 2 美元、输出 6 美元,隐式缓存命中 0.25 美元。媒体测算这一价格约为闭源标杆 Anthropic Claude Opus 5 的四分之一成本。除 API 外,权重开源可自行部署,2.4 万亿参数的 Max 版适合有大规模算力的机构,轻量部署场景可选同步开源的 Qwen3.8-27B。模型也已接入阿里的 Agent 产品千问办公。

值不值得用?

优点很实在:Max 级旗舰开放权重,意味着有算力的机构第一次可以把这个级别的模型放进自己的机房,而不必受 API 约束;稀疏 MoE 让推理成本明显低于同规模稠密模型;百万上下文加原生视觉减少了工程拼装;长周期自主任务能力是它区别于「更会聊天」的关键——训练目标已经从「答得对」变成「干得完」。

缺点也要认。2.4 万亿参数的本地部署门槛极高,绝大多数团队现实中还是只能走 API,开源更多是生态与信任层面的意义。第三方 Arena 类榜单上,Qwen 的综合排名仍在 Anthropic Claude 系列之后。另外有消息称阿里计划向下一代通义千问开源模型的大型商用用户收取营收分成,如果成立,长期授权成本存在不确定性,商用前建议确认授权条款。

结论:想以更低成本拿到接近第一梯队的长上下文与 Agent 能力,它是目前性价比很突出的选择;追求单点最强的对话与推理体验,仍要横向对比。

使用建议

  • 先用 API 跑通场景再谈部署,尤其别低估 2.4 万亿参数的算力账。
  • 长上下文任务把隐式缓存用起来,命中价格差一个数量级,成本能压下来。
  • 让它跑长周期任务时设好检查点和人工介入位,「连续 16 天」是官方演示条件,不等于你的场景可以撒手不管。
  • 轻量部署与边缘场景直接考虑 Qwen3.8-27B,别硬上 Max。
  • 商用前确认开源授权条款,特别是营收分成相关的变化。

适合谁用?

推荐:需要长上下文、多模态与长周期 Agent 能力,且对 API 成本敏感的开发者与企业。 可考虑:有自建算力、希望把旗舰模型私有化部署的机构,以及需要轻量部署的团队(选 27B)。 不推荐:只做简单对话或轻量问答的个人用户(小模型更划算),以及无法接受开源授权条款变动风险的商用项目。