腾讯混元 Hy4 preview 发布:770B 参数 + 1M 上下文,国产开源大模型再添一员
8月28日腾讯混元发布并开源 Hy4 preview:770B总参数、49B激活、1M上下文,定位生产力场景,并首次实现递归自我改进闭环。本文拆解参数、对比GLM/Kimi/DeepSeek,并给出开发者上手与定价建议。
开场:腾讯又交卷了
8 月 28 日,腾讯混元正式发布并开源新一代大语言模型 Hy4 preview。这不是一次小版本微调,而是混元自 2 月重建基础设施以来,约两个月一次的大版本迭代中,体量最大、定位最清晰的一代。
一句话结论:Hy4 preview 带着 770B 总参数、49B 激活参数、1M 上下文,直接挤进国产开源大模型第一梯队,而且它从一开始就是"为干活"设计的。
这篇文章先把事实摆清楚,再回答几个开发者最关心的问题:它强在哪?和 智谱 GLM 5.3、Kimi、DeepSeek 比谁更值?以及——你现在能怎么用、要花多少钱?
一、Hy4 preview 到底是什么
混元是腾讯的自研大模型系列。腾讯混元 此前已经覆盖文本、图像、视频等多个方向,而 Hy4 preview 是面向"真实生产力场景"的旗舰文本模型。
官方给它的定位非常明确:"为生产力而生"。注意,不是"为刷榜而生",也不是"为对话闲聊而生"。从软件工程、办公分析,到游戏开发、科学研究,这四个场景是它重点打磨的方向。
为什么要强调"生产力"?因为过去一年行业里"参数越大、榜单越高"的叙事已经疲劳,用户真正关心的是:这个模型接进我的工作流之后,能不能少写几个 prompt、少改几版代码、少做几张表。Hy4 preview 的发布说明,把评价指标从"分数"拉回到了"任务完成度"。
二、关键参数与技术亮点
把公开披露的核心数字先列出来(来源:腾讯官方公告、科技日报 2026-08-28):
- 总参数 770B,单次推理激活 49B:典型的 MoE(混合专家)结构,靠"激活少量专家"控制实际算力开销,这是当前超大模型兼顾能力和成本的主流路线。
- 上下文长度突破 1M tokens:约等于一本中长篇小说的体量,长文档分析、跨文件代码理解、超长对话记忆都能一次性吃进去。
- 端到端吞吐较基线提升 31.8%:这点很关键——它不是"更聪明但更慢",而是在变强的同时把推理效率也做上去了。
- Arena 代码测试排第 5、开源模型里第 3:代码能力是生产力模型最硬的指标之一,这个排位说明它在"能不能真写代码"这件事上进入了头部区间。
在腾讯内部组织的盲测里(163 名专家、203 个工程任务),Hy4 preview 拿到均分 2.99/4,略优于 GLM 5.3(2.92)和 Kimi K3(2.94)。分数差距不大,但方向一致:混元在真实工程任务上追了上来。
三、递归自我改进闭环:它自己优化自己
Hy4 preview 最值得写一笔的,不是某个单项指标,而是它首次参与了自身研发的全链路。
具体说,模型在训练方法、数据策略、评估体系、底层算子这四个层面,都做了自动优化:它提出方案 → 跑实验 → 根据结果继续迭代,实验产生的代码、日志、反馈再进入下一轮探索,形成了一个初步的递归自我改进闭环(recursive self-improvement loop)。
更实在一点的例子是推理系统优化:Hy4 preview 自主分析了推理链路的瓶颈,围绕算子融合、通信优化等方向做了多轮调优,最终端到端吞吐量比基线提升了 31.8%。也就是说,模型不只"被训练",还参与了"怎么训练得更好、跑得更快"的决策。
这听着像科幻,但落到工程上就是一句话:未来大模型研发的人力瓶颈,会从"人写优化脚本"部分转移到"模型辅助发现优化点"。腾讯这次等于把这个闭环跑通了一个最小可用版本。
四、横向对比:和 GLM、Kimi、DeepSeek 比如何
国产开源大模型现在已经是"四国杀"的格局。把几款当红模型放在一张表里看(数据见文末信息图):
| 模型 | 总参数 | 上下文 | 开源许可 | 核心定位 |
|---|---|---|---|---|
| 腾讯混元 Hy4 preview | 770B(激活49B) | 1M | 权重+代码全开,商用宽松 | 生产力(代码/办公/游戏/科研) |
| 智谱 GLM 5.3-Flash | 320B | 1M | MIT | 原生多模态通用 |
| 千问 Qwen3.8-Max | 2.4 万亿 | 未公开 | 开源权重 | 超大杯长上下文 |
| DeepSeek V4-Pro | 1.6 万亿 | 100 万 | 开源权重 | Agent 与推理强化 |
几个观察:
- 参数不是唯一维度。Hy4 的 770B 总参在四家里不算最大,但 49B 的激活参数意味着实际推理成本可控——这对部署方是实打实的省钱。
- 千问 Qwen3.8-Max 走"超大杯"路线,2.4 万亿参数主打长上下文和复杂任务;DeepSeek V4-Pro 则把 Agent 能力和峰谷定价做到极致。各家路线明显分化。
- GLM 5.3-Flash 的 MIT 许可 + 极低定价,在"想低成本做产品"的开发者里依然最有号召力。
所以"谁更强"没有标准答案,要看你的场景:要写代码做游戏,Hy4 值得试;要 cheapest 多模态,GLM 5.3-Flash 香;要超大杯长文,看 Qwen;要 Agent 编排,DeepSeek 仍是首选之一。
五、对开发者意味着什么:怎么用、贵不贵
怎么用:
- 已经在 WorkBuddy 和 CodeBuddy(腾讯)的国内版、国际版首发,直接在产品里体验;
- 腾讯元宝、ima 同步上线;
- API 侧通过腾讯云 TokenHub 和 OpenRouter 接入。
贵不贵:
- 输入 6 元 / 百万 tokens,输出 18 元 / 百万 tokens,缓存命中 0.3 元 / 百万 tokens。
- 对比一下:这比 GLM 5.3-Flash(¥0.15 / ¥0.50)贵一个数量级,但和闭源旗舰(如 Claude Opus 4.8 的四十分之一定价口径)比,依然属于"开源普惠"区间。
- 上线初期,WorkBuddy 和 CodeBuddy 提供为期两周的限时免费体验,想试水的现在最划算。
商用友好度: 权重和代码全开,商用许可宽松。这对要做产品的团队是重要信号——不用在"开源免费"和"能商用"之间二选一。
六、冷静看:优势与待观察点
优势很清晰:参数与上下文够大、场景定位准、开源且可商用、吞吐还涨了三成。递归自我改进闭环是这次最差异化的叙事。
但要泼两盆冷水:
- 盲测差距极小。2.99 vs 2.92 vs 2.94,统计学上几乎打平。说明"第一梯队"是真,但"遥遥领先"谈不上。
- preview 不是正式版。腾讯现在的节奏是"先发 preview、再发正式版",意味着当前版本还会有基于真实反馈的打磨。正式版的稳定性和定价是否维持,要等后续。
另外,1M 上下文在实际长文本任务里的"有效利用率"如何、49B 激活参数在极端复杂任务上会不会触顶,这些都需要社区真实跑一段时间才有结论。
结语
腾讯混元 Hy4 preview 的发布,标志着国产开源大模型从"追平闭源"进入"各自找差异化定位"的阶段。混元选了"生产力"这条最务实的赛道,用递归自我改进闭环讲了一个新鲜的故事。
对开发者来说,最实在的建议是:两周免费窗口别浪费,把你的真实工作流搬上去跑一遍。代码、办公、游戏原型、科研推理——哪个场景真替你省了时间,哪个才是属于你的"最强模型"。
❓ 常见问题
2026 年 8 月 28 日,腾讯混元正式发布并开源 Hy4 preview。模型权重和代码全开、商用许可宽松,已通过 WorkBuddy/CodeBuddy、腾讯元宝、ima 及腾讯云 TokenHub、OpenRouter 多路可用。
在腾讯内部盲测(163 名专家、203 个工程任务)中,Hy4 preview 均分 2.99/4,略优于 GLM 5.3(2.92)和 Kimi K3(2.94),差距极小、基本同处第一梯队。Arena 代码测试排第 5、开源模型第 3。选哪个要看具体场景,并非单方面碾压。
已在 WorkBuddy、CodeBuddy(国内版及国际版)、腾讯元宝、ima 同步首发,可直接在产品内体验。API 通过腾讯云 TokenHub 和 OpenRouter 接入,上线初期 WorkBuddy/CodeBuddy 提供为期两周的限时免费体验。
定价为输入 6 元 / 百万 tokens、输出 18 元 / 百万 tokens、缓存命中 0.3 元 / 百万 tokens。比 GLM 5.3-Flash(¥0.15/¥0.50)贵约一个数量级,但相对闭源旗舰仍属开源普惠区间。两周免费体验期是试水成本最低的时间窗口。
指 Hy4 preview 首次参与自身研发全链路:在训练方法、数据策略、评估体系、底层算子层面自动优化,形成「提方案→跑实验→按结果迭代」的循环;并自主优化推理系统(算子融合、通信优化等),使端到端吞吐较基线提升 31.8%。模型不只被训练,也参与了「如何训练得更好、跑得更快」的决策。