# 腾讯混元 Hy4 preview 发布：770B 参数 + 1M 上下文，国产开源大模型再添一员

## 开场：腾讯又交卷了

8 月 28 日，腾讯混元正式发布并开源新一代大语言模型 **Hy4 preview**。这不是一次小版本微调，而是混元自 2 月重建基础设施以来，约两个月一次的大版本迭代中，体量最大、定位最清晰的一代。

一句话结论：**Hy4 preview 带着 770B 总参数、49B 激活参数、1M 上下文，直接挤进国产开源大模型第一梯队，而且它从一开始就是"为干活"设计的。**

这篇文章先把事实摆清楚，再回答几个开发者最关心的问题：它强在哪？和 [智谱 GLM 5.3](https://www.aitoollab.cn/tools/glm-5-2/)、[Kimi](https://www.aitoollab.cn/tools/kimi/)、[DeepSeek](https://www.aitoollab.cn/tools/deepseek/) 比谁更值？以及——你现在能怎么用、要花多少钱？

## 一、Hy4 preview 到底是什么

混元是腾讯的自研大模型系列。[腾讯混元](https://www.aitoollab.cn/tools/tencent-hunyuan/) 此前已经覆盖文本、图像、视频等多个方向，而 Hy4 preview 是面向"真实生产力场景"的旗舰文本模型。

官方给它的定位非常明确：**"为生产力而生"**。注意，不是"为刷榜而生"，也不是"为对话闲聊而生"。从软件工程、办公分析，到游戏开发、科学研究，这四个场景是它重点打磨的方向。

为什么要强调"生产力"？因为过去一年行业里"参数越大、榜单越高"的叙事已经疲劳，用户真正关心的是：这个模型接进我的工作流之后，能不能少写几个 prompt、少改几版代码、少做几张表。Hy4 preview 的发布说明，把评价指标从"分数"拉回到了"任务完成度"。

## 二、关键参数与技术亮点

把公开披露的核心数字先列出来（来源：腾讯官方公告、科技日报 2026-08-28）：

- **总参数 770B，单次推理激活 49B**：典型的 MoE（混合专家）结构，靠"激活少量专家"控制实际算力开销，这是当前超大模型兼顾能力和成本的主流路线。
- **上下文长度突破 1M tokens**：约等于一本中长篇小说的体量，长文档分析、跨文件代码理解、超长对话记忆都能一次性吃进去。
- **端到端吞吐较基线提升 31.8%**：这点很关键——它不是"更聪明但更慢"，而是在变强的同时把推理效率也做上去了。
- **Arena 代码测试排第 5、开源模型里第 3**：代码能力是生产力模型最硬的指标之一，这个排位说明它在"能不能真写代码"这件事上进入了头部区间。

在腾讯内部组织的盲测里（163 名专家、203 个工程任务），Hy4 preview 拿到均分 2.99/4，**略优于 GLM 5.3（2.92）和 Kimi K3（2.94）**。分数差距不大，但方向一致：混元在真实工程任务上追了上来。

## 三、递归自我改进闭环：它自己优化自己

Hy4 preview 最值得写一笔的，不是某个单项指标，而是它**首次参与了自身研发的全链路**。

具体说，模型在训练方法、数据策略、评估体系、底层算子这四个层面，都做了自动优化：它提出方案 → 跑实验 → 根据结果继续迭代，实验产生的代码、日志、反馈再进入下一轮探索，形成了一个初步的**递归自我改进闭环（recursive self-improvement loop）**。

更实在一点的例子是推理系统优化：Hy4 preview 自主分析了推理链路的瓶颈，围绕算子融合、通信优化等方向做了多轮调优，最终端到端吞吐量比基线提升了 31.8%。也就是说，**模型不只"被训练"，还参与了"怎么训练得更好、跑得更快"的决策**。

这听着像科幻，但落到工程上就是一句话：未来大模型研发的人力瓶颈，会从"人写优化脚本"部分转移到"模型辅助发现优化点"。腾讯这次等于把这个闭环跑通了一个最小可用版本。

## 四、横向对比：和 GLM、Kimi、DeepSeek 比如何

国产开源大模型现在已经是"四国杀"的格局。把几款当红模型放在一张表里看（数据见文末信息图）：

| 模型 | 总参数 | 上下文 | 开源许可 | 核心定位 |
|------|--------|--------|----------|----------|
| 腾讯混元 Hy4 preview | 770B（激活49B） | 1M | 权重+代码全开，商用宽松 | 生产力（代码/办公/游戏/科研） |
| 智谱 GLM 5.3-Flash | 320B | 1M | MIT | 原生多模态通用 |
| 千问 Qwen3.8-Max | 2.4 万亿 | 未公开 | 开源权重 | 超大杯长上下文 |
| DeepSeek V4-Pro | 1.6 万亿 | 100 万 | 开源权重 | Agent 与推理强化 |

几个观察：

1. **参数不是唯一维度**。Hy4 的 770B 总参在四家里不算最大，但 49B 的激活参数意味着实际推理成本可控——这对部署方是实打实的省钱。
2. **[千问 Qwen3.8-Max](https://www.aitoollab.cn/tools/qwen3-8-max/) 走"超大杯"路线**，2.4 万亿参数主打长上下文和复杂任务；[DeepSeek V4-Pro](https://www.aitoollab.cn/tools/deepseek/) 则把 Agent 能力和峰谷定价做到极致。各家路线明显分化。
3. **GLM 5.3-Flash 的 MIT 许可 + 极低定价**，在"想低成本做产品"的开发者里依然最有号召力。

所以"谁更强"没有标准答案，要看你的场景：要写代码做游戏，Hy4 值得试；要 cheapest 多模态，GLM 5.3-Flash 香；要超大杯长文，看 Qwen；要 Agent 编排，DeepSeek 仍是首选之一。

## 五、对开发者意味着什么：怎么用、贵不贵

**怎么用：**

- 已经在 [WorkBuddy](https://www.aitoollab.cn/tools/workbuddy/) 和 CodeBuddy（腾讯）的国内版、国际版首发，直接在产品里体验；
- [腾讯元宝](https://www.aitoollab.cn/tools/tencent-yuanbao/)、ima 同步上线；
- API 侧通过腾讯云 TokenHub 和 [OpenRouter](https://www.aitoollab.cn/tools/open-router/) 接入。

**贵不贵：**

- 输入 6 元 / 百万 tokens，输出 18 元 / 百万 tokens，缓存命中 0.3 元 / 百万 tokens。
- 对比一下：这比 GLM 5.3-Flash（¥0.15 / ¥0.50）贵一个数量级，但和闭源旗舰（如 Claude Opus 4.8 的四十分之一定价口径）比，依然属于"开源普惠"区间。
- 上线初期，WorkBuddy 和 CodeBuddy 提供**为期两周的限时免费体验**，想试水的现在最划算。

**商用友好度：** 权重和代码全开，商用许可宽松。这对要做产品的团队是重要信号——不用在"开源免费"和"能商用"之间二选一。

## 六、冷静看：优势与待观察点

优势很清晰：参数与上下文够大、场景定位准、开源且可商用、吞吐还涨了三成。递归自我改进闭环是这次最差异化的叙事。

但要泼两盆冷水：

1. **盲测差距极小**。2.99 vs 2.92 vs 2.94，统计学上几乎打平。说明"第一梯队"是真，但"遥遥领先"谈不上。
2. **preview 不是正式版**。腾讯现在的节奏是"先发 preview、再发正式版"，意味着当前版本还会有基于真实反馈的打磨。正式版的稳定性和定价是否维持，要等后续。

另外，1M 上下文在实际长文本任务里的"有效利用率"如何、49B 激活参数在极端复杂任务上会不会触顶，这些都需要社区真实跑一段时间才有结论。

## 结语

腾讯混元 Hy4 preview 的发布，标志着国产开源大模型从"追平闭源"进入"各自找差异化定位"的阶段。混元选了"生产力"这条最务实的赛道，用递归自我改进闭环讲了一个新鲜的故事。

对开发者来说，最实在的建议是：**两周免费窗口别浪费，把你的真实工作流搬上去跑一遍**。代码、办公、游戏原型、科研推理——哪个场景真替你省了时间，哪个才是属于你的"最强模型"。
