📋 编辑总结
MAGI-2 Preview 是 Sand.ai 于 2026-08-05 开源的千亿级(114B 总参数)MoE 音视频生成模型:文本、视频、音频统一进同一个 Transformer 联合建模,一次生成 10 秒 1080p 且带同步音频的视频,推理成本约 0.5 元/条,是开源视频生成的天花板级选择。 定价:开源免费(权重+代码全开源,本地部署需自备算力)。编辑评分:⭐ 4.5。

MAGI-2 是什么?

MAGI-2 Preview 是 Sand.ai 在 2026 年 8 月 5 日发布并开源的千亿级(114B 总参数)MoE 音视频生成模型,也是目前全球首个开源的千亿参数视频生成模型。它最核心的特点只有一句话:把文本、视频、音频放进同一个 Transformer 里联合建模,一次就能生成 10 秒 1080p、且画面与声音天然同步的视频。

对创作者来说,这意味着过去“先出画面、再单独配口型/音效”的多段链路被压缩成一步——人物说话时,口型、表情、身体动作和环境声由同一套主干共同生成,镜头完整度更高。

Sand.ai 在官方技术博客中把长期目标表述为:以最可扩展的方式把视频中的信息压缩进模型,最终“使其成为物理 AGI 的基础”。MAGI-2 是一次围绕“视频模型如何规模化”的架构验证,而非面向个人用户的成品 App。

为什么 MAGI-2 值得关注?

1. 千亿参数,但每次只激活 6B

语言模型早就被 MoE 推到千亿、万亿级,开源视频模型却长期停在十几 B。MAGI-2 用一套叫 MagiMoE 的超细粒度专家架构把总参数推到 114B,却把每个 token 实际激活的参数压到约 6B:它将 3072 维隐藏表示拆成 12 个 256 维 head,每个 head 有 256 个专家、每次只选 6 个,单层共 3072 个 head-local 专家单元、每 token 激活 72 个。

结果就是“存储容量很大、单步计算很省”——在 Artificial Analysis 视频生成榜单上排第 6,用的却只是 6B 激活参数。

2. 统一音视频,原生音画同步

多数开源视频模型只生成无声画面,音频要靠后续对口型或配乐补上。MAGI-2 延续 Sand.ai 在 MagiHuman 论文里的单流架构:文本、视频、音频作为统一 token 序列,在同一主干的每一层 self-attention 里持续交换信息。口型、表情、动作、对白、环境声从生成一开始就互相影响,而不是最后拼接。

3. 极低的推理成本

按 8 卡 H100 月租金折算,生成一条 10 秒 1080p 视频的推理成本约 0.5 元(蒸馏后模型),约为行业主流模型的十分之一。单次成本下降后,同一预算可以跑更多版本再人工筛选,对广告、短剧、动画、游戏资产等高频调用场景意义明显。


MAGI-2 能做什么?

能力说明
文生视频(T2V)输入文本提示词,生成 10 秒 1080p 视频
图生视频(I2V)输入静图 + 文本指令,让画面动起来并带同步音频
统一音视频画面与声音一次成型,非后处理拼接
开源可私有化权重 + 代码全开源,可本地/企业内网部署与微调

需要明确:当前 Preview 仅支持 10 秒固定时长,更长的视频、更高的一致性是下一步方向。


部署门槛高吗?

实话实说,门槛很高。MAGI-2 需要 8 张 NVIDIA Hopper(如 H100)GPU,完整权重约 307GB(含预览阶段 DiT、refiner、Qwen3.5-27B 文本编码器、Wan2.2 视频 VAE、Stable Audio Open 1.0 音频 VAE 等),官方提供 Docker 镜像与 torchrun 脚本。对个人创作者而言,更现实的是等待社区量化/轻量版本,或使用托管视频服务。


值不值得用?

适合谁: 研究机构、基础设施团队、具备多卡算力且需要私有化/领域微调的企业(尤其金融、医疗、工业等敏感行业,可内网部署)。

暂不适合谁: 想要“开箱即用”的个人创作者——MAGI-2 是工程级研究发布,不是消费级产品。

它的价值不在于“今天就能替代可灵/Runway”,而在于把千亿级视频 MoE 这条路线正式带进开源社区,让开发者和企业可以围绕统一音视频、细粒度专家、低成本推理继续验证。