📋 编辑总结
Seedance 是字节跳动 Seed 团队推出的多模态 AI 视频生成模型,基于统一音视频联合生成架构,支持文本/图片/音频/视频输入并生成带原生音频的 1080p 视频。2026 年 8 月发布 Seedance 2.5 重大升级:单次视频生成时长从 15 秒提升至 30 秒并支持多轮延长,模型可在 30 秒内组织多个有逻辑关联的镜头(铺垫-推进-转折-收尾的完整故事结构),与同期开源的 MiniMax H3 形成直接竞争。2026 年 9 月 7 日彭博社报道,字节正基于 Seedance 筹备一款实时空间视频生成模型,由创始人张一鸣亲自督战,目标实现约每秒 20 帧按需生成、端到端延迟约 0.05 秒、渲染在云端完成,面向直播、短剧与游戏创建可交互三维虚拟世界,最快或于 10 月推出——标志竞争从二维平面迈入可交互三维空间。 定价:暂未公开(经即梦/Dreamina、火山引擎等计费)。编辑评分:⭐4.5(编辑评测)。

Seedance 2.5 是什么?

Seedance 是字节跳动 Seed 团队推出的多模态 AI 视频生成模型,采用统一的音视频联合生成架构,不是先出画面再单独配乐,而是让画面和声音在同一套模型里一起长出来。它支持文本、图片、音频、视频多种输入,并生成带原生音频的高质量视频,这对需要"画面+声音一次成片"的短视频和广告场景很实用。2026 年 7 月 31 日,Seed 团队发布 Seedance 2.5:单次生成时长从 15 秒提升到 30 秒并支持多轮延长,多模态参考上限从 15 个(9 图 + 3 视频 + 3 音频)提升到 50 个(30 图 + 10 视频 + 10 音频),并新增时间戳级定向编辑、白模参考与光照控制,定位从"生成一个片段"升级为"完成一段创作"。

核心功能

输入上很灵活:2.5 版本起你可以同时喂入最多 30 张图片、10 段视频、10 段音频(2.0 为 9 图 / 3 视频 / 3 音频),再加上自然语言指令,模型会引用这些素材里的构图、运动、镜头、视觉效果和声音元素来生成新内容;在多人同框、群像叙事这类复杂场景里,也能同时还原多个人物的形象与声音。正因为是原生音视频联合生成,它能做出口型同步的对话、环境音效和配乐,并让声音与画面节奏对齐,而不是生硬贴上一段背景音乐。

可控性方面,Seedance 强调跨帧的角色与物体一致性——同一人物或物品在不同镜头里外观稳定,叙事才立得住;导演级镜头与运动控制则让你用提示词规划运镜、设计视觉模板,呈现出低角度跟拍、环绕、推近等丰富镜头语言。视频编辑与延伸能力支持针对指定片段、角色或动作做定向修改——2.5 起可用时间戳精确指定"第几秒改哪里",只重生成那一段而不是整条重来;也能基于提示"续拍"出连贯的后续镜头(多轮延长可达数分钟,官方标注 Beta,正式出片仍建议以单次 30 秒为准)。此外还强化了绿幕替换、视角与运镜编辑,并新增白模(无纹理 3D 几何)参考与光照控制,可用 3D 白模先搭好空间结构、机位与运动轨迹再渲染成片。这些能力把生成从一次性产出变成可迭代的创作。

价格与平台

Seedance 本身是一个云端模型,可通过即梦 AI(jimeng.jianying.com)/Dreamina 网页端、豆包专业版使用;开发者 API 于 2026 年 8 月 7 日上线火山方舟,2026 年 8 月 10 日接入剪映 CapCut。按各平台各自的计费方式收费,模型价格官方暂未单独公开(第三方报道称 2.5 生成一段 30 秒视频约 ¥80、较 2.0 上涨约 50%–86%,未经官方确认,以平台实际计费为准)。对想用中文生态、又需要画面与声音一次成片的人来说,它是个顺手的选择。

需要理解的是,Seedance 是底层模型能力,普通用户通常不直接和它打交道,而是通过即梦、Dreamina、豆包、剪映或火山方舟这类前端去用——这也意味着它的实际体验、配额和价格,取决于你所用的那个平台,而非模型本身单独标价。对创作者来说,关注点应是"我想做哪种片子、需要多长、要不要声音",再选对应入口。它目前更适合有清晰想法的半专业创作,而非完全无方向的随手生成;把输入素材准备得越具体,成片与预期越接近。

最终结论

从工作流角度,Seedance 2.5 更适合作为"成片引擎"嵌进你的创作流程,而不是孤立使用——你在即梦/Dreamina 里写想法、传素材,它负责把画面和声音一次生成。但它仍需要你给出清晰的输入:素材越具体、指令越明确,成片越贴近预期。把它当"把脚本变成带声音的片子"的那一步,而非创意本身,预期会更稳。想上手,从即梦或 Dreamina 里的一次小尝试开始最顺。真正用熟之后,你会发现它最省心的,是画面和声音不必再分两步去凑。

Seedance 版本演进对比

对比维度Seedance 2.0Seedance 2.5(2026-07-31)
单次生成时长15 秒30 秒(多轮延长可达数分钟,Beta)
多模态参考上限9 图 + 3 视频 + 3 音频(共 15)30 图 + 10 视频 + 10 音频(共 50)
长镜头一致性需拆分镜头反复拼接优化镜头衔接与场景过渡,主体跨切镜稳定
时间戳级定向编辑不支持支持(按秒定向修改角色/动作/声音/剧情)
绿幕 / 视角 / 运镜编辑有限强化
白模(3D 几何)参考不支持支持,含光照控制
画质处理存在常见「油腻感」系统优化材质/肤质/眼神/光影/饱和度
主要入口即梦 / Dreamina / 火山引擎即梦 AI、豆包专业版、火山方舟 API(08-07)、剪映 CapCut(08-10)
定价官方未单独公开(按平台计费)官方未单独公开(第三方报道 30 秒约 ¥80,未经官方确认,以平台实际计费为准)

主要升级点:

  • 单次生成时长 15 秒 → 30 秒,官方称「长镜头一致性」,并支持多轮延长(第三方评测称最长约 180 秒,仍带 Beta 标签)
  • 多模态参考上限 15 个(9 图 + 3 视频 + 3 音频)→ 50 个(30 图 + 10 视频 + 10 音频)
  • 新增时间戳级定向编辑:可对指定秒数区间的角色/动作/声音/剧情做局部修改,不必整条重生成
  • 编辑能力强化:绿幕编辑、视角与运镜编辑、参考编辑
  • 新增白模(无纹理 3D 几何)参考 + 光照控制,用于构图/机位/运动轨迹预演(第三方报道称提供 Maya / Blender 插件)
  • 画质系统优化:物体材质、人物肤质与眼神、光影、饱和度,官方称弱化常见「油腻感」
  • 接入渠道扩展:2026-08-07 上线火山方舟 API,2026-08-10 接入剪映 CapCut

后续若发布更新代(如 5.3 / 6.0),本小节会持续补充各代差异。