字节 SeedRealtime 发布:AI 第一次真正「边看边听边说」,还会主动开口提醒你——全双工从「语音」跨进「音视频」(2026年8月)
2026年8月5日,字节跳动 Seed 团队发布原生音视频全双工大模型 SeedRealtime,并在豆包 App 全量上线,成为业界首个规模化落地音视频全双工技术的产品。它用统一端到端架构原生融合音频、视频与文本,摆脱了 ASR+视觉+LLM+TTS+VAD 的级联流水线,官方人工评测显示对话节奏问题减少约50%。更关键的是它学会了主动开口——持续盯着画面,认出文物、翻到指定章节、操作出错时主动提醒。本文拆解全双工三级台阶、级联与端到端的架构差异、四款实时交互模型横评,以及厂商自评数据、未公开参数、常开摄像头隐私这三个诚实边界。
2026年8月5日中午,字节跳动 Seed 团队发布了原生音视频全双工大模型 SeedRealtime,并同步宣布:该能力已在豆包 App 全量上线。用户把 App 更新到最新版,在对话框里点"打电话"进入视频通话界面,就能直接用——不用申请,不用排队,不是内测名单。
这个发布很容易被淹没。就在过去八周里,国产大模型密集放出了五款重磅产品:阿里 Qwen3.8-Max(8月3日,2.4万亿参数)、月之暗面 Kimi K3、DeepSeek V4-Flash(7月31日)、智谱 GLM-5.2,以及字节自家的 Seedance 2.5。每一条新闻都在比参数、比跑分、比价格。
SeedRealtime 不在这条赛道上。它没有公布参数量,没有刷任何主流基准榜单,甚至连端到端时延的具体毫秒数都没披露。它改的是另一件事——人怎么跟 AI 说话。
这件事上一次发生重大变化,是2026年7月8日 OpenAI 用 GPT-Live 替换了 ChatGPT 的语音引擎。而 SeedRealtime 把台阶又往上抬了一级。
二、先分清三级台阶:半双工 → 音频全双工 → 音视频全双工
绝大多数关于"全双工"的讨论都糊在一起了。实际上这是三个不同的阶段:
| 阶段 | 交互机制 | 用户体感 | 代表产品与时间 |
|---|---|---|---|
| 半双工 | 你说完 → 它听 → 它想 → 它说 | 像对讲机,必须等一方讲完 | 2024–2025 年绝大多数语音助手 |
| 音频全双工 | 边听边说,可随时打断、可回应"嗯嗯" | 接近打电话 | 豆包 Seeduplex(2026年4月)、GPT-Live(2026年7月8日) |
| 音视频全双工 | 声音 + 画面 + 时序同时进,边看边听边说 | 接近视频通话里的一个"在场的人" | SeedRealtime(2026年8月5日) |
注意第二行那个容易被忽略的事实:字节不是第一次做全双工。早在2026年4月,豆包就基于 Seeduplex 模型上线了音频全双工通话,比 OpenAI 的 GPT-Live 早了三个月。SeedRealtime 是这条技术线的第二步——从"只有耳朵和嘴",变成"还长了眼睛"。
把这条脉络串起来看,比只看单次发布重要得多:字节在实时交互这条线上是连续投入的,不是临时跟风。
三、架构才是真正的分水岭:级联流水线 vs 原生端到端
要理解 SeedRealtime 的价值,得先看它替掉了什么。
传统做法:四个模块接力
过去的"AI 视频通话"基本都是拼出来的:
你的声音 → ASR 语音识别 → 转成文字
你的画面 → 视觉模型 → 转成文字描述
↓
大模型思考 → 生成文字
↓
TTS 合成 → 播放语音
外挂一个 VAD(语音活动检测)模块,负责判断"你说完没有"
这套流水线有三个绕不开的代价:
- 延迟层层叠加。每个模块几十到几百毫秒,四段串起来就是明显的"愣一下"。
- 信息层层损耗。你的语气、犹豫、画面里的一个手势,在被压成文字的那一刻就没了。文字是有损压缩。
- 轮次判断被外包。VAD 只能听声波能量,它分不清你是"说完了"还是"停下来想一下"。所有的抢话和迟滞,根源都在这。
SeedRealtime 的做法:一个模型全接住
SeedRealtime 用统一的端到端架构,把音频、视频、文本原生融合进同一个网络,在连续的多模态信息流上同步完成感知、理解、决策与表达,并且不再依赖外部 VAD 做轮次判断。
换句话说:不是"听完→看完→想完→说",而是像人一样,眼睛耳朵嘴同时在工作,每一刻都在判断该继续说还是该让对方说。
这个架构差异不是学术洁癖。它直接决定了下一节那个数字。
四、"节奏问题减少约50%",为什么比多考几分更值钱
字节公布的核心数据只有一个:端到端人工评测显示,相比级联模型,音视频对话中的节奏问题减少了约一半。同时,单次对话能够完整、顺畅进行的概率明显提升。
所谓"节奏问题",具体是三类卡壳:
- 抢话:你话还没说完,它急着接。
- 迟滞:你说完了,它愣一两秒才开口。
- 误触发:旁人聊天、背景电视声、机场广播,它以为在跟它说话。
为什么这个数字比"某某基准提高 3 分"更值钱?
因为实时对话的门槛从来不是知识量,是时机(timing)。一个知识水平 95 分但总抢话的助手,用户用两次就关掉了;一个知识 85 分但节奏舒服的助手,能被天天用。语音交互这十年反复卡在同一个地方——不是 AI 不够聪明,是它不懂什么时候该闭嘴。
这也解释了一个现象:这类模型很难用传统 benchmark 衡量。MMLU、GPQA 这些题库测不出"分寸感",所以目前只能靠人工评测——这既是行业的现实,也是后文"诚实边界"要展开的问题。
五、真正的新东西:AI 学会了"主动开口"
如果说全双工解决的是"不打断人",那 SeedRealtime 最有产品意义的能力是反过来的——它会在你没提问的时候主动说话。
官方给出的几个场景:
| 场景 | AI 的动作 | 背后能力 |
|---|---|---|
| 博物馆参观 | 持续看画面,认出你要找的那件文物就主动提醒 | 持续视觉监测 + 目标匹配 |
| 阅读论文 | 跟着你翻页,翻到指定章节自动提示 | 时序理解 + 状态跟踪 |
| 操作咖啡机 | 步骤按错了立刻纠正 | 动作序列判断 + 主动干预 |
| 多人聚会 | 认出不同人的身份,一直对应到各自的发言者 | 声纹 + 人脸的联合追踪 |
| 外国游客看中文菜单 | 实时理解菜单和服务员的介绍 | 音视频联合理解 |
这里面藏着一个交互范式的转折:从"被动响应"到"持续在场"。
过去的 AI 是一个工具:你调用它,它返回结果,然后它就不存在了。SeedRealtime 想做的是一个"一直在旁边的人"——它一直看着,判断什么时候值得开口。
还有一个被低估的细节:用视觉消解指代。你指着桌上某个东西说"这个怎么弄",模型要结合当前画面、你的手势和视线,判断"这个"到底指哪个。指代消解是语音助手做了十年都没解决的老问题,因为纯音频里根本没有"这个"的答案。加上眼睛,问题的性质就变了。
反过来讲,知道什么时候闭嘴同样是能力。官方演示里,机场这种嘈杂环境中,模型能区分你和旁人的对话,不因背景噪声误触发;儿童学习场景里,不被背景电话声打断。这部分能力和"主动提醒"是一枚硬币的两面——都要求模型对"当下这一刻值不值得说话"有判断。
六、四款实时交互模型横评
2026年下半年,实时交互赛道已经跑出了四条明显不同的路线:
| 维度 | SeedRealtime(豆包) | GPT-Live(ChatGPT) | Gemini Live | Claude 语音模式 |
|---|---|---|---|---|
| 对话机制 | 音视频原生全双工 | 音频全双工 + 后台委派推理 | 低延迟轮次制(turn-based) | 轮次制,可切换模型 |
| 视觉输入 | ✅ 原生融合摄像头画面 | ❌ 官方称"即将推出" | ✅ 摄像头 + 屏幕共享 | ❌ |
| 主动提醒 | ✅ 持续监测、主动开口 | ❌ 被动响应 | ❌ 被动响应 | ❌ 被动响应 |
| 智能上限 | 未公开委派机制 | 难题委派 GPT-5.6 后台推理 | 为速度优化,深度让位 | 可选 Opus / Sonnet / Haiku |
| 中文与抗噪 | 中文场景优化,抗噪强 | 英文优先 | 英文优先 | 支持 11 种语言 |
| 工具连接 | 可调用工具融入表达 | 联网搜索并在转录中引用 | Google 生态集成 | Gmail / Calendar / Slack |
| 可得性 | 豆包 App 全量上线,免费 | 免费版给 GPT-Live-1 mini | Android 优先,免费层可用 | 免费层仅 Haiku |
四家押的东西完全不同:
- OpenAI 押"对话智能"——全双工 + 后台委派大模型思考,聊天时不冷场,难题也不糊弄。代价是至今没有眼睛。
- Google 押"感知广度"——摄像头和屏幕共享早就上线,但对话仍是轮次制,边界检测会误判。
- Anthropic 押"深度与工具"——7月23日更新后可在 Opus / Sonnet / Haiku 之间切换,接 Gmail、日历、Slack,适合严肃长任务。
- 字节押"原生融合 + 主动性 + 规模化落地"——三级台阶里唯一走到第三级的,而且是直接推给所有豆包用户,不是灰度。
需要说清楚的是:这张表的多数条目来自各家官方描述与公开评测报道,四款产品之间不存在公认的统一基准,横向比较只能做定性判断。
七、同一天的另一条线:京东开源实时流式视频编辑
值得放在一起看的是,8月5日同一天,京东宣布开源自研的实时流式视频编辑模型 JoyAI-Video-Edit——用户可以一边看视频,一边改里面的人物和场景,视频创作从"先有素材再修改"变成"可实时互动编辑"。
两条新闻放在一起,指向同一个词:实时(realtime)。
回看2026年的节奏会更清楚:
- 上半年的关键词是"生成":谁画得更好、谁的视频更长、谁的参数更大。Seedance 2.5 把单次生成拉到30秒,MiniMax H3 开源登顶视频编辑榜,可灵 Kling 3.0 做到原生 4K。
- 下半年的关键词正在变成"实时":不是生成得多好,而是能不能在连续的流上即时反应——听着、看着、改着、答着。
这两条线其实会合流。生成模型解决"能做出什么",实时交互解决"人怎么参与其中"。前者决定天花板,后者决定日活。
八、三类人现在该做什么
普通用户:今天就能试,挑这三个场景
把豆包更新到最新版,对话框里点"打电话"。最值得先试的三类:
- 看不懂的东西:外文菜单、说明书、药盒、仪表盘——举着摄像头问,比拍照上传快一个数量级。
- 需要陪着做的事:练口语、跟着菜谱做饭、组装家具。它能跟着你的进度走,而不是一次性把步骤念完。
- 需要被纠错的操作:调试设备、按流程操作。这是"主动提醒"真正比传统助手强的地方。
内容与教育从业者:注意"主动性"带来的新产品形态
持续监测 + 主动提醒这套组合,天然对应几种产品:陪练(口语、乐器、健身动作纠正)、导览(博物馆、展会、门店)、巡检(设备、流程合规)。
过去做这类产品,要么请真人,要么写死一堆规则脚本。现在成本结构变了。但要提醒一句:官方演示的都是成功案例,真实场景里"该提醒时不提醒"和"不该提醒瞎提醒"的比例,目前没有任何公开数据。做产品前必须自己压测。
开发者:现在还够不着,但要提前算一笔账
SeedRealtime 目前只在豆包 App 内可用,官方未公布 API 与定价。想做原型的话,现阶段的现实选择是 GPT-Live 的实时接口或 Gemini Live 的 Live API。
有一件事必须提前想清楚:实时多模态的成本模型和文本模型完全不是一回事。文本按 token 计费,一次调用几分钱;实时音视频按连接时长计费,而且摄像头流是持续消耗。一个"挂机十分钟"的陪练场景,成本可能是一次文本问答的几百倍。别拿 DeepSeek 或 Qwen 的文本价格直觉来估算实时产品的账。
九、三个诚实边界
边界一:所有数据都来自厂商自评
"节奏问题减少约50%"是字节自己的端到端人工评测结果。评测集怎么构成、对照的"级联模型"具体是哪一套、评测员规模多少、是否盲测——通稿里一个字没有。也没有第三方复现。
更根本的问题是:实时音视频交互目前不存在公认的公开基准。这不是字节一家的问题,是整个赛道的状况。所以任何"谁比谁强多少"的说法,现阶段都只能当作方向性判断。
边界二:关键参数一个都没公开
端到端时延(毫秒)、模型规模、是否开源、API 定价、并发能力——官方发布里全部缺席。
而且字节自己说了,"未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力"。这句话的潜台词很清楚:当下这四项都还不是最优状态。这是厂商难得的坦诚,值得当真。
边界三:常开摄像头这笔隐私账,还没人认真算
主动提醒能力的前提,是模型持续看着你的画面。这引出了几个必须回答但目前答案模糊的问题:
- 摄像头在什么条件下开启、什么时候真正关闭?
- 音视频流是实时处理后丢弃,还是留存?留多久?
- 这些数据会不会进入训练?用户能不能一键退出?
这不只是产品体验问题。欧盟《AI 法案》的透明度与告知义务已于8月2日生效,国内《个人信息保护法》对生物识别信息(人脸、声纹)本就有单独同意的要求。而 SeedRealtime 的"多人聚会识别不同人物身份"这个演示场景,涉及的是在场其他人的生物特征——他们并没有同意。
这道题不解决,这类产品在 to B 和出海场景上会一直有天花板。
十、拐点判断:三个正在发生的转向
第一,交互形态的竞争回来了。 过去两年,行业的注意力几乎全在参数、跑分和价格上。SeedRealtime 提醒了一件被忽略的事:用户体感的天花板,经常不在智能,而在交互。一个能力普通但节奏自然的助手,日活可能高过一个能力更强但总抢话的。
第二,"全双工"会像"多模态"一样,在一年内变成标配。 字节4月做音频全双工、8月做音视频全双工,OpenAI 已明确视觉输入"即将推出",Google 的感知能力早就在线只差对话机制。这个窗口很短——今天的差异化,明年就是入场券。
第三,真正的护城河在"分寸感",而参数买不到。 什么时候该接话、什么时候该沉默、哪些画面变化值得主动提醒、哪些是噪声——这些判断没法靠堆参数解决,只能靠海量真实场景的反馈慢慢调。而这恰恰是拥有豆包这种亿级 C 端入口的公司的结构性优势:它有别人拿不到的对话数据。
这也是为什么"全量上线"这四个字,可能比任何技术指标都重要。
常见问题(FAQ)
Q1:SeedRealtime 怎么用?要付费吗? 把豆包 App 更新到最新版本,在对话框里选"打电话",进入视频通话界面即可。官方宣布为全量上线,未提及付费门槛。
Q2:它和 GPT-Live 到底差在哪? GPT-Live 是音频全双工,能边听边说、可被打断,难题会委派给后台大模型思考,但目前没有摄像头输入。SeedRealtime 是音视频全双工,能同时处理画面,还能主动提醒。简单说:GPT-Live 更"会聊",SeedRealtime 更"看得见、会主动"。
Q3:"全双工"和"能打断 AI"是一回事吗? 不完全是。能打断只是全双工的一个表现。真正的全双工是模型在说话的同时仍在持续听、持续判断,每秒多次决定继续说还是让位——包括在你思考停顿时不抢话。很多号称"支持打断"的产品,底层仍是靠 VAD 检测轮次的半双工。
Q4:有 API 吗?开发者能接入吗? 截至发布,官方只公布了豆包 App 内的落地,未公开 API 与定价。开发者现阶段做实时多模态原型,可先考虑 GPT-Live 或 Gemini Live 的实时接口。
Q5:它开源吗?参数多大? 官方均未披露。这与字节在 Seed Audio、Seedance 等产品线上的一贯做法一致——以产品落地为先,技术细节披露有限。
Q6:这类产品最大的风险是什么? 两点。一是主动提醒的误报:官方演示都是成功案例,真实场景中误提醒的干扰成本可能很高。二是隐私:持续开启摄像头意味着持续采集环境画面,涉及在场他人的人脸与声纹,合规压力显著高于纯文本产品。
数据来源
- 字节跳动 Seed 团队官方发布(2026年8月5日)
- 凤凰网科技、IT之家、新浪科技关于 SeedRealtime 的报道(2026年8月5日)
- 每日经济新闻《未来商业早参》关于京东 JoyAI-Video-Edit 开源的报道(2026年8月5日)
- 21世纪经济报道《中国大模型八周五连发》(2026年8月5日)
- GPT-Live、Gemini Live、Claude 语音模式的官方文档与公开评测报道(2026年7月)
本文数据截至2026年8月6日。文中涉及的厂商自评数据均已标注来源,未经第三方独立验证。产品能力与定价可能随版本更新变化,请以官方最新信息为准。