字节 SeedRealtime 发布:AI 第一次真正「边看边听边说」,还会主动开口提醒你——全双工从「语音」跨进「音视频」(2026年8月)

· AI资讯 · · 📖 阅读时长 20 分钟
⚡ TL;DR
2026年8月5日,字节跳动 Seed 团队发布原生音视频全双工大模型 SeedRealtime,并在豆包 App 全量上线,成为业界首个规模化落地音视频全双工技术的产品。它用统一端到端架构原生融合音频、视频与文本,摆脱了 ASR+视觉+LLM+TTS+VAD 的级联流水线,官方人工评测显示对话节奏问题减少约50%。更关键的是它学会了主动开口——持续盯着画面,认出文物、翻到指定章节、操作出错时主动提醒。本文拆解全双工三级台阶、级联与端到端的架构差异、四款实时交互模型横评,以及厂商自评数据、未公开参数、常开摄像头隐私这三个诚实边界。

2026年8月5日中午,字节跳动 Seed 团队发布了原生音视频全双工大模型 SeedRealtime,并同步宣布:该能力已在豆包 App 全量上线。用户把 App 更新到最新版,在对话框里点"打电话"进入视频通话界面,就能直接用——不用申请,不用排队,不是内测名单。

这个发布很容易被淹没。就在过去八周里,国产大模型密集放出了五款重磅产品:阿里 Qwen3.8-Max(8月3日,2.4万亿参数)、月之暗面 Kimi K3、DeepSeek V4-Flash(7月31日)、智谱 GLM-5.2,以及字节自家的 Seedance 2.5。每一条新闻都在比参数、比跑分、比价格。

SeedRealtime 不在这条赛道上。它没有公布参数量,没有刷任何主流基准榜单,甚至连端到端时延的具体毫秒数都没披露。它改的是另一件事——人怎么跟 AI 说话

这件事上一次发生重大变化,是2026年7月8日 OpenAI 用 GPT-Live 替换了 ChatGPT 的语音引擎。而 SeedRealtime 把台阶又往上抬了一级。


二、先分清三级台阶:半双工 → 音频全双工 → 音视频全双工

绝大多数关于"全双工"的讨论都糊在一起了。实际上这是三个不同的阶段:

阶段交互机制用户体感代表产品与时间
半双工你说完 → 它听 → 它想 → 它说像对讲机,必须等一方讲完2024–2025 年绝大多数语音助手
音频全双工边听边说,可随时打断、可回应"嗯嗯"接近打电话豆包 Seeduplex(2026年4月)、GPT-Live(2026年7月8日)
音视频全双工声音 + 画面 + 时序同时进,边看边听边说接近视频通话里的一个"在场的人"SeedRealtime(2026年8月5日)

注意第二行那个容易被忽略的事实:字节不是第一次做全双工。早在2026年4月,豆包就基于 Seeduplex 模型上线了音频全双工通话,比 OpenAI 的 GPT-Live 早了三个月。SeedRealtime 是这条技术线的第二步——从"只有耳朵和嘴",变成"还长了眼睛"。

把这条脉络串起来看,比只看单次发布重要得多:字节在实时交互这条线上是连续投入的,不是临时跟风。


三、架构才是真正的分水岭:级联流水线 vs 原生端到端

要理解 SeedRealtime 的价值,得先看它替掉了什么。

传统做法:四个模块接力

过去的"AI 视频通话"基本都是拼出来的:

你的声音 → ASR 语音识别 → 转成文字

你的画面 → 视觉模型 → 转成文字描述 ↓ 大模型思考 → 生成文字 ↓ TTS 合成 → 播放语音

外挂一个 VAD(语音活动检测)模块,负责判断"你说完没有"

这套流水线有三个绕不开的代价:

  • 延迟层层叠加。每个模块几十到几百毫秒,四段串起来就是明显的"愣一下"。
  • 信息层层损耗。你的语气、犹豫、画面里的一个手势,在被压成文字的那一刻就没了。文字是有损压缩。
  • 轮次判断被外包。VAD 只能听声波能量,它分不清你是"说完了"还是"停下来想一下"。所有的抢话和迟滞,根源都在这。

SeedRealtime 的做法:一个模型全接住

SeedRealtime 用统一的端到端架构,把音频、视频、文本原生融合进同一个网络,在连续的多模态信息流上同步完成感知、理解、决策与表达,并且不再依赖外部 VAD 做轮次判断

换句话说:不是"听完→看完→想完→说",而是像人一样,眼睛耳朵嘴同时在工作,每一刻都在判断该继续说还是该让对方说。

这个架构差异不是学术洁癖。它直接决定了下一节那个数字。


四、"节奏问题减少约50%",为什么比多考几分更值钱

字节公布的核心数据只有一个:端到端人工评测显示,相比级联模型,音视频对话中的节奏问题减少了约一半。同时,单次对话能够完整、顺畅进行的概率明显提升。

所谓"节奏问题",具体是三类卡壳:

  • 抢话:你话还没说完,它急着接。
  • 迟滞:你说完了,它愣一两秒才开口。
  • 误触发:旁人聊天、背景电视声、机场广播,它以为在跟它说话。

为什么这个数字比"某某基准提高 3 分"更值钱?

因为实时对话的门槛从来不是知识量,是时机(timing)。一个知识水平 95 分但总抢话的助手,用户用两次就关掉了;一个知识 85 分但节奏舒服的助手,能被天天用。语音交互这十年反复卡在同一个地方——不是 AI 不够聪明,是它不懂什么时候该闭嘴。

这也解释了一个现象:这类模型很难用传统 benchmark 衡量。MMLU、GPQA 这些题库测不出"分寸感",所以目前只能靠人工评测——这既是行业的现实,也是后文"诚实边界"要展开的问题。


五、真正的新东西:AI 学会了"主动开口"

如果说全双工解决的是"不打断人",那 SeedRealtime 最有产品意义的能力是反过来的——它会在你没提问的时候主动说话

官方给出的几个场景:

场景AI 的动作背后能力
博物馆参观持续看画面,认出你要找的那件文物就主动提醒持续视觉监测 + 目标匹配
阅读论文跟着你翻页,翻到指定章节自动提示时序理解 + 状态跟踪
操作咖啡机步骤按错了立刻纠正动作序列判断 + 主动干预
多人聚会认出不同人的身份,一直对应到各自的发言者声纹 + 人脸的联合追踪
外国游客看中文菜单实时理解菜单和服务员的介绍音视频联合理解

这里面藏着一个交互范式的转折:从"被动响应"到"持续在场"

过去的 AI 是一个工具:你调用它,它返回结果,然后它就不存在了。SeedRealtime 想做的是一个"一直在旁边的人"——它一直看着,判断什么时候值得开口。

还有一个被低估的细节:用视觉消解指代。你指着桌上某个东西说"这个怎么弄",模型要结合当前画面、你的手势和视线,判断"这个"到底指哪个。指代消解是语音助手做了十年都没解决的老问题,因为纯音频里根本没有"这个"的答案。加上眼睛,问题的性质就变了。

反过来讲,知道什么时候闭嘴同样是能力。官方演示里,机场这种嘈杂环境中,模型能区分你和旁人的对话,不因背景噪声误触发;儿童学习场景里,不被背景电话声打断。这部分能力和"主动提醒"是一枚硬币的两面——都要求模型对"当下这一刻值不值得说话"有判断。


六、四款实时交互模型横评

2026年下半年,实时交互赛道已经跑出了四条明显不同的路线:

维度SeedRealtime(豆包)GPT-Live(ChatGPT)Gemini LiveClaude 语音模式
对话机制音视频原生全双工音频全双工 + 后台委派推理低延迟轮次制(turn-based)轮次制,可切换模型
视觉输入✅ 原生融合摄像头画面❌ 官方称"即将推出"✅ 摄像头 + 屏幕共享
主动提醒✅ 持续监测、主动开口❌ 被动响应❌ 被动响应❌ 被动响应
智能上限未公开委派机制难题委派 GPT-5.6 后台推理为速度优化,深度让位可选 Opus / Sonnet / Haiku
中文与抗噪中文场景优化,抗噪强英文优先英文优先支持 11 种语言
工具连接可调用工具融入表达联网搜索并在转录中引用Google 生态集成Gmail / Calendar / Slack
可得性豆包 App 全量上线,免费免费版给 GPT-Live-1 miniAndroid 优先,免费层可用免费层仅 Haiku

四家押的东西完全不同:

  • OpenAI 押"对话智能"——全双工 + 后台委派大模型思考,聊天时不冷场,难题也不糊弄。代价是至今没有眼睛。
  • Google 押"感知广度"——摄像头和屏幕共享早就上线,但对话仍是轮次制,边界检测会误判。
  • Anthropic 押"深度与工具"——7月23日更新后可在 Opus / Sonnet / Haiku 之间切换,接 Gmail、日历、Slack,适合严肃长任务。
  • 字节押"原生融合 + 主动性 + 规模化落地"——三级台阶里唯一走到第三级的,而且是直接推给所有豆包用户,不是灰度。

需要说清楚的是:这张表的多数条目来自各家官方描述与公开评测报道,四款产品之间不存在公认的统一基准,横向比较只能做定性判断。


七、同一天的另一条线:京东开源实时流式视频编辑

值得放在一起看的是,8月5日同一天,京东宣布开源自研的实时流式视频编辑模型 JoyAI-Video-Edit——用户可以一边看视频,一边改里面的人物和场景,视频创作从"先有素材再修改"变成"可实时互动编辑"。

两条新闻放在一起,指向同一个词:实时(realtime)

回看2026年的节奏会更清楚:

  • 上半年的关键词是"生成":谁画得更好、谁的视频更长、谁的参数更大。Seedance 2.5 把单次生成拉到30秒,MiniMax H3 开源登顶视频编辑榜,可灵 Kling 3.0 做到原生 4K。
  • 下半年的关键词正在变成"实时":不是生成得多好,而是能不能在连续的流上即时反应——听着、看着、改着、答着。

这两条线其实会合流。生成模型解决"能做出什么",实时交互解决"人怎么参与其中"。前者决定天花板,后者决定日活。


八、三类人现在该做什么

普通用户:今天就能试,挑这三个场景

把豆包更新到最新版,对话框里点"打电话"。最值得先试的三类:

  • 看不懂的东西:外文菜单、说明书、药盒、仪表盘——举着摄像头问,比拍照上传快一个数量级。
  • 需要陪着做的事:练口语、跟着菜谱做饭、组装家具。它能跟着你的进度走,而不是一次性把步骤念完。
  • 需要被纠错的操作:调试设备、按流程操作。这是"主动提醒"真正比传统助手强的地方。

内容与教育从业者:注意"主动性"带来的新产品形态

持续监测 + 主动提醒这套组合,天然对应几种产品:陪练(口语、乐器、健身动作纠正)、导览(博物馆、展会、门店)、巡检(设备、流程合规)。

过去做这类产品,要么请真人,要么写死一堆规则脚本。现在成本结构变了。但要提醒一句:官方演示的都是成功案例,真实场景里"该提醒时不提醒"和"不该提醒瞎提醒"的比例,目前没有任何公开数据。做产品前必须自己压测。

开发者:现在还够不着,但要提前算一笔账

SeedRealtime 目前只在豆包 App 内可用,官方未公布 API 与定价。想做原型的话,现阶段的现实选择是 GPT-Live 的实时接口或 Gemini Live 的 Live API。

有一件事必须提前想清楚:实时多模态的成本模型和文本模型完全不是一回事。文本按 token 计费,一次调用几分钱;实时音视频按连接时长计费,而且摄像头流是持续消耗。一个"挂机十分钟"的陪练场景,成本可能是一次文本问答的几百倍。别拿 DeepSeekQwen 的文本价格直觉来估算实时产品的账。


九、三个诚实边界

边界一:所有数据都来自厂商自评

"节奏问题减少约50%"是字节自己的端到端人工评测结果。评测集怎么构成、对照的"级联模型"具体是哪一套、评测员规模多少、是否盲测——通稿里一个字没有。也没有第三方复现。

更根本的问题是:实时音视频交互目前不存在公认的公开基准。这不是字节一家的问题,是整个赛道的状况。所以任何"谁比谁强多少"的说法,现阶段都只能当作方向性判断。

边界二:关键参数一个都没公开

端到端时延(毫秒)、模型规模、是否开源、API 定价、并发能力——官方发布里全部缺席。

而且字节自己说了,"未来将继续优化模型的端到端时延、主动感知与决策能力、多人复杂场景理解能力以及工具调用能力"。这句话的潜台词很清楚:当下这四项都还不是最优状态。这是厂商难得的坦诚,值得当真。

边界三:常开摄像头这笔隐私账,还没人认真算

主动提醒能力的前提,是模型持续看着你的画面。这引出了几个必须回答但目前答案模糊的问题:

  • 摄像头在什么条件下开启、什么时候真正关闭?
  • 音视频流是实时处理后丢弃,还是留存?留多久?
  • 这些数据会不会进入训练?用户能不能一键退出?

这不只是产品体验问题。欧盟《AI 法案》的透明度与告知义务已于8月2日生效,国内《个人信息保护法》对生物识别信息(人脸、声纹)本就有单独同意的要求。而 SeedRealtime 的"多人聚会识别不同人物身份"这个演示场景,涉及的是在场其他人的生物特征——他们并没有同意

这道题不解决,这类产品在 to B 和出海场景上会一直有天花板。


十、拐点判断:三个正在发生的转向

第一,交互形态的竞争回来了。 过去两年,行业的注意力几乎全在参数、跑分和价格上。SeedRealtime 提醒了一件被忽略的事:用户体感的天花板,经常不在智能,而在交互。一个能力普通但节奏自然的助手,日活可能高过一个能力更强但总抢话的。

第二,"全双工"会像"多模态"一样,在一年内变成标配。 字节4月做音频全双工、8月做音视频全双工,OpenAI 已明确视觉输入"即将推出",Google 的感知能力早就在线只差对话机制。这个窗口很短——今天的差异化,明年就是入场券。

第三,真正的护城河在"分寸感",而参数买不到。 什么时候该接话、什么时候该沉默、哪些画面变化值得主动提醒、哪些是噪声——这些判断没法靠堆参数解决,只能靠海量真实场景的反馈慢慢调。而这恰恰是拥有豆包这种亿级 C 端入口的公司的结构性优势:它有别人拿不到的对话数据

这也是为什么"全量上线"这四个字,可能比任何技术指标都重要。


常见问题(FAQ)

Q1:SeedRealtime 怎么用?要付费吗? 把豆包 App 更新到最新版本,在对话框里选"打电话",进入视频通话界面即可。官方宣布为全量上线,未提及付费门槛。

Q2:它和 GPT-Live 到底差在哪? GPT-Live 是音频全双工,能边听边说、可被打断,难题会委派给后台大模型思考,但目前没有摄像头输入。SeedRealtime 是音视频全双工,能同时处理画面,还能主动提醒。简单说:GPT-Live 更"会聊",SeedRealtime 更"看得见、会主动"。

Q3:"全双工"和"能打断 AI"是一回事吗? 不完全是。能打断只是全双工的一个表现。真正的全双工是模型在说话的同时仍在持续听、持续判断,每秒多次决定继续说还是让位——包括在你思考停顿时不抢话。很多号称"支持打断"的产品,底层仍是靠 VAD 检测轮次的半双工。

Q4:有 API 吗?开发者能接入吗? 截至发布,官方只公布了豆包 App 内的落地,未公开 API 与定价。开发者现阶段做实时多模态原型,可先考虑 GPT-Live 或 Gemini Live 的实时接口。

Q5:它开源吗?参数多大? 官方均未披露。这与字节在 Seed Audio、Seedance 等产品线上的一贯做法一致——以产品落地为先,技术细节披露有限。

Q6:这类产品最大的风险是什么? 两点。一是主动提醒的误报:官方演示都是成功案例,真实场景中误提醒的干扰成本可能很高。二是隐私:持续开启摄像头意味着持续采集环境画面,涉及在场他人的人脸与声纹,合规压力显著高于纯文本产品。


数据来源

  • 字节跳动 Seed 团队官方发布(2026年8月5日)
  • 凤凰网科技、IT之家、新浪科技关于 SeedRealtime 的报道(2026年8月5日)
  • 每日经济新闻《未来商业早参》关于京东 JoyAI-Video-Edit 开源的报道(2026年8月5日)
  • 21世纪经济报道《中国大模型八周五连发》(2026年8月5日)
  • GPT-Live、Gemini Live、Claude 语音模式的官方文档与公开评测报道(2026年7月)
本文数据截至2026年8月6日。文中涉及的厂商自评数据均已标注来源,未经第三方独立验证。产品能力与定价可能随版本更新变化,请以官方最新信息为准。
字节 SeedRealtime 发布:AI 第一次真正「边看边听边说」,还会主动开口提醒你——全双工从「语音」跨进「音视频」(2026年8月) - 数据对比信息图
字节 SeedRealtime 发布:AI 第一次真正「边看边听边说」,还会主动开口提醒你——全双工从「语音」跨进「音视频」(2026年8月) · 核心数据一览

关于作者:本文由 AI工具宝箱编辑组 撰写,团队 5+ 年 AI 工具付费实测经验,月均订阅支出 $200+,所有评测基于真实付费长期使用。

数据声明:本文所有数据均标注来源,可溯源核查。发现错误欢迎通过 联系页面 反馈,48 小时内核查修正。