语音 Agent 三强对比:Gemini 3.8 Live 与阶跃 StepAudio 3 同日发布,字节 SeedRealtime 最强却买不到(2026年9月)
2026 年 9 月 15 日,Google 发布 Gemini 3.8 Live 与 Extended Thinking,阶跃星辰同日发布 StepAudio 3 系列五款语音模型;加上字节 8 月已上线的 SeedRealtime,语音 Agent 的竞争从「谁更像人」转向「说话时能不能把事办完」。本文对比三家路线,并指出最关键的一条:最强的那个开发者买不到。
2026 年 9 月 15 日,语音模型赛道上出现了两次正面撞车:Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking;同一天,中国的阶跃星辰一次性发布 StepAudio 3 系列五款模型。两家发布会互不提及,但把它们放在一起看会发现,它们在回答同一个问题——怎么让 AI 在说话的时候不停止思考、也不停止干活。
过去两年,语音模型的考卷是「谁更像人」:词错误率、音色相似度、语调自然度。2026 年下半年的考卷换了:AI 能不能一边听你说、一边在后台查资料调接口,还能在需要的时候插一句「我看一下」,而不是让你对着静音等。这篇文章把 9 月 15 日的两场发布、字节 8 月已经上线的 SeedRealtime、以及同一天企业侧的几条消息放在一起,给出一个可判断的结论。
一、先给结论:竞争重心从「说得好听」转移到「说得同时能干活」
三家给出的答案方向一致,但实现路径差别很大:
- Google 走的是「把推理塞进同一个对话会话」。Extended Thinking 版本边推理边说话,用口播提示告诉你它在做什么,工具调用与 API 请求在后台跑,不打断当前对话。
- 阶跃星辰走的是「把语音做成一条产线」。识别、合成、实时对话、统一音频生成、音乐创作五款模型一次性发齐,全部上线开放平台;实时那款主打推理与语音生成并行、工具调用与长任务异步执行。
- 字节走的是「端到端统一架构」。SeedRealtime 把音频、视频、文本塞进一个网络,连「什么时候该开口」都由模型自己决定,不依赖外挂的语音活动检测模块。
三条路线的差异,最后收敛成一个非常现实的问题:能力最激进的那一个,开发者买不到;能买到的,是托管闭源、按分钟计费。这才是这一轮语音 Agent 竞赛真正分胜负的地方。
二、Google:把「思考」搬进了对话里
Gemini 3.8 Live 这一代,Google 明确说要替代传统「级联式」语音链路——也就是 ASR 转文字、LLM 想答案、TTS 再读出来那套串行流水线。它给出的技术卖点是:语音 Agent 不再需要在思考的时候暂停。
Extended Thinking 版的机制是「边想边说」:接到复杂请求后,先用「让我确认一下」这类短句口头确认,然后一边推进多步推理、一边口播进度,同时后台执行工具调用与 API 请求;如果用户中途插话,对话不中断。Google 的演示里包括用实时视觉上下文下棋、靠语音反馈把白板草图变成可运行的 React 组件、以及现场生成完整商业方案。
除推理并行外,Live API 这一代开放了五项对开发者更实用的能力:
- 异步函数调用:工具与接口调用在后台完成,音频输出持续流向用户,不产生「卡住等你」的空档;
- 视觉上下文:近实时处理画面输入,Agent 能同时理解你说了什么和你看到了什么;
- 字母数字精度:能准确解析确认码、保单号、技术参数——这是传统语音系统最常见的翻车点;
- 多语言无缝切换:自动检测并在 97 种语言之间切换,支持一句话中途换语言,且保持口音一致;
- 增量内容更新:把实时音频与结构化数据合并,返回贴合当前上下文的内容。
接入方式上,Live API 走有状态 WebSocket 长连接,输入为 16kHz 原始 PCM 音频与每秒最多一帧的 JPEG 图像,输出为 24kHz 原始 PCM 音频;开发者可以选择服务端转发,也可以让前端直连。模型 ID 是 gemini-3.8-live 与 gemini-3.8-live-extended-thinking。
三、三个数字看懂 Gemini 3.8 Live 的位置
Google 这一代主要引用第三方榜单说话。把关键数字翻译成人话,是下面这样:
第一个数字:82.6。Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音质量指数(Speech to Speech Quality Index)上拿到 82.6,居首;基础版 Gemini 3.8 Live 为 76.0。作为参照,同一榜单上 OpenAI 的 GPT-Live-1 Astra 为 81.5,Grok Voice Think Fast 2.0 为 81.3——头部三家已经挤进了不到两分的区间,这意味着单纯比「像不像人」的区分度正在消失。
第二个数字:68.6%。这是 Extended Thinking 在 τ-Voice 智能体任务完成率上的成绩,用来衡量「不只是聊天,而是把事办完」的能力。但同一套评测的银行场景变体(Sierra 的 τ-Voice-banking)只有 35.1%——也就是说,即便是当下最好的语音 Agent,在真实金融业务任务里失败率仍然过半。这是本文最重要的一条冷数据:演示视频能跑通的任务,和受监管行业敢上线的任务,中间还隔着很远。
第三个数字:97.7%。这是 Big Bench Audio 音频推理得分;基础版 3.8 Live 在人工偏好的 Speech Agent Arena 中排名第二。这两项说明基础版的性价比定位是成立的——不是「阉割版」,而是面向高并发、成本敏感场景的那一档。
另外两个值得记的细节:一是价格,音频输入约每百万 Token 3 美元、输出 12 美元,折算下来约每分钟 0.005 美元输入、0.018 美元输出(第三方测算输入音频约每小时 0.84 美元,Extended Thinking 约每小时 3.50 美元);二是所有生成音频都带 SynthID 不可感知水印——这条对做内容分发和客服质检的团队是硬约束。
| 对比项 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| 定位 | 高并发、成本敏感 | 复杂多步任务 |
| 语音质量指数 | 76.0 | 82.6(第一) |
| 音频推理 | 97.7%(Big Bench Audio) | 97.7%(Big Bench Audio) |
| 智能体任务 | Speech Agent Arena 第二 | τ-Voice 68.6%;银行场景 35.1% |
| 音频定价 | 约 $0.005/分钟 输入、$0.018/分钟 输出 | 第三方测算约 $3.50/小时 输入音频 |
| 可用渠道 | Gemini API、AI Studio、Search Live、Gemini App | Gemini API、AI Studio、Gemini Enterprise 私测、Docs/Gmail/Keep Live |
四、阶跃星辰:一次发五款,把语音做成一条产线
如果说 Google 是在补「推理」这一块,阶跃星辰这次的动作是把语音相关的所有环节一次性铺满。StepAudio 3 系列包含 Realtime、ASR、TTS、Gen、Music 五款模型,覆盖实时交互、语音识别、语音生成、音频生成与音乐创作,全部已上线阶跃星辰开放平台。
这个产品结构的意图很清楚:过去语音赛道是「单项能力竞争」——识别准的和生成像的各做各的;StepAudio 3 想做的是全栈能力,让模型不只「听」和「说」,而是理解声音背后的语义与情绪,并参与更完整的交互和内容生产。
| 型号 | 主打场景 | 关键能力 |
|---|---|---|
| StepAudio 3 Realtime | 实时语音交互 | 原生全双工、推理与语音生成并行、工具调用与长任务异步执行 |
| StepAudio 3 ASR | 语音识别 | 结合大模型上下文理解,支持中英、方言、中英混说、长音频与专业领域 |
| StepAudio 3 TTS | 真人级语音生成 | 可生成笑声、迟疑、结巴、重复、改口等副语言表现;流式架构边生成边播放 |
| StepAudio 3 Gen | 统一音频生成 | 一次生成人声、音效、环境音与背景音乐,可编排时间与顺序 |
| StepAudio 3 Music | 音乐创作 | 从零生成、清唱配乐、歌曲翻唱,支持基于 ABC 记谱法的多轮交互创作 |
五、StepAudio 3 的几个「全球第一」是怎么拿到的
阶跃这次直接在第三方榜单上对标,几项成绩值得单独说:
- Realtime 在对话动态评测(Conversational Dynamics)以 98.9% 综合得分排名全球第一,语音推理评测以 99.7% 准确率同样是全球第一。它的机制是同时理解语义、语气、情绪、副语言和环境声音,判断「何时回应、何时等待」,并处理临时打断与连续反馈;推理与语音生成并行,工具调用和长任务异步执行、不阻塞当前会话。
- ASR 在非流式语音识别准确性榜单上词错误率 1.7%,并列全球第一。它针对的是真实场景里最难的部分:低声、快语速、含糊连读、歌声和背景音乐;同时按医疗、法律、金融、汽车、编程等专业领域做表达优化。
- TTS 的突破点不在音色,而在副语言。它能还原笑声、迟疑、结巴、重复、改口这些真实交流中常见的表现——这一层恰恰是过去合成语音「一听就是 AI」的根源。
- Gen 走的是统一框架。基于自研的 StepAudio Tokenizer,以 12.5Hz 帧率在共享残差码空间里联合量化语义与波形级声学特征,每个码层都保留这两类信息,因此可以在同一个模型里生成人声、音效、环境声和配乐,并精细控制多个角色的音色、口音、情绪。在中文拟人度竞技场的 Elo 榜上,它以 1755.3 分居首,领先第二名 Qwen-Audio-3.0-TTS-Plus 约 211 分。
- Music 也不再是「一句话生成一首歌」。它支持歌曲创作、清唱配乐、翻唱,以及基于 ABC 记谱法的多轮交互创作,用户通过歌词、清唱或参考歌曲参与编曲迭代。
接入方式与 Google 有区别:Realtime 走 WebSocket 长连接,ASR / TTS / Gen / Music 走 HTTP API 传文本或音频。
六、字节 SeedRealtime:能力最激进,但开发者拿不到
把这三家放在同一张表上,最刺眼的对比其实不在技术,而在可获取性。字节 Seed 的 SeedRealtime 于 2026 年 8 月 5 日发布,定位是原生音视频全双工大模型:用统一架构融合音频、视频与文本,在连续多模态信息流上实现「边看、边听、边说」,目前已在豆包 App 全量上线,可在视频通话中使用。
它的架构主张比另外两家更激进:话轮转换不再是外挂在模型之外的语音活动检测器,而是模型自己决定的事情。这解决的是级联系统的典型病症——ASR 等语句边界、视觉模型按帧采样、LLM 按 Token 推理、TTS 按音频块输出,四套时间尺度对齐稍有偏差,就会出现「话没说完被抢断」「话音已落却反应迟缓」「被背景杂音误触发」。
但证据面是它最大的短板。字节公布的核心数据是一次端到端人工评测:相比级联模型,音视频对话的节奏问题减少一半,单次对话能完整顺畅交流的概率明显提升;另有次级报道称对话流畅度较前代提升约 12%。公开信息里没有样本量、没有评测方法、没有标注人数,也没有毫秒级延迟数据;同时没有 API、没有开源权重、没有技术报告、参数规模与价格均未公布。相比之下,Gemini 3.8 Live 上线当天就开放 API 并公布每分钟定价,阶跃五款模型当天全部上线开放平台。
| 对比项 | Gemini 3.8 Live | StepAudio 3 Realtime | SeedRealtime |
|---|---|---|---|
| 发布时间 | 2026-09-15 | 2026-09-15 | 2026-08-05 |
| 输入模态 | 音频、视频、文本 | 音频、文本 | 音频、视频、文本(原生统一) |
| 开发者可用性 | 当天开放 API 与 AI Studio | 当天上线开放平台 | 无 API、无权重 |
| 公开定价 | 约 $0.005/$0.018 每分钟 | 平台按文档计费 | 未公布 |
| 第三方榜单 | 语音质量 82.6 居首 | 对话动态 98.9%、语音推理 99.7% 居首 | 仅内部人工偏好评测 |
| 音频水印 | SynthID 不可感知水印 | 未公开说明 | 未公开说明 |
| 面向谁 | 开发者与企业采买者 | 开发者与企业、内容生产方 | 豆包 App 个人用户 |
信息图:下面这张图把 Gemini 3.8 Live、阶跃 StepAudio 3 Realtime、字节 SeedRealtime 三家在八个维度上压缩成一张表,重点看「开发者可用性」和「证据面」两行——本轮竞争的分水岭不在跑分,在能不能交付。
七、为什么全行业突然都在做全双工
把三家放在一起会发现一个共同的技术押注:推理必须留在实时会话内部,而不是拆出去单独跑。Google 把这条路线写进了产品定义(Extended Thinking 在同一会话里边想边说),阶跃写成了「推理与语音生成并行」,字节则直接在架构层面把话轮决策交给模型。
这条路线的好处与代价都很明确。好处是应用层的编排复杂度大幅下降——不需要自己维护打断检测、状态机、多模型切换,也就不容易出现「用户插话后上下文丢失」这类工程事故。代价是把延迟管理和成本控制的压力全部压到模型选择上:一旦把复杂任务也交给贵的那一档,语音 Agent 的每分钟成本会迅速失控。
因此,实际部署中更常见的做法是分层路由:简单对话交给基础版模型,只有任务型的少数轮次升级到 Extended Thinking 那一档。这也解释了 Google 为什么要把两款模型分开卖、并明确给出成本区间。
生态侧的动作同样在加速。Gemini Live API 已经与 Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 等实时媒体传输平台打通,开发者只负责交互设计,底层流媒体基建交给合作方;企业侧则公布了 Salesforce、Genspark、Lumeris 等首批合作方。
八、企业侧的门槛:数据留存正在变成采购前置条件
9 月 15 日还有两条容易被忽略、但对「语音 Agent 能不能进企业」影响更大的消息。
第一条是飞书 8.0 与「豆包工作伙伴」。在飞书未来无限大会上,飞书发布 8.0,并推出团队智能体产品「豆包工作伙伴」:它拥有独立身份、权限与记忆,可以像同事一样加入飞书群聊。飞书披露上半年 ARR 为去年同期的 2.5 倍。同期消息称字节已完成 AI 办公业务重组,把豆包、飞书与火山引擎整合为一体化企业智能平台,2026 年上半年营收同比增长 30% 至 1200 亿美元,但 AI 投入加大导致净利润同比下降至 200 亿美元。这条的意义在于形态变化:AI 从「你问它答的工具」变成「被写进组织架构的数字同事」,而语音正是这类数字同事的第一交互界面。
第二条是数据留存成为硬门槛。据 The Information 报道,英伟达、Palantir、博思艾伦等企业正在限制部分 Anthropic 模型的使用,其中 Palantir 要求给出不可撤销的零数据留存承诺;争议源头是 Anthropic 自 6 月起对 Fable 5、Mythos 5 等前沿模型默认保留 30 天使用数据(用途限于安全监测,而非训练)。作为回应,Anthropic 已于 9 月 1 日推出企业前沿安全防护方案,把安全日志存入客户自有云账户,密钥与审核权归客户,今年秋季起分阶段上线。
把这个逻辑套到语音上会更尖锐:语音对话是当下所有 AI 输入形态里最敏感的一类——它天然包含声纹、情绪状态与第三方在场信息。企业采购语音 Agent 时,数据留存策略、日志归属、声纹能否被复用,这些问题的权重正在超过榜单分数。
九、对开发者、企业采买者和普通用户的实际影响
对开发者:语音 Agent 的技术选型窗口已经打开,但要先接受一个事实——你没法只靠榜单选型。Gemini 3.8 Live Extended Thinking 在语音质量上是第一,但银行场景任务完成率只有 35.1%;StepAudio 3 Realtime 在对话动态与语音推理上居首,但接入方式与定价需要按开放平台文档逐项核算。正确做法是拿自己业务里最典型的 50 到 100 通真实对话做端到端评测,重点看任务成功率、打断恢复、工具调用失败率与延迟分布,而不是只看一个综合分。
对企业采买者:今年下半年的采购清单上,建议把三件事前置:一是数据留存与日志归属的合同条款;二是音频水印与生成内容标识的合规要求(Gemini 全线音频带 SynthID,这条对内容分发与合规审计是加分项,对「想拿到完全干净音频」的团队则是约束);三是分层路由的成本模型——把简单轮次与任务型轮次分开计价,语音 Agent 的每分钟成本差距可能是数倍。
对普通用户:最直观的变化是「等待」消失了。语音助手不再需要在你说完之后沉默几秒,也不会因为你插一句话就重新开始。你会越来越多地在语音对话、手机助手和办公套件里,听到那种带停顿、带迟疑、甚至带一声笑的回复——那不是延迟,而是模型在思考的同时把过程说了出来。相应的,判断一段语音是不是 AI 生成,会越来越依赖水印与平台标识,而不再依赖「听起来像不像」。
十、给做工具和做内容的人的三个具体动作
- 如果你在做客服、销售或语音交互类产品,先别急着换模型,先把自己的对话数据跑一遍分层评测。三家头部模型在通用榜单上已经挤进两分区间,区分度来自你的场景,不来自榜单。
- 如果你在做内容生产,StepAudio 3 Gen 与 Music 这类「统一音频生成 + 多轮交互创作」的路径值得试:它可以一次产出人声、音效、环境声与配乐,并且支持按时间与顺序编排,这比拼接多个单点工具更省流程;音乐侧支持 ABC 记谱法多轮迭代,适合已有旋律或歌词、需要反复打磨的场景。同类需求也可以参考 Suno 与 ElevenLabs 的现有能力做横向对照。
- 如果你在评估本地化或私有部署,请先确认一件事实:这一轮最受关注的语音模型全部是闭源托管——Gemini 是托管服务,StepAudio 3 走平台 API,SeedRealtime 更是只存在于豆包 App 内。短期内在自有服务器上跑同等能力的实时全双工语音 Agent,并不现实;可评估的替代路径是开源语音到语音方案与开源语音合成模型的组合,但工程成本与效果差距要自己权衡。
十一、三句话总结
- 考卷换了。语音模型不再比「谁更像人」,而是比「说话的同时能不能把事办完」。Gemini 3.8 Live 把推理留在会话里,StepAudio 3 把语音做成全栈产线,SeedRealtime 把话轮决策交给模型——三条路指向同一个终点。
- 差距不在跑分,在交付。头部三家的语音质量分差已经挤进两分区间,但开发者可用性差得很远:一边是当天开放 API 并公布每分钟定价,另一边是三重证据缺失、接口为零。拿不到的东西,不构成竞争。
- 真正的门槛正在从技术转向合规。银行场景任务完成率 35.1%、企业开始用零数据留存承诺作为采购前提、音频水印成为默认配置——接下来语音 Agent 拼的不是谁更聪明,而是谁更敢被审计。
本文信息整理自 Google DeepMind 官方发布与模型文档、阶跃星辰 StepAudio 3 系列发布信息及开放平台文档、字节跳动 Seed 官方发布信息、Artificial Analysis 公开榜单数据,以及路透社、The Information、澎湃新闻、凤凰网科技、广州日报等媒体报道。相关模型能力、榜单成绩、定价与开放范围均可能随时调整,请以各厂商官方文档与平台公告为准;涉及企业采购与合规安排的判断,请以合同条款与所在地区监管要求为准。