🎙️

全双工语音(Full-Duplex Voice)

Full-Duplex Voice
前沿概念
语音交互多模态

全双工语音(Full-Duplex Voice)指语音助手可以在你还在说话时就开始聆听、理解并适时插话,也允许你随时打断它——就像人和人面对面聊天,而不是传统语音助手的“对讲机模式”(你说完→它想→它说)。

与旧方案的区别

传统链路是三段式流水线:语音识别(ASR)→ 大模型生成文字 → 语音合成(TTS),每段都有延迟,且模型在用户说话时是“聋”的。全双工方案让模型直接在连续音频流上工作,实时感知对方何时停顿、何时该接话,端到端延迟从数秒压缩到几百毫秒。

关键技术

流式音频编解码器(把声音变成模型可处理的离散词元)、说话节奏与轮次预测(什么时候该接话、什么时候该等)、打断恢复(被打断后记住说到哪了)。

应用场景

AI 陪伴与情感陪聊、实时电话客服、口语陪练、车载语音。GPT-4o 的实时语音、各家原生多模态模型都把全双工作为标配方向。它是“语音交互从工具变伙伴”体验的分水岭。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

☆ 0