AI 语音合成同日开战:Google 30 秒克隆声音,千问全线降价 95%(2026年9月)
谷歌 Gemini 3.8 Flash TTS 与阿里千问 Qwen-Audio-3.1 同日发布:30 秒声音克隆与同意验证、SynthID 水印、促销价 2027 年翻倍、ASR 降价 95%,中文配音选型全解析。
9月23日,两条语音大新闻同日落地:谷歌上线 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,30 秒样本即可克隆声音,促销价每百万音频输出 token 低至 6~9 美元;同日阿里千问在云栖大会发布 Qwen-Audio-3.1 五款语音模型,全线降价,语音识别最高降 95%。AI 语音合成正式进入「白菜价 + 强合规」双拐点。
同一天,两条完全不同的路线
谷歌走「创意导演 + 声音克隆」:Flash TTS 主打按行表演指令,笑声、叹气、语速、方言切换都能写进脚本,还支持单脚本排双角色对话;Flash-Lite TTS 面向配音与语音代理的高吞吐场景。预设音色从 30 个扩到 2000+,覆盖 100 多种语言,也能用一句话描述设计音色。
阿里走「全栈 + 降价」:ASR、TTS、Realtime 三大基础模型全面升级,新增音频创作模型 TTS-Next(单次同步生成语音、音效、背景音)与音频理解模型 ASR-Next(多说话人、时间戳、情绪与环境声识别)。配套还开源了 Qwen-Audio-Agent 框架。
价格账:促销价和长期价要分开算
| 方案 | 输入(每百万 token) | 音频输出 | 备注 |
|---|---|---|---|
| Gemini 3.8 Flash TTS | $0.50 | $9 | 促销至 2026-12-31,2027 年起 $18 |
| Gemini 3.8 Flash-Lite TTS | $0.50 | $6 | 2027 年起 $12,批处理再减半 |
| 千问 TTS-Flash | ¥1.5 | ¥12 | TTS 全线降约 70% |
| 千问 ASR-Flash | ¥0.8 | ¥2.7 | ASR 最高降 95% |
两个坑:谷歌的 $9/$6 是促销价,官方定价页写明 2027 年 1 月起音频输出翻倍,对比旧版 3.1 的 $20 只便宜约 10%~40%;千问降幅为官方口径,暂无第三方比价,成本模型建议按长期价算。
声音克隆的合规门,才是真正的分水岭
谷歌的克隆要求 30 秒样本之外,再录一段同长度的本人同意语音,比对通过才生成可复用声音 ID;所有输出自带 SynthID 水印与 C2PA 凭证。但克隆在伊利诺伊州、得州、欧盟、英国、瑞士、印度直接不可用——法务高风险地区一步到位地禁了。国内这边,千问暂未开放同类克隆,音色能力限于跨语言迁移。
对做产品的团队,这一段比跑分更重要:能跑通同意验证链路的,声音资产才敢规模化;跑不通的,克隆声音就是法律负债。
质量怎么看:榜单第一之外的两个保留
谷歌引用 Hume AI 榜单:Flash TTS 以 71.4 分居 Voice Design Benchmark 第一,重音建模 60.8 分也是第一,两款模型包揽 Hume 综合质量指数前两名。但有两点保留:榜单为厂商引用,Hume 创始人还联名了谷歌发布文;同一评测体系里,ElevenLabs 在单音色质量与类人变化两项仍然更高。
中文场景怎么选
- 有声书、短视频配音走量:千问 TTS-Flash(输出 ¥12/百万 token)或 CosyVoice,情绪语速用指令调。
- 人声 + 音效 + 背景音一次成片:TTS-Next 是目前少有的一条流水线方案,适合播客与短剧。
- 多角色播客、游戏角色(英文为主):Flash TTS 的按行表演指令更合适,Gemini 生态内 Notebook 已内置。
- 转写预算敏感:ASR 降 95% 后接近免费;同日讯飞 星火 发布的 Spark-ASR-2.0 走精度路线,可对照测。
信息图:Gemini 3.8 Flash TTS、千问 TTS 与 ElevenLabs 三方案同维度对比。
写在最后
语音正在重演文本模型的价格战剧本:识别先变白菜价,合成紧随其后,差异化押在「创作」上。2027 年 1 月促销到期是明确时间锚——按翻倍价也算得过来的产品现在就可以迁;只靠促销价跑得通的,先别把成本模型写死。
❓ 常见问题
谷歌要求在 30 秒样本之外再录制一段本人同意语音并通过比对,输出自带 SynthID 水印与 C2PA 凭证;克隆功能在欧盟、英国、伊利诺伊州等地不可用。未获授权克隆他人声音仍有法律风险。
官方口径:ASR 最高降 95%(ASR-Flash 每百万 token 输入 0.8 元、输出 2.7 元),TTS 降约 70%(TTS-Flash 输入 1.5 元、输出 12 元),Realtime 降约 85%。降幅为厂商发布数据,暂无第三方独立比价。
不会。官方定价页写明促销价仅到 2026 年 12 月 31 日,2027 年 1 月 1 日起音频输出价格翻倍(Flash TTS $18、Flash-Lite $12)。长期成本模型建议按翻倍后的价格测算。
走量选千问 TTS-Flash 或 CosyVoice 等国产方案;需要人声、音效、背景音一次生成选 TTS-Next;多角色英文内容可试 Gemini Flash TTS 的按行表演指令。