# AI 语音合成同日开战：Google 30 秒克隆声音，千问全线降价 95%（2026年9月）

9月23日，两条语音大新闻同日落地：谷歌上线 Gemini 3.8 Flash TTS 与 Flash-Lite TTS，30 秒样本即可克隆声音，促销价每百万音频输出 token 低至 6~9 美元；同日阿里千问在云栖大会发布 Qwen-Audio-3.1 五款语音模型，全线降价，语音识别最高降 95%。AI 语音合成正式进入「白菜价 + 强合规」双拐点。

![谷歌与阿里同日掀起语音价格战](https://www.aitoollab.cn/images/articles/tts-price-war-gemini-qwen-audio-2026/price-war-article.png)

## 同一天，两条完全不同的路线

谷歌走「创意导演 + 声音克隆」：Flash TTS 主打按行表演指令，笑声、叹气、语速、方言切换都能写进脚本，还支持单脚本排双角色对话；Flash-Lite TTS 面向配音与语音代理的高吞吐场景。预设音色从 30 个扩到 2000+，覆盖 100 多种语言，也能用一句话描述设计音色。

阿里走「全栈 + 降价」：ASR、TTS、Realtime 三大基础模型全面升级，新增音频创作模型 TTS-Next（单次同步生成语音、音效、背景音）与音频理解模型 ASR-Next（多说话人、时间戳、情绪与环境声识别）。配套还开源了 Qwen-Audio-Agent 框架。

## 价格账：促销价和长期价要分开算

| 方案 | 输入（每百万 token） | 音频输出 | 备注 |
|---|---|---|---|
| Gemini 3.8 Flash TTS | $0.50 | $9 | 促销至 2026-12-31，2027 年起 $18 |
| Gemini 3.8 Flash-Lite TTS | $0.50 | $6 | 2027 年起 $12，批处理再减半 |
| 千问 TTS-Flash | ¥1.5 | ¥12 | TTS 全线降约 70% |
| 千问 ASR-Flash | ¥0.8 | ¥2.7 | ASR 最高降 95% |

两个坑：谷歌的 $9/$6 是促销价，官方定价页写明 2027 年 1 月起音频输出翻倍，对比旧版 3.1 的 $20 只便宜约 10%~40%；千问降幅为官方口径，暂无第三方比价，成本模型建议按长期价算。

![千问 Qwen-Audio-3.1 五款模型与降价明细](https://www.aitoollab.cn/images/articles/tts-price-war-gemini-qwen-audio-2026/qwen-audio-31-article.png)

## 声音克隆的合规门，才是真正的分水岭

谷歌的克隆要求 30 秒样本之外，再录一段同长度的本人同意语音，比对通过才生成可复用声音 ID；所有输出自带 SynthID 水印与 C2PA 凭证。但克隆在伊利诺伊州、得州、欧盟、英国、瑞士、印度直接不可用——法务高风险地区一步到位地禁了。国内这边，千问暂未开放同类克隆，音色能力限于跨语言迁移。

对做产品的团队，这一段比跑分更重要：能跑通同意验证链路的，声音资产才敢规模化；跑不通的，克隆声音就是法律负债。

## 质量怎么看：榜单第一之外的两个保留

谷歌引用 Hume AI 榜单：Flash TTS 以 71.4 分居 Voice Design Benchmark 第一，重音建模 60.8 分也是第一，两款模型包揽 Hume 综合质量指数前两名。但有两点保留：榜单为厂商引用，Hume 创始人还联名了谷歌发布文；同一评测体系里，[ElevenLabs](https://www.aitoollab.cn/tools/elevenlabs/) 在单音色质量与类人变化两项仍然更高。

## 中文场景怎么选

- **有声书、短视频配音走量**：千问 TTS-Flash（输出 ¥12/百万 token）或 [CosyVoice](https://www.aitoollab.cn/tools/cosy-voice/)，情绪语速用指令调。
- **人声 + 音效 + 背景音一次成片**：TTS-Next 是目前少有的一条流水线方案，适合播客与短剧。
- **多角色播客、游戏角色（英文为主）**：Flash TTS 的按行表演指令更合适，[Gemini](https://www.aitoollab.cn/tools/gemini/) 生态内 Notebook 已内置。
- **转写预算敏感**：ASR 降 95% 后接近免费；同日讯飞 [星火](https://www.aitoollab.cn/tools/xinghuo-iflytek/) 发布的 Spark-ASR-2.0 走精度路线，可对照测。

> 信息图：Gemini 3.8 Flash TTS、千问 TTS 与 ElevenLabs 三方案同维度对比。

## 写在最后

语音正在重演文本模型的价格战剧本：识别先变白菜价，合成紧随其后，差异化押在「创作」上。2027 年 1 月促销到期是明确时间锚——按翻倍价也算得过来的产品现在就可以迁；只靠促销价跑得通的，先别把成本模型写死。