文本转语音(Text-to-Speech,TTS)是让计算机把文字「读出来」的技术。经过几十年发展,TTS已从生硬的电子音进步到带情感、有语气、几乎难辨真假的自然语音,是语音交互系统中负责「说话」的输出端。
技术演进
- 拼接式合成:早年把预录音节拼接成句子,声音生硬、不连贯
- 参数式合成:用统计模型建模发音,更灵活但仍带「机器味」
- 神经网络TTS:端到端深度学习让自然度大幅提升,2016年后成为主流
- 大模型时代:2023年起,端到端大模型TTS在情感表现、多语种、实时性上进一步逼近真人
- 多音色多语言:一个模型支持多种人声与数十种语言
- 情感控制:开心、悲伤、严肃等语气可调节
- 实时合成:延迟低至数百毫秒,足以支撑实时对话
- 声音克隆:与声音克隆技术结合,可复刻指定音色
- 语音助手:智能音箱、手机助手的「开口说话」
- 有声书与新闻播报、视障人士的无障碍阅读
- 车载导航、客服机器人、游戏与短视频配音
- 开源端到端TTS模型已能做到「一句话克隆加高自然度」,个人开发者也能搭建专业级配音流水线;真实度不断提升的同时,内容溯源与防滥用成为重要议题。