📋 编辑总结
voice-pro 是 abus-aikorea 开源的一站式 AI 配音与语音处理套件,本质上是一个基于 Gradio 的 WebUI,把视频/音频下载、人声分离、转录、声音克隆、TTS、翻译全部塞进同一条工作流。它最早是商业项目,后来把整套代码开源,因此常被称为开源版 ElevenLabs。对做双语字幕、多语种配音、视频本地化的创作者来说,它是一个能把订阅账单打到零的本地替代方案。 定价:开源免费(开源后完全免费、无时长限制;官方 ABUS 商业完整版需购买,价格见官网)。编辑评分:⭐ 4.2。

voice-pro 是什么?

voice-pro 是 abus-aikorea 开源的一站式 AI 配音与语音处理套件,本质上是一个基于 Gradio 的 WebUI,把创作者平时要来回切换的好几个工具——视频/音频下载、人声分离、转录、声音克隆、TTS、翻译——全部塞进同一条工作流。它最早是商业项目,后来把整套代码开源,因此常被称为开源版 ElevenLabs。对做双语字幕、多语种配音、视频本地化的创作者来说,它是一个能把订阅账单打到零的本地替代方案。

核心功能

  • 音频提取:内置 yt-dlp,可直接下载并处理 YouTube 等平台内容。
  • 人声分离:用 Demucs 把人声与背景音乐干净分离,提升克隆质量。
  • 高精度转录:支持 Faster-Whisper、Whisper-Timestamped 等,做到词级时间轴。
  • 零样本声音克隆:集成 F5-TTS、E2-TTS、CosyVoice,少量参考音频即可复刻音色。
  • 文本转语音:内置 Edge-TTS 与 kokoro,自然度高、开箱即用。
  • 多语种翻译:集成 Deep-Translator,覆盖 100+ 语种。

版本/套餐对比

开源免费、无时长限制;需要商业无限制版本可购买 ABUS 官方版,具体价格见官网。

值不值得用?

对内容创作者,voice-pro 很值得。它一次性解决了下载—分离—转录—克隆—合成—翻译的完整链路,省去在四五个 SaaS 之间倒腾文件和预算。前提是你能接受本地部署的硬件门槛:建议 NVIDIA 显卡 4–8GB 显存,首次还要下载约 10GB 模型。

使用建议

  • Windows 用户跑 configure.bat + start.bat 基本一键安装;Linux/Mac 用 .sh 版本。
  • 显存吃紧就把 Denoise 调到 0/1,并用 int 计算类型换速度。
  • 长内容用 large 模型换准确率,短内容 medium/small 足够。

适合谁用?(三档)

  • 重度用户:出海视频创作者、需要批量多语种配音的团队。
  • 中度用户:偶尔做配音、翻译的 UP 主,本地跑省钱。
  • 轻度用户:想体验声音克隆的玩家,先免费版试水。