HuggingFace Speech-to-Speech 是 Hugging Face 官方出品的本地语音 Agent 管线,把 VAD(语音活动检测)→ STT(语音转写)→ LLM(大模型应答)→ TTS(语音合成)拆成四个可替换阶段,通过 OpenAI Realtime 兼容的 WebSocket API 暴露服务。整套栈可完全跑在本地,数据不出本机,是构建私有语音 Agent 与客服机器人的理想底座,已在数千台 Reachy Mini 机器人上作为对话后端投产。 定价:开源免费(Apache-2.0,自托管,需自备算力)。编辑评分:⭐ 4.3。
HuggingFace Speech-to-Speech 是什么?
HuggingFace Speech-to-Speech 是 Hugging Face 官方出品的本地语音 Agent 管线(开源项目),目标是让开发者用开源模型自建一个能听、会想、能说的语音助手。它把整条链路拆成四个可替换的阶段——VAD(语音活动检测)→ STT(语音转写)→ LLM(大模型应答)→ TTS(语音合成),通过 OpenAI Realtime 兼容的 WebSocket API 暴露服务。整套栈可以完全跑在本地,数据不出本机,是构建私有语音 Agent 与客服机器人的理想底座。它已在数千台 Reachy Mini 机器人上作为对话后端投产。
核心功能
- 低延迟模块化管线:VAD→STT→LLM→TTS,每个阶段独立线程、队列连接,延迟可控。
- 全组件可插拔:STT、LLM、TTS 都能换,LLM 槽位支持任意 OpenAI 兼容协议。
- 本地或云端自由切换:既能指向托管供应商,也能指向本机 vLLM / llama.cpp,做到完全开源栈。
- 默认实时路径:Parakeet TDT 本地 STT + OpenAI 兼容 LLM + Qwen3-TTS 本地语音输出。
- 生产背书:作为 Reachy Mini 机器人的对话后端,已在真实硬件规模运行。
版本/套餐对比
项目本身开源免费(Apache-2.0),无 SaaS 套餐;成本主要是你自托管的算力。开发者按需选择本地模型规模即可。
值不值得用?
如果你要做自己的语音 Agent,而不是接第三方 API,这个项目非常值得。它把语音助手这件原本很碎的事,用一套标准管线收拢起来,又保留每个环节的替换自由。隐私敏感、需要私有部署的团队尤其合适。代价是你需要自己部署和调参。
使用建议
- 先用 pip install speech-to-speech 跑通默认实时服务,再逐步替换模型。
- 想彻底本地化,就用 llama.cpp 起一个 Gemma 之类的本地 LLM 后端指过去。
- 任何 OpenAI Realtime 兼容客户端都能连,直接复用现有前端。
适合谁用?(三档)
- 重度用户:做语音 Agent 产品、客服机器人的团队,拿它当生产底座。
- 中度用户:想给自己的应用加语音交互的开发者,fork 后改组件。
- 轻度用户:单纯想本地跑个语音助手玩的研究者,按文档几步即可。