你想象一下,跟AI说话不用先打字了。你开口说一句,它直接回你一句,中间那些转文字、生成回复、再合成声音的步骤,全都实时做完。这不是科幻片,是今天刚上GitHub热榜的一个开源项目,叫speech-to-speech。
这个东西说白了就是一个管道:你说话,它先检测你是不是说完了,然后转成文字,送进一个大模型生成回答,最后合成声音播出来。四个环节,每个都能换——你想用本地跑的小模型也行,想接OpenAI的接口也行。最绝的是,它把整套东西打包成了一个WebSocket服务,你写个客户端连上去就能用,延迟很低,已经在几千台机器人上跑着生产环境了。
安装也不折腾。Python 3.10以上,一行pip命令装上,本地就能跑起来。默认用的语音识别是Hugging Face的Parakeet TDT,语音合成是Qwen3-TTS,大模型那格只要是OpenAI兼容的都能接。你要是手头有张N卡,还能用CUDA加速。它甚至贴心地帮你处理了macOS和Linux的依赖差异——Apple Silicon上自动用mlx-audio,别处用GGML后端。
我突然想起《庄子》里那个轮扁。他砍了一辈子车轮,跟齐桓公说,砍得慢了松而不固,快了涩而不入,那个分寸“得之于手而应于心,口不能言”。所以他儿子学不会,七十岁还得自己干。你看,几千年前手艺活最讲究的是“口不能言”的体感。现在倒好,我们费这么大劲,就是把“口不能言”的东西,变成“开口就能说”。