Voicebox:让 Codex 用你的声音汇报结果
https://github.com/jamiepine/voicebox
Codex 写完代码以后,不再只是在屏幕上告诉你“任务完成”,而是直接用你的声音念出来。
听起来有点离谱,但一个名叫 Voicebox 的开源项目,已经把这件事做成了。
Voicebox 是一个本地优先的 AI 语音工作室。录制或上传几秒钟的声音样本,创建一个声音档案,再输入一段文字,它就能用这个声音生成语音。更有意思的是,它内置了 MCP 服务,可以让 Claude Code、Cursor、Cline,以及能够连接 MCP 的 Codex 等 AI Agent 直接调用。
于是就可以出现这样的场景:
“测试已经通过,可以合并代码了。”
这句话不是系统默认女声,也不是云端 TTS 的某个公共音色,而是从你自己授权的样本克隆出来的声音。
写稿时,这个项目在 GitHub 上已经超过 4.3 万 Star,采用 MIT 许可证。
它不只是声音克隆工具
如果只是输入文字生成语音,开源 TTS 项目已经很多。Voicebox 的特别之处,是把语音克隆、文字转语音、语音输入、音频编辑和 Agent 接口放进了同一个桌面应用。
目前它集成了 7 套 TTS 引擎:
- Qwen3-TTS;
- Qwen CustomVoice;
- LuxTTS;
- Chatterbox Multilingual;
- Chatterbox Turbo;
- HumeAI TADA;
- Kokoro。
这些模型各有侧重。有的适合多语言声音克隆,有的体积小、可以在 CPU 上快速运行,有的支持笑声、叹气、咳嗽等表达标签,还有的提供大量预设音色。
项目所说的“支持 23 种语言”,主要来自 Chatterbox Multilingual。并不是每个引擎都支持全部 23 种语言。例如 Qwen3-TTS 和 Qwen CustomVoice 支持 10 种,Kokoro 支持 8 种,LuxTTS 和 Chatterbox Turbo 当前主要面向英语。
声音数据留在本机
Voicebox 强调 local-first。模型、声音样本、录音和生成结果都可以保存在自己的电脑上,本地模型推理不需要把声音交给云端 TTS 服务。
这对声音克隆尤其重要。声音本身已经接近一种生物特征,如果上传到不清楚用途的服务,风险并不比上传人脸低。能够在本地完成克隆和生成,是 Voicebox 相比很多在线配音平台的核心优势。
当然,本地运行不等于没有成本。第一次使用某个模型时需要下载文件,体积从几百 MB 到数 GB 不等。官方文档建议至少准备 8GB 内存和 5GB 空间,想获得更流畅的生成速度,最好有 16GB 以上内存和可用 GPU。CPU 也能运行,只是速度会慢不少。
语速、情绪和风格怎么控制
Voicebox 可以通过不同模型和后处理效果调整声音。Qwen 系列支持“慢一点说”“低声说”等自然语言指令;Chatterbox Turbo 可以识别 [laugh]、[sigh]、[gasp] 等标签。
生成完成后,还可以继续添加音高、混响、延迟、合唱、压缩、增益和高低通滤波等效果。长文章会按照句子自动切分,分段生成后再交叉淡化拼接,避免一次输入太长。
不过,“情绪可调”也不能理解为所有模型都能精确控制所有情绪。README 特别提醒,只有 Chatterbox Turbo 会把笑声、叹气等标签当作表达指令,其他一些引擎可能会直接把标签念出来。
让 Codex 和 Claude Code 真正开口
Voicebox 同时提供 REST API 和 MCP Server。接入以后,Agent 只需要调用一个工具:
voicebox.speak({
text: "部署完成。",
profile: "我的声音"
})
就可以让电脑播放对应语音。
可以给不同 Agent 绑定不同声音。比如 Claude Code 使用一种声音,Cursor 使用另一种声音,不看屏幕也能判断是谁在汇报。除了“说话”,MCP 还提供语音转写、声音档案列表和录音记录查询等工具。
它并不是 Codex 的官方语音插件,但只要当前 Codex 环境能够连接本地 MCP,就可以接入 Voicebox。服务默认监听本机的 127.0.0.1:17493,不会直接开放到公网。
需要注意的是,当前本地 MCP 接口没有鉴权。正常情况下只有本机进程能够访问,但不要把它随意监听到局域网或公网地址。官方文档也明确表示,如果改成非本机地址,应增加令牌保护,而内置 Bearer Token 仍在后续计划中。
它也能充当本地语音输入法
Voicebox 的另一面是语音输入。按下全局快捷键说话,它会通过本地 Whisper 转成文字,还可以用本地 Qwen3 小模型删除“嗯”“啊”、重复和口误。
在 macOS 上,识别结果可以直接粘贴到当前输入框。Windows 和 Linux 的自动粘贴能力还在路线图中,但应用内录音和转写已经可以使用。
这使它不只是“开源版 ElevenLabs”。更准确地说,它把 ElevenLabs 式的声音输出和 Wispr Flow 式的语音输入放在了一起,中间再接上 AI Agent。
使用自己的声音,也要有边界
声音克隆很方便,也很容易被滥用。
Voicebox 无法自动判断一段声音属于谁。项目的 Responsible Use 文件明确要求:只能克隆自己的声音,或者已经获得明确授权、具有合法许可的声音。不能用来冒充他人、诈骗、钓鱼、绕过声纹验证,或者制作误导性的政治、医疗、金融和紧急通知。
如果对外发布合成语音,也应按照法律、平台规则和受众预期说明这是 AI 生成的内容。
值不值得装
如果只是偶尔听一下文章,系统自带 TTS 已经够用。
但如果经常做视频配音、播客、游戏角色语音,或者希望 Coding Agent 在长任务结束后主动语音提醒,Voicebox 就比较有意思。它把声音克隆、多模型切换、长文本生成、音频效果和 Agent 接口集中在一个本地应用里。
核心项目完全开源,macOS 和 Windows 有现成安装包,Linux 目前主要通过 Docker 或源码安装。第一次下载模型和配置 GPU 可能需要一点耐心,但比起把声音长期托管在云端,本地方案至少把数据控制权留在了自己手里。
一句话概括:
Voicebox 像是一个本地开源版 ElevenLabs,再加上一套让 AI Agent 开口说话的语音中枢。