🎤 Codex + Voicebox:开源声音克隆,短剧配音利器
短剧配音的痛点:找一个合适的配音演员要花钱、要排期、要一遍遍录。剧里有几个角色就得找几个人,100 集的短剧光配音就能把人折腾死。
Voicebox 来解这个题。
Voicebox 是开发者 Jamie Pine(同时也是开源文件管理器 Spacedrive 的作者)打造的 本地优先、完全免费的 AI 语音克隆工作室。GitHub 上已有 17,900+ Star,下载量超过 100 万次。
它和 ElevenLabs 这类付费服务最大的区别是:
- 本地运行 — 你的声音数据不出你的电脑,隐私安全
- 完全免费 — 无 API 费用、无字数限制、无角色费
- 3 秒克隆 — 最低 3 秒音频就能克隆一个声音
- 7 种 TTS 引擎 — Qwen3-TTS、Chatterbox、LuxTTS、Kokoro 等,按需切换
- 23 种语言 — 中文、英文、日文、韩文……出海短剧也能用
- 内置 REST API + MCP — Codex 可以直接调用 Voicebox 生成配音
搭配 Codex,你可以用自然语言指挥整个配音流程——写剧本、调用 Voicebox 生成配音、调整语气、批量处理。
🎯 适合谁用?
🎬 短剧创作者
一部短剧几十上百集,每集多个角色对话。Voicebox 克隆几个声音模板,每集剧本写完直接批量生成配音。
📹 视频博主
做解说视频、产品评测、知识科普,需要稳定的旁白声音。克隆一次自己的声音,以后每期视频自动配音。
📚 有声书/播客
把文字内容转成有声书,支持 23 种语言、多角色切换。长文本有 TADA 引擎支持 700 秒+ 连贯输出。
🤖 AI 内容工作室
用 AI 写剧本 → Voicebox 配音 → Remotion 生成画面 → 全自动出片。Voicebox 的 REST API 让一切可编程。
📦 下载与安装
下载 Voicebox
Voicebox 是独立的桌面应用,支持 Windows、macOS、Linux:
- 访问官网 voicebox.sh 或 GitHub 搜索 jamiepine/voicebox
- 下载对应操作系统的安装包(无需安装依赖,开箱即用)
- 安装后打开应用,你会看到一个简洁的语音工作室界面
克隆第一个声音
三种方式获取声音样本:
- 上传文件 — 拖入 WAV、MP3、FLAC 或 WebM 音频文件
- 麦克风录制 — 直接对着电脑说几句话,最长 30 秒
- 系统音频捕获 — 从 YouTube 视频、播客等任意应用中捕获音频
只需 3 秒 的音频即可完成克隆。样本越清晰、越干净,克隆效果越好。
用 Codex 调用 Voicebox
Voicebox 内置 REST API,Codex 可以直接发送请求生成配音。在 Codex 中告诉它:
我想用 Voicebox 生成一段短剧配音:
1. 用"温柔女声"这个声音模板(之前克隆好的)
2. 为以下台词配音:
"你终于来了,我等了你好久。"(语气:温柔)
"你以为这就结束了?才刚刚开始。"(语气:冷笑)
3. 调用 Voicebox 的 REST API (http://localhost:8080)
4. 输出为 MP3 文件,分别保存
🎨 实用案例
案例 1:短剧多角色配音
一集短剧 3 个角色:男主角、女主角、反派。准备 3 段各 10 秒的声音样本,让 Voicebox 分别克隆并保存为声音模板。之后每集剧本写完,用 Codex 调用 Voicebox API 批量生成配音,3 个角色的台词一次性搞定。
案例 2:旁白 + 角色对话混合
解说类视频需要旁白 + 角色对话。克隆一个旁白声音,再克隆角色声音。Voicebox 的多轨编辑器可以精细编排时间线:旁白 3 秒 → 角色 A 对话 5 秒 → 旁白 2 秒 → 角色 B 对话 4 秒。
案例 3:个性人设配音
Voicebox 支持给声音模板设置"人格"(Personality)。比如给一个声音设置"1940 年代黑色电影侦探"的人格,Voicebox 会自动用那种语气和措辞风格来说话。短剧里每个角色都可以有专属的声音人格。
案例 4:AI 全自动短剧流水线
剧本用 AI 写 → Voicebox 通过 REST API 配音 → Remotion 生成画面 → FFmpeg 合成 → 自动上传。每句台词 Codex 自动调用 API,全程不需要手动操作。
🔧 选哪个 TTS 引擎?
Voicebox 支持 7 种 TTS 引擎,不同场景选不同的引擎:
- Qwen3-TTS(通义千问)— 中文效果最佳,支持自然语言语气控制。说"说慢点、温暖一点",它就真的能做到。做中文短剧首选。
- Chatterbox(Resemble AI)— 23 种语言支持最广,适合出海短剧。支持情感夸张度调节。
- LuxTTS(ZipVoice)— CPU 上跑得飞快(150 倍实时),48kHz 高采样率。适合快速试听和迭代。
- TADA(Hume AI)— 专为长文本设计,700 秒以上连贯输出不漂移。适合有声书、长篇播客。
- Kokoro(hexgrad)— 只有 82M 参数,CPU 实时运行。低配电脑的福音。
⚠️ 避坑清单
- 样本质量决定上限 — 背景噪音、回声、电音都会放大到克隆结果中。录样本请在安静环境,嘴离麦 10-15cm。
- 别要求克隆不存在的音色 — 男声样本克隆不出甜美女声。样本有什么音色、语调范围,克隆结果就在什么范围内。
- 情感表达靠样本引导 — 想要愤怒的语气,样本里最好有愤怒片段。纯平静语气的样本克隆出来说话永远像播音员。
- 长文本分段处理 — 超过 200 字的台词分段生成,每句控制好语气和停顿,最后拼起来比一次性生成效果好。
- 配音和 BGM 分开处理 — 先出纯配音,再用视频编辑软件加背景音乐。不要混在一起处理。
- 第一次启动要下载模型 — Voicebox 的引擎模型需要本地下载,根据网络情况可能需要几分钟到十几分钟。耐心等待。
🔄 完整工作流(短剧篇)
- 下载并安装 Voicebox(voicebox.sh)
- 启动 Voicebox,下载需要的 TTS 引擎(中文推荐 Qwen3-TTS)
- 准备每个角色的声音样本(每段 5-10 秒 WAV/MP3,安静环境录制)
- 在 Voicebox 中克隆声音并保存为模板
- 写剧本台词,标注每句的语气要求
- 用 Codex 调用 Voicebox API 逐句生成配音
- 在 Voicebox 多轨编辑器中检查并调整时间线
- 用 Remotion 生成对应画面(可选)
- 合成配音 + 画面 + BGM → 导出成品视频
- 发布到短剧平台!
🎉 把配音交出去
Codex + Voicebox 不是让你变成配音演员,而是让你不用找配音演员也能做出好声音。
把时间留给剧本和创意——让开源工具帮你完成录音棚里的重复劳动。
Voicebox by Jamie Pine · voicebox.sh · GitHub: jamiepine/voicebox · 免费 · 开源 · 本地运行