不会配音、没有录音棚、预算几乎为零——这三条放在以前,基本和”接配音单”无缘。但这两天刷屏的一个国产开源项目,正在把配音副业的门槛直接拆掉:3 秒音频就能克隆一种音色,一句话就能凭空设计一种新声音,30 种语言随意切换,而且完全开源、免费、可商用。

8 月 7 日,面壁智能官方公众号发布了一篇实战案例:有独立开发者用开源的 VoxCPM 模型克隆网红的声音,做出能让 AI”会聊天”的语音应用,引发大量讨论。这个案例之所以火,是因为它让很多人第一次意识到——声音,已经变成了可以”复制粘贴”的数字资产。

VoxCPM 是什么?

VoxCPM 是面壁智能联合清华大学深圳国际研究生院人机语音交互实验室(THUHCSI)、OpenBMB 开源社区共同研发的语音生成模型,今年 4 月开源的 VoxCPM 2 是当前主力版本。它最亮眼的三个能力:

**一句话设计音色。**你不需要提供任何录音,只要用文字描述,比如”年轻女性,温柔甜美,语速稍慢”,它就能凭空生成一个全新的声音。这意味着配音的”音色供给”彻底摆脱了录音样本的限制。

**3 到 10 秒克隆声音。**提供一段 3-10 秒的参考音频,就能复刻出相似的音色,还能通过文字指令调节情绪(开心、悲伤)和语速;提供参考音频加对应文本,可以实现更精细的”像素级”还原,保留呼吸、口音等细微特征,适合影视配音这类高精度场景。

**30 种语言 + 9 种方言。**原生支持英语、日语、法语等 30 种全球主流语言,并对粤语、四川话、东北话、吴语等 9 种中国方言做了深度优化,不需要额外标注语言标签就能自动识别。输出音质达到 48kHz 采样率,接近真人录音质感。

配音副业怎么玩?

结合公开报道里的真实案例,VoxCPM 至少打开了三条副业路径:

**路径一:有声书和短视频配音。**以前接配音单,要么自己有嗓子条件,要么花钱买闭源平台的按字符套餐。现在开源模型本地部署,录几秒自己的声音做参考,就能批量生成稳定的配音输出,有声书、短视频旁白、口播稿一条龙。

**路径二:多语种跨境带货。**据公开报道(腾讯新闻 4 月的实测长文),有人用 VoxCPM 2 一次生成了泰语、越南语、印尼语、马来语、菲律宾语五个版本的 15 秒带货广告脚本,发音让当地人都听不出破绽。同样的活儿,如果用按字符收费的闭源平台,五个语种一天跑 30 条,一个月账单就是几千美金;用开源模型本地跑,成本几乎只是一张显卡的电费。对于跨境电商、出海团队来说,这是实打实的省钱生意。

**路径三:AI 语音应用和虚拟形象。**给数字人配专属声音、给聊天机器人装”会说话的嘴”、给游戏角色做多语言配音——这些都需要低成本、可商用的语音能力,VoxCPM 的开源授权正好满足。

上手有多简单?

官方给的技术栈很完整:支持 Windows、Linux、macOS;一条 `pip install voxcpm` 就能完成部署;提供 LoRA 和全参数微调脚本,可以训练出完全属于你自己的音色;还有 ComfyUI、WebUI 插件,不懂代码的人也能通过界面操作。想先体验的话,官方 Demo 平台(voxcpm.modelbest.cn)在线就能试,把声音描述和目标文本贴进去,点生成就能听到效果。

一个必须强调的底线

能力越强,边界越要清楚。克隆”网红的声音”这类玩法,只限于本人声音或已经获得授权的素材。声音属于个人权益,未经授权克隆、使用他人声音做内容,可能涉及侵权甚至违法。这篇案例之所以值得关注,是因为它展示了一种”AI 赋能创作”的可能性,而不是教大家去盗用别人的声音。用 AI 配音做副业,请始终从”自己的声音、授权的素材、合规的内容”出发。

你想试试吗?

最后问问大家:如果给你 3 秒音频就能克隆一个专属音色,你最想拿它做什么?录有声书、做短视频口播,还是给数字人配个声?评论区聊聊你的想法,说不定这就是你的第一个 AI 副业方向。