VoxCPM:多语言语音合成 / 声音克隆工具(重点收藏)

调研日期:2026-08-27 | 数据来源:GitHub API、官方 README(中/英)、ReadTheDocs 文档
仓库:https://github.com/OpenBMB/VoxCPM
合集入口:《AI视频生成工具 & Skill 合集》F. AI 配音工具

一句话定位

面壁智能 + 清华人机交互实验室出品的 Tokenizer-Free(无音频分词器)语音合成系统:用文字描述凭空设计音色、克隆任意声音、支持 30 种语言 + 9 种中文方言,原生 48kHz 输出,Apache-2.0 免费商用。最新版 VoxCPM2 为 20 亿参数,200 万小时多语种训练。

1. 项目背景

  • ⭐ 36145★ · 4132 fork · 113 open issues · Apache-2.0 · Python · 2025-09 创建,2026-08 仍活跃更新
  • 机构:面壁智能(ModelBest)+ 清华大学人机交互实验室(THU-HCSI),基于 MiniCPM-4 基座
  • 版本线:VoxCPM-0.5B(2025-09,HuggingFace Trending #1)→ VoxCPM1.5(2025-12,GitHub Trending #1)→ VoxCPM2(2026-04,最新)
  • VoxCPM2:2B 参数 · 200 万小时音频 · 30 语言 + 9 方言 · 48kHz,技术报告 arXiv:2606.06928
  • 架构:连续音频表征 + 扩散自回归(DiTAR 骨干 + AudioVAE),四阶段 LocEnc → TSLM → RALM → LocDiT
  • 完整生态:vLLM-Omni(官方全模态服务)/ llama.cpp-omni(端侧)/ VoxCPM.cpp / ONNX / Rust / ComfyUI 节点等

2. 环境要求(额外小节)

2.1 官方 Python 运行(推荐)

项 要求
Python ≥3.10 且 <3.13
PyTorch ≥2.5.0
CUDA ≥12.0(NVIDIA GPU)
显存 VoxCPM2 约 8GB(RTX 4090 实测);0.5B/1.5B 约 5–6GB
可跑设备 CUDA / MPS(Apple Silicon)/ CPU(慢)
pip install voxcpm
# 国内网络可先用 modelscope 下载权重:pip install modelscope

2.2 端侧 / 生产部署(可选)

  • 端侧无 Python:llama.cpp-omni(CPU/Metal/CUDA/Vulkan,GGUF,Apple M4 Pro 上 RTF ~1.76 Q8_0)
  • 高吞吐生产:vLLM-Omni(OpenAI 兼容 /v1/audio/speech,PagedAttention,RTX 4090 RTF ~0.13)或 Nano-vLLM
  • 权重下载:HuggingFace(openbmb/VoxCPM2)或 ModelScope(OpenBMB/VoxCPM2,国内友好)

3. 怎么用(详细介绍)

3.1 文本转语音

from voxcpm import VoxCPM
import soundfile as sf

model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)
wav = model.generate(text="VoxCPM2 是目前推荐使用的多语言语音合成版本。",
cfg_value=2.0, inference_timesteps=10, seed=42)
sf.write("demo.wav", wav, model.tts_model.sample_rate)

3.2 音色设计(文字凭空造音色,无需参考音频)

wav = model.generate(text="(年轻女性,声音温柔甜美)你好,欢迎使用VoxCPM2!")

在 text 开头用括号写音色描述:性别、年龄、音色、情绪、语速…

3.3 可控声音克隆(参考音频 + 风格指令)

wav = model.generate(text="(稍快一点,欢快的语气)这是带风格控制的克隆语音。",
reference_wav_path="path/to/voice.wav")

3.4 极致克隆(参考音频 + 精确文本,续写式高保真)

wav = model.generate(text="这是使用VoxCPM2的极致克隆演示。",
prompt_wav_path="path/to/voice.wav",
prompt_text="参考音频的文本转录。",
reference_wav_path="path/to/voice.wav")

3.5 命令行(CLI)

voxcpm design --text "VoxCPM2带来全新语音合成体验。" --output out.wav
voxcpm clone --text "这是一个声音克隆的演示。" --reference-audio path/to/voice.wav --output out.wav
voxcpm batch --input examples/input.txt --output-dir outs # 批量
voxcpm design --text "..." --output out.wav --timestamps --timestamp-level word # 词级时间戳

3.6 Web Demo / 微调 / 部署

  • Web UI:python app.py --port 8808 → http://localhost:8808 (–device auto/cpu/mps/cuda)
  • 微调:支持 SFT + LoRA,5–10 分钟音频即可适配特定说话人/语言/领域;python scripts/train_voxcpm_finetune.py --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml,或 python lora_ft_webui.py(:7860)
  • 生产:vllm serve openbmb/VoxCPM2 --omni --port 8000 → 任意 OpenAI 客户端 curl /v1/audio/speech
  • 在线体验:HuggingFace Space / voxcpm.modelbest.cn(国内)

4. 价值

  • 音色设计独有:文字描述凭空造音色,无需参考音频,同类少见(InstructTTSEval 上 SOTA 或可比)
  • 可商用:Apache-2.0 权重+代码免费商用(GPT-SoVITS/Index TTS 多为非商用或受限)
  • 多语言/方言强:30 语言 + 9 种中文方言(川/粤/吴/东北/河南/陕西/山东/天津/闽南)
  • 48kHz 高质量 + 流式:AudioVAE V2 非对称编解码直接出 48kHz;RTF ~0.3(vLLM-Omni 加速 ~0.13)
  • 生态完整:端侧 GGUF / ComfyUI / Rust / ONNX / 视频配音工具全覆盖
  • 自托管 + 免费本地路径:8GB 显存即可跑,视频制作可白嫖本地 TTS

5. 能力边界

  • ✅ 音色设计 · 可控克隆 · 极致克隆 · 30+9 语言方言 · 48kHz · 流式 · SFT/LoRA · 全平台部署 · 免费商用
  • ❌ 可控生成稳定性:音色/风格结果可能因生成次数而异,官方建议生成 1~3 次挑选(正在改进一致性)
  • ❌ 语言覆盖固定 30 种,未列入语言需自测或微调(官方计划扩展)
  • ⚠️ 显存门槛:VoxCPM2 需约 8GB 显存;纯 CPU 很慢(端侧走 llama.cpp-omni)
  • ⚠️ 极端克隆相似度仍受参考音频质量影响(官方给最佳实践)

6. 对比同类

维度 VoxCPM(本工具) GPT-SoVITS Index TTS Edge TTS
定位 文字造音 + 克隆 + 多语 个人音色微调 免训练克隆 在线免费批量
Star 36k 61k 23k 12k
音色设计 ✅ 文字凭空造 ❌ ❌ ❌
语言 30+9 方言 中英日韩粤 多语种 300+ 音色
商用许可 ✅ Apache-2.0 ⚠️ 需确认 开源 ✅
硬件 8G 显存 需训练显卡 无需训练 无需显卡
额外 端侧 GGUF / vLLM / ComfyUI 微调强 带情绪控制 在线+字幕文件

结论:四款里 VoxCPM 是唯一”文字造音色 + 多语 + 可商用 + 生态全“的,最适合做视频口播/本地 TTS;缺点是新版本可控性需自测。

7. 安全风险(重点分析)

用户要求专门评估安全风险。TTS 克隆类工具核心风险在滥用与合规。

7.1 滥用风险(官方明确警示)

  • 声音克隆能力可生成高度逼真语音——官方 README 明确:严禁用于冒充他人、欺诈、虚假信息传播,强烈建议对所有 AI 生成内容明确标注
  • 典型红线:伪造名人/他人语音、诈骗电话、虚假录音证据、伪造金融确认

7.2 供应链 / 技术风险(低)

  • 依赖 PyTorch/transformers 生态,pip install voxcpm 走默认源 → 建议生产用私有源/lock(同其他 Python 项目)
  • 权重从 HuggingFace / ModelScope 下载,官方发布 → 供应链风险低;建议核验 sha256(HF 提供)
  • WebUI 默认本地 :8808 → 若暴露公网需注意访问控制(模型加载 + 合成服务)

7.3 合规建议

  • ✅ 只克隆自己有授权的声音(本人/客户明确授权);商用前确认被克隆者同意
  • ✅ 生成内容添加 AI 水印/标注(官方建议;部分平台要求强制披露)
  • ⚠️ 多语种/方言输出若涉及他人隐私、肖像或商用,按当地法律(如中国《民法典》声音权益、Deepfake 相关法规)把控

7.4 总体评价

代码/权重供应链风险低(官方发布 + Apache-2.0),真正的风险在”用”——声音克隆的滥用与合规边界,必须由使用者自律把控。

8. 社区反馈 / 可靠性

  • 36k★ / 4k fork,2025-09 起一路 GitHub/HF Trending #1,2026-08 仍活跃
  • 官方技术报告 2 篇(ICLR 2026 收录)、ReadTheDocs 完整文档、飞书群 + Discord 社区
  • 大量社区生态(vLLM-Omni 官方原生支持、llama.cpp-omni、ComfyUI、视频配音翻译工具等)佐证活跃度
  • 可靠性结论:面壁+清华背书、Apache-2.0、持续更新,是当前开源 TTS 第一梯队;新版本(VoxCPM2)建议实际生成自测中文/方言效果

refer

声明:

  1. 若文章存在错误,望诸君不吝指正^

  2. blog仅供个人记录学习所用

  3. 部分笔记由于年代久远,做的笔记找不到最初是引用谁的,若是不允许引用转载,请联系我