VoxCPM-多语言语音合成工具
VoxCPM:多语言语音合成 / 声音克隆工具(重点收藏)
调研日期:2026-08-27 | 数据来源:GitHub API、官方 README(中/英)、ReadTheDocs 文档
仓库:https://github.com/OpenBMB/VoxCPM
合集入口:《AI视频生成工具 & Skill 合集》F. AI 配音工具
一句话定位
面壁智能 + 清华人机交互实验室出品的 Tokenizer-Free(无音频分词器)语音合成系统:用文字描述凭空设计音色、克隆任意声音、支持 30 种语言 + 9 种中文方言,原生 48kHz 输出,Apache-2.0 免费商用。最新版 VoxCPM2 为 20 亿参数,200 万小时多语种训练。
1. 项目背景
- ⭐ 36145★ · 4132 fork · 113 open issues · Apache-2.0 · Python · 2025-09 创建,2026-08 仍活跃更新
- 机构:面壁智能(ModelBest)+ 清华大学人机交互实验室(THU-HCSI),基于 MiniCPM-4 基座
- 版本线:VoxCPM-0.5B(2025-09,HuggingFace Trending #1)→ VoxCPM1.5(2025-12,GitHub Trending #1)→ VoxCPM2(2026-04,最新)
- VoxCPM2:2B 参数 · 200 万小时音频 · 30 语言 + 9 方言 · 48kHz,技术报告 arXiv:2606.06928
- 架构:连续音频表征 + 扩散自回归(DiTAR 骨干 + AudioVAE),四阶段 LocEnc → TSLM → RALM → LocDiT
- 完整生态:vLLM-Omni(官方全模态服务)/ llama.cpp-omni(端侧)/ VoxCPM.cpp / ONNX / Rust / ComfyUI 节点等
2. 环境要求(额外小节)
2.1 官方 Python 运行(推荐)
| 项 | 要求 |
|---|---|
| Python | ≥3.10 且 <3.13 |
| PyTorch | ≥2.5.0 |
| CUDA | ≥12.0(NVIDIA GPU) |
| 显存 | VoxCPM2 约 8GB(RTX 4090 实测);0.5B/1.5B 约 5–6GB |
| 可跑设备 | CUDA / MPS(Apple Silicon)/ CPU(慢) |
pip install voxcpm |
2.2 端侧 / 生产部署(可选)
- 端侧无 Python:llama.cpp-omni(CPU/Metal/CUDA/Vulkan,GGUF,Apple M4 Pro 上 RTF ~1.76 Q8_0)
- 高吞吐生产:vLLM-Omni(OpenAI 兼容 /v1/audio/speech,PagedAttention,RTX 4090 RTF ~0.13)或 Nano-vLLM
- 权重下载:HuggingFace(openbmb/VoxCPM2)或 ModelScope(OpenBMB/VoxCPM2,国内友好)
3. 怎么用(详细介绍)
3.1 文本转语音
from voxcpm import VoxCPM |
3.2 音色设计(文字凭空造音色,无需参考音频)
wav = model.generate(text="(年轻女性,声音温柔甜美)你好,欢迎使用VoxCPM2!") |
在 text 开头用括号写音色描述:性别、年龄、音色、情绪、语速…
3.3 可控声音克隆(参考音频 + 风格指令)
wav = model.generate(text="(稍快一点,欢快的语气)这是带风格控制的克隆语音。", |
3.4 极致克隆(参考音频 + 精确文本,续写式高保真)
wav = model.generate(text="这是使用VoxCPM2的极致克隆演示。", |
3.5 命令行(CLI)
voxcpm design --text "VoxCPM2带来全新语音合成体验。" --output out.wav |
3.6 Web Demo / 微调 / 部署
- Web UI:
python app.py --port 8808→ http://localhost:8808 (–device auto/cpu/mps/cuda) - 微调:支持 SFT + LoRA,5–10 分钟音频即可适配特定说话人/语言/领域;
python scripts/train_voxcpm_finetune.py --config_path conf/voxcpm_v2/voxcpm_finetune_lora.yaml,或python lora_ft_webui.py(:7860) - 生产:
vllm serve openbmb/VoxCPM2 --omni --port 8000→ 任意 OpenAI 客户端 curl /v1/audio/speech - 在线体验:HuggingFace Space / voxcpm.modelbest.cn(国内)
4. 价值
- 音色设计独有:文字描述凭空造音色,无需参考音频,同类少见(InstructTTSEval 上 SOTA 或可比)
- 可商用:Apache-2.0 权重+代码免费商用(GPT-SoVITS/Index TTS 多为非商用或受限)
- 多语言/方言强:30 语言 + 9 种中文方言(川/粤/吴/东北/河南/陕西/山东/天津/闽南)
- 48kHz 高质量 + 流式:AudioVAE V2 非对称编解码直接出 48kHz;RTF ~0.3(vLLM-Omni 加速 ~0.13)
- 生态完整:端侧 GGUF / ComfyUI / Rust / ONNX / 视频配音工具全覆盖
- 自托管 + 免费本地路径:8GB 显存即可跑,视频制作可白嫖本地 TTS
5. 能力边界
- ✅ 音色设计 · 可控克隆 · 极致克隆 · 30+9 语言方言 · 48kHz · 流式 · SFT/LoRA · 全平台部署 · 免费商用
- ❌ 可控生成稳定性:音色/风格结果可能因生成次数而异,官方建议生成 1~3 次挑选(正在改进一致性)
- ❌ 语言覆盖固定 30 种,未列入语言需自测或微调(官方计划扩展)
- ⚠️ 显存门槛:VoxCPM2 需约 8GB 显存;纯 CPU 很慢(端侧走 llama.cpp-omni)
- ⚠️ 极端克隆相似度仍受参考音频质量影响(官方给最佳实践)
6. 对比同类
| 维度 | VoxCPM(本工具) | GPT-SoVITS | Index TTS | Edge TTS |
|---|---|---|---|---|
| 定位 | 文字造音 + 克隆 + 多语 | 个人音色微调 | 免训练克隆 | 在线免费批量 |
| Star | 36k | 61k | 23k | 12k |
| 音色设计 | ✅ 文字凭空造 | ❌ | ❌ | ❌ |
| 语言 | 30+9 方言 | 中英日韩粤 | 多语种 | 300+ 音色 |
| 商用许可 | ✅ Apache-2.0 | ⚠️ 需确认 | 开源 | ✅ |
| 硬件 | 8G 显存 | 需训练显卡 | 无需训练 | 无需显卡 |
| 额外 | 端侧 GGUF / vLLM / ComfyUI | 微调强 | 带情绪控制 | 在线+字幕文件 |
结论:四款里 VoxCPM 是唯一”文字造音色 + 多语 + 可商用 + 生态全“的,最适合做视频口播/本地 TTS;缺点是新版本可控性需自测。
7. 安全风险(重点分析)
用户要求专门评估安全风险。TTS 克隆类工具核心风险在滥用与合规。
7.1 滥用风险(官方明确警示)
- 声音克隆能力可生成高度逼真语音——官方 README 明确:严禁用于冒充他人、欺诈、虚假信息传播,强烈建议对所有 AI 生成内容明确标注
- 典型红线:伪造名人/他人语音、诈骗电话、虚假录音证据、伪造金融确认
7.2 供应链 / 技术风险(低)
- 依赖 PyTorch/transformers 生态,
pip install voxcpm走默认源 → 建议生产用私有源/lock(同其他 Python 项目) - 权重从 HuggingFace / ModelScope 下载,官方发布 → 供应链风险低;建议核验 sha256(HF 提供)
- WebUI 默认本地 :8808 → 若暴露公网需注意访问控制(模型加载 + 合成服务)
7.3 合规建议
- ✅ 只克隆自己有授权的声音(本人/客户明确授权);商用前确认被克隆者同意
- ✅ 生成内容添加 AI 水印/标注(官方建议;部分平台要求强制披露)
- ⚠️ 多语种/方言输出若涉及他人隐私、肖像或商用,按当地法律(如中国《民法典》声音权益、Deepfake 相关法规)把控
7.4 总体评价
代码/权重供应链风险低(官方发布 + Apache-2.0),真正的风险在”用”——声音克隆的滥用与合规边界,必须由使用者自律把控。
8. 社区反馈 / 可靠性
- 36k★ / 4k fork,2025-09 起一路 GitHub/HF Trending #1,2026-08 仍活跃
- 官方技术报告 2 篇(ICLR 2026 收录)、ReadTheDocs 完整文档、飞书群 + Discord 社区
- 大量社区生态(vLLM-Omni 官方原生支持、llama.cpp-omni、ComfyUI、视频配音翻译工具等)佐证活跃度
- 可靠性结论:面壁+清华背书、Apache-2.0、持续更新,是当前开源 TTS 第一梯队;新版本(VoxCPM2)建议实际生成自测中文/方言效果
refer
声明:
若文章存在错误,望诸君不吝指正^
blog仅供个人记录学习所用部分笔记由于年代久远,做的笔记找不到最初是引用谁的,若是不允许引用转载,请联系我
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 晚上十一点睡觉のBlog!
评论










