VoxCPM2 实战多语言 TTS 与声音克隆完整指南【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM给一款产品同时录 30 种语言的旁白还要求每条都是同一个声音——以前这事基本靠外包配音成本高得吓人。VoxCPM2 要解决的正是多语言语音合成 声音克隆这个组合基于无分词器扩散自回归架构原生支持 30 种语言和 9 种中文方言同一个音色可以跨语言复用。代码与权重均按 Apache-2.0 发布免费商用。无分词器多语言 TTS 的底层逻辑连续表征对比离散 token主流 TTS 的路线是先把音频离散成一串 token“音频词”再让语言模型逐词预测。这条路有两个先天成本离散化过程本身丢信息音色、韵律的细节在量化时被压掉再由这些 token 生成的音质天花板有限另一是离散分词器的多语言覆盖往往只有几种主流语言换到小语种后音质明显不稳。VoxCPM2 的做法是直接跳过离散化语言模型输出连续语音表征扩散模型在这些表征上做去噪生成。内部分四个阶段——LocEnc 编码参考音频文本语义 LMTSLM处理文本残差声学 LMRALM生成声学表征LocDiT 产出块级潜变量最后由 AudioVAE V2 解码回音频。这个 VAE 是非对称设计编码器吃 16kHz、解码器直接吐 48kHz内置超分不用再挂一个上采样器。直接好处30 种语言加 9 种中文方言四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话共用同一个连续表征空间多语言覆盖问题自然消解。官方内部 30 语种 ASR 评测的平均错误率是 1.68%各语种之间没有明显掉队项。⚡ 从克隆仓库到第一句语音5 分钟跑通你的第一句 VoxCPM2 语音环境要求Python ≥ 3.10低于 3.13、PyTorch ≥ 2.5.0、CUDA ≥ 12.0显存建议 8GB 以上——2B 模型的显存占用实测约 8GB。git clone https://gitcode.com/GitHub_Trending/vo/VoxCPM cd VoxCPM pip install voxcpm python app.py --port 8808 # 浏览器打开 http://localhost:8808Web 界面入口是 app.py支持--device auto/cpu/mps/cudaApple Silicon 的 Mac 会自动落到 MPS。想直接调 API 的话最小示例是这样的from voxcpm import VoxCPM import soundfile as sf model VoxCPM.from_pretrained(openbmb/VoxCPM2, load_denoiserFalse) wav model.generate(textVoxCPM2 多语言语音合成与声音克隆。, cfg_value2.0, inference_timesteps10, seed42) sf.write(out.wav, wav, model.tts_model.sample_rate)输出即 48kHz 音频。如果网络访问 HuggingFace 不方便可先用 ModelScope 把权重拉到本地目录再把本地路径传给from_pretrained。 声音克隆的四种玩法音色设计、可控克隆、极致克隆与流式四种模式调的都是同一个generate接口区别只在输入组织方式音色设计不需要任何参考音频在文本开头用括号写音色描述性别、年龄、情绪、语速凭空生成全新音色。该模式结果有随机性建议生成 1~3 次挑一个。可控克隆传reference_wav_path克隆音色同时可在文本里写“稍快一点欢快的语气”这类风格指令调韵律但保留原音色。极致克隆传prompt_wav_path加它的文本转录prompt_text模型从参考音频“接着说”相似度最高再把同一音频传给reference_wav_path还能进一步提升。流式合成generate_streaming按块吐出音频适合实时对话和长文本。两代版本的核心管线其实是同一套TSLM→RALM→LocDiT模式只是输入端有没有参考音频的差别最有代表性的音色设计几行就够wav model.generate( text(年轻女性声音温柔甜美)你好我是用文字描述设计出来的音色。, cfg_value2.5, inference_timesteps10, seed42, ) Seed-TTS-eval 性能对比和开源模型差多少Seed-TTS-eval 零样本基准的数据与官方发布一致模型参数量开源英语 WER↓英语 SIM↑中文 CER↓中文 SIM↑VoxCPM22B✅1.84%75.3%0.97%79.5%Qwen3-TTS1.7B✅1.23%71.7%1.22%77.0%FishAudio S24B✅0.99%—0.54%—VoxCPM1.50.8B✅2.12%71.4%1.18%77.0%CosyVoice31.5B❌2.22%72.0%1.12%78.1%中文这边 0.97% 的 CER 是已公布 SIM 的模型里最低档79.5% 的中文 SIM 领跑全表英语 WER 上 FishAudio S2 和 Qwen3-TTS 更低但前者没公布 SIM后者 SIM 低了 3.6 个点。对相似度要求高的场景声音克隆、多说话人一致性连续表征路线的优势更明显。多语言是它拉开身位的地方Minimax 多语言测试里英语 SIM 85.4%、中文 82.5%、日语 82.8%均居对比模型前列而且芬兰语、越南语、泰语这类少数开源模型不覆盖的语言也在支持列表里。推理速度方面RTX 4090 上标准实现 RTF 约 0.30Nano-vLLM 加速后约 0.13Apple M4 Pro 上约 1.76实时交互可用。 8GB 显存怎么跑起来本地到端侧的三种部署路径个人本地装完包直接开 Web UI或者写 Python 调 API 都行Mac 上用--device mps比 CPU 体验好不少GPU 侧显存门槛就是 8GB 上下。服务端高并发两个引擎可选。Nano-vLLM-VoxCPM 是专用推理引擎支持并发请求和异步 API4090 上 RTF 做到约 0.13约为标准实现的三分之一vLLM-Omni 是官方 vLLM 全模态扩展带 PagedAttention 和连续批处理提供 OpenAI 兼容的/v1/audio/speech接口适合多租户服务。端侧 / CPUllama.cpp-omni 提供 GGUF 量化权重同一套 CLI 跑在 CPU / Metal / CUDA / Vulkan 上Q8_0 量化体积减半、质量损失可忽略社区还有 ONNX 导出CPU 推理和 Apple Neural Engine 后端。偏好可视化工作流的话也有 ComfyUI 插件可接入。 生成效果不理想先调什么cfg_value 与 inference_timesteps 速查最常用的就两个参数cfg_value引导强度默认 2.0。偏大时音频更贴合文本或描述偏小时韵律更自然、随机性更大。音色设计用 2.0~2.5普通合成用 2.0 附近比较稳。inference_timestepsCFM 去噪步数默认 10。10~15 足够再高音质提升有限生成时间却变长。显存吃紧时加载模型先传load_denoiserFalse不加载参考音频去噪管线再紧张就用 CPU/MPS 做小规模验证正式生成换回 GPU。想把“自己的声音”固定下来可以走 LoRA 微调5~10 分钟音频就能适配特定说话人。数据是 jsonl每行音频路径加对应文本格式见 examples/train_data_example.jsonl可选duration和dataset_id字段再用 scripts/train_voxcpm_finetune.py 配对应 yaml 启动训练即可。VoxCPM2 的价值很直接一套开源协议下的 30 语种、48kHz、音色可控的语音合成管线显存门槛只有 8GB。下一步建议先跑通 Web UI把四种模式都听一遍再拿自己的参考音频试克隆。【免费下载链接】VoxCPMVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning项目地址: https://gitcode.com/GitHub_Trending/vo/VoxCPM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考