RVC WebUI 使用指南10分钟语音数据训练出可用的语音转换模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC WebUI是一个开源的语音音色转换框架把一段 10 分钟左右的干声喂给它就能训练出一个把任意音频变成这个音色的模型支持离线批量转换和实时变声。项目基于 Python 3.12Windows、Linux 都能跑A 卡、I 卡用户用 CPU 方案也能跑通N 卡则可用 CUDA 加速。适合第一次做 AI 变声的开发者也适合想给自己直播间换个音色的普通用户。项目定位它靠什么做到又快又像RVC 的技术路线一句话用检索式特征替换top1 检索把输入源的特征替换为训练集的特征从根源上杜绝音色泄漏——即输出里混入推理源或底模音色而不是靠简单的音调偏移。几个可以量化验证的点数据量官方推荐 10 分钟到 50 分钟低底噪语音音色特征明显、录音干净的 5~10 分钟数据也能出可用模型docs/cn/faq.md 的 Q10 就是这么写的。实时延迟实时变声界面默认端到端 170ms配 ASIO 声卡驱动可压到 90ms。音高提取默认用 Interspeech 2023 的 RMVPE 算法速度快、资源占用小、能解决哑音问题比早期 Harvest 方案稳定得多。另外它内置了 UVR5 人声分离模块代码在 tools/uvr5/拿到一首歌可以先把干声摘出来再训练不用自己找别的分离工具。快速上手三步拿到第一个模型以下以 Linux/Windows Python 3.12 x64 为例。第一步克隆仓库并安装依赖N 卡按 CUDA 版本选对应文件没有 N 卡就用 CPU 包git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI py -3.12 -m venv .venv .venv\Scripts\activate pip install torch torchaudio pip install -r requirments_cu118_py312.txtLinux 用python3.12 -m venv .venv source .venv/bin/activate替代上面第三行。第二步把预训练权重放到仓库约定的路径下。推理和特征提取最少需要assets/hubert_base/、assets/rmvpe/rmvpe.pt训练还需要assets/pretrained/和assets/pretrained_v2/。官方模型托管在 Hugging Face 的lj1995/VoiceConversionWebUI仓库用hf download命令按 README 里的下载模型一节拉取即可路径结构assets/weights/、assets/indices/、logs/mute/README 有完整清单照着放不要改名字。第三步启动 WebUI默认监听 7865 端口浏览器自动打开python webui.py跑通后你会看到训练推理界面把切好的 16k 干声放进指定实验文件夹点一键训练它会自动完成 Hubert 特征提取train/dataset/extract_hubert_feature.py、音高提取train/dataset/extract_f0.py、训练和建索引几个阶段产物是logs/下的.pth模型和.index索引文件。训练完切到推理选项卡选自己的音色上传一段音频就能听到变声结果。场景实战批量转换把翻唱 demo 变成目标音色拿到一段翻唱伴奏加干声先切到 UVR5 选项卡做人声分离权重来自assets/uvr5_weights/得到干净干声切到训练选项卡一键训练最后推理选项卡把干声整段转成目标音色。预期效果10 分钟数据训出的模型音色相似度对日常直播、demo 制作已经够用如果结果里有原唱歌手的影子把 index_rate 往 1 调音色会更贴近训练集。实时变声麦克风进变声出用python realtime_gui.py启动独立实时界面配置会保存到 configs/config.json。把声卡输出设备设为变声器、输入设备设为该输出形成回环。预期效果默认配置下端到端 170ms戴上耳机会感觉接近说话即变声换 ASIO 声卡可以压到 90ms但非常依赖驱动USB 声卡一般到不了这个数。多语言界面与团队协作界面内置 13 种语言i18n/locale/ 下有 zh_CN、en_US、ja_JP、ko_KR 等 JSON 文件启动后在选项卡里切换。适合团队里有人只看得懂英文、或者把教程翻译成其他语言发布时直接参考 locale 文件的措辞。参数速查配置项推荐值适用场景f0method音高算法rmvpe默认首选快且稳pm 最省资源老机器可用index_rate索引比率0.0 ~ 1.0默认 0.75音色泄漏明显调到 1训练集音质差时调低total_epoch底噪大 20~30音质高时长多可到 200训练轮数见 faq Q9训练集时长10~50 min精简干声 5 min 起步数据量直接决定下限采样率 sr40k / 48k底模版本不同可选项不同v1 支持 32k补充两点index_rate 调 1 会削弱检索混色的保护效果之外的音质增益见 faq Q11训练中途别换采样率要换就换实验名重训。避坑指南现象一键训练跑完却没有索引。原因训练流程中断或索引阶段出错。解决重跑前检查磁盘空间索引由 train/train_index.py 生成日志里找报错行。现象推理结果里混着原唱歌手的音色。原因index_rate 偏低时底模/推理源的音色会泄漏进来。解决把 index_rate 提到 1或增加训练数据量后重训原理见 faq Q11 的科普。现象Cuda error / out of memory。原因显存不够或进程开太多。解决拉低提取音高和处理数据使用的 CPU 进程数手动把训练集长音频切短N 卡用户确认装的是与显卡匹配的 CUDA 版 torch。现象Windows 启动报 llvmlite.dll 相关错误。原因缺 VC 运行库。解决安装 VC Redist 后重启 WebUIfaq Q16。现象训练时内存炸了文件页面/内存 error。原因并行进程过多、单条音频太长。解决降低 CPU 进程数手工切分训练集长文件。更多问题直接翻 docs/cn/faq.mdQ1 到 Q18 覆盖了 ffmpeg 报错、断点续训、模型分享等高频坑。下一步现在就可以做一件事录一段 10 分钟的干净干声按上面三步跑通第一次一键训练然后拿翻唱伴奏实测效果。参数拿不准时以 docs/cn/faq.md 为准多语言文档和 changelog 都在 docs/ 下有问题去项目 issues 或社区提问。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考