10 分钟录音就能练出:Retrieval-based-Voice-Conversion-WebUI 语音转换实操教程
10 分钟录音就能练出Retrieval-based-Voice-Conversion-WebUI 语音转换实操教程【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI刚剪完的视频想把解说换成自己的声音或者想用练出来的音色翻唱一首喜欢的歌——这件事不需要录几个小时的素材。Retrieval-based-Voice-Conversion-WebUI后文简称 RVC WebUI是一个开源的 AI 变声框架用 10 分钟左右的低噪语音就能训练出一个可用的音色模型。RVC WebUI 是什么它是基于 VITS 语音生成模型搭建的变声框架外面包了一层网页操作界面不用写代码就能完成训练和推理。项目采用 MIT 协议免费使用商业场景也不受限制。适合的对象很明确想用自己的声音或少量他人录音做配音、翻唱、实时变声的创作者而不是做算法研究的工程师。 配好环境把 WebUI 跑起来整个过程是一条时间线装依赖 → 装 ffmpeg → 下预模型 → 启动 → 第一次转换。每一步我都标了怎样算成功卡住时先看信号而不是继续往下走。第 1 步克隆仓库并安装依赖环境要求 Python 高于 3.8PyTorch 需要先装好pip install torch torchvision torchaudio再按硬件装对应依赖git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI系统与显卡依赖安装启动方式Windows N 卡pip install -r requirements.txt双击go-web.batLinux / Mac N 卡pip install -r requirements.txtpython infer-web.pyAMD 卡DirectMLpip install -r requirements-dml.txtpython infer-web.py --dmlA 卡 ROCmLinuxpip install -r requirements-amd.txtpython infer-web.pyI 卡 IPEXLinuxpip install -r requirements-ipex.txtpython infer-web.py成功信号终端没有红色报错滚过浏览器自动打开http://127.0.0.1:7865的网页。如果浏览器没开手动访问这个地址即可。第 2 步安装 ffmpeg音频切割和重采样全靠它。Ubuntu 用sudo apt install ffmpegMac 用brew install ffmpegWindows 把ffmpeg.exe放到项目根目录。成功信号ffmpeg -version能打印出版本号。我刚开始时在这一步卡得最久后来发现多半不是 ffmpeg 本身的问题而是音频路径带中文或空格。第 3 步下载预模型训练和推理依赖assets/hubert、assets/pretrained、assets/uvr5_weights等预训练文件tools/文件夹里自带下载脚本如download_models.py、dlmodels.sh跑一遍即可。成功信号assets/下对应的目录不再为空。第 4 步拿到第一次转换结果变声需要一个训练好的模型所以最快的路线是照下一节用 10 分钟素材跑一次训练然后在推理页签选中模型、上传一段音频点击转换。成功信号输出 wav 文件生成、时长和输入一致、听感上音色明显变了。 10 分钟数据的训练配置数据准备决定模型的上限先满足这几条再谈参数数据项要求时长10–50 分钟最低 10 分钟格式WAV采样率 44100Hz 或 48000Hz录音环境安静、无背景音乐、无多人对话音量保持稳定避免破音和底噪大的段落路径目录名和文件名避免中文、空格、括号界面配置进入训练页签填实验名和训练集路径点一键训练。它会按顺序执行数据处理、特征与音高提取、模型训练、索引生成四个环节。关键参数及新手建议参数新手建议值为什么total_epoch总轮数底噪大的数据 20–30高质量长数据可到 200轮数调太高救不了低音质数据只会放大底噪batch_size4configs/v2/48k.json 默认显存紧张时往 1 调4GB 显存也跑得动learning_rate1e-4默认新手阶段改学习率的收益为负训练集缓存至显存10 分钟以下小数据开小数据能加速训练大数据会挤爆显存过程中的观察点终端里能看到实时进度和 loss 曲线正常是持续下降控制台出现Training is done. The program is closed.即训练完成紧随其后的报错属于误报不用处理。模型落在weights/目录实验日志在logs/实验名/下排查问题就翻这个目录。音高与索引比率怎么调转换效果主要看推理页签里的三个旋钮按这张表起步参数起步值往哪个方向调音高算法RMVPE提取最稳、哑音问题最少比 crepe 更省资源音调偏移半音数0 原调男声转女声常见 8 到 12±12 等于升降一个八度索引比率0.3–0.5调低音色更自由但相似度下降调高相似度上去声音发僵、接近念保护值protect0.33 默认调高可减少非人声部分被错误处理产生的爆音调参经验先固定其他项每次只动一个参数转同一首歌做 A/B 对比。实时变声运行go-realtime-gui.batWindows 整合包选好输入输出设备即可边说边变声。官方实测端到端延迟 170ms换成 ASIO 输入输出设备可压到 90ms——代价是对声卡驱动支持要求很高普通 USB 声卡未必能发挥。进阶玩法API、批量处理与模型融合挑三个用到就省时间的方向展开点到为止。批量转换tools/infer_batch_rvc.py把整个文件夹一次跑完参数直接写在命令行python tools/infer_batch_rvc.py \ --input_path ./songs \ --opt_path ./out \ --model_name my-voice \ --index_path logs/my-voice/added_XXX.index--f0up_key控制音高偏移--index_rate控制索引比率语义和 WebUI 里一致。API 调用api_240604.py 是一个 FastAPI 服务python api_240604.py启动后监听 6242 端口模型路径、索引路径、pitch、formant、index_rate 都可以通过请求参数传适合把 RVC 嵌进你自己的剪辑流水线。旧的 api_231006.py 仍可作兼容版本。模型融合WebUI 的 ckpt 选项卡里有 ckpt-merge 功能把两个训练好的模型按权重比例比如 70% A 30% B混成新音色适合做介于两种风格之间的自定义声音不用重新训练。️ 高频问题速查一键训练结束没生成索引看到Training is done.说明训练其实成功了后面的报错是误报缺索引时再点一次训练索引按钮即可。显存不足out of memory训练时把 batch_size 降到 1推理时调小 configs/config.py 尾部的 x_pad、x_query、x_center、x_max。4GB 以下显存建议换机器4GB 降参数后还有救。ffmpeg error / utf8 error大概率不是 ffmpeg 的锅是音频路径带了空格、括号或中文改目录名重试。推理下拉框里看不到新训练的音色先点刷新音色还没有就打开logs/实验名/下的日志确认训练是否真的报错。分享模型该发哪个文件发weights/目录下 60MB 以上的.pthlogs/里几百 MB 的是断点续训用的实验状态发出去会引发 key 缺失报错。下一步行动录一段 10 分钟低噪语音放到无中文、无空格的路径下。按上面的顺序完成首次训练推理页签转一首歌确认音色相似度。卡住时查文档中文 FAQ 见 docs/cn/faq.md训练建议见 docs/en/training_tips_en.md更新记录见 docs/cn/Changelog_CN_CN.md多语言文档在 docs/ 下都有对应版本。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考