马上注册,下载更多AI资源软件
您需要 登录 才可以下载或查看,没有账号?立即注册
×
RVC V3版:用少量录音实现高质量AI变声与唱歌,适合翻唱配音与直播
Retrieval-based-Voice-Conversion-WebUI(简称 RVC) 是一个开源的 AI 语音音色转换工具,简单说就是“变声器”框架。它能把一个人的说话/唱歌声音,转换成另一个人的音色,同时尽量保持原来的内容和语调。官方标语是“Easily train a good VC model with voice data ≤ 10 mins!”——用大约 10 分钟左右的干净语音数据,就能训练出效果不错的模型。
RVC 把复杂的 AI 语音转换变得相对亲民,普通人用少量自己的录音就能训练专属音色模型,特别适合想玩 AI 翻唱、角色配音或实时变声的人。
今天分享的 RVC V3版(官方版本 2.3.260718) 是三年来该项目的首次大更新,兼容旧版模型,简化界面,新增 FCPE 音高算法、人声伴奏分离以及实时推理优化。
具体更新日志如下:
降低网页使用难度(推理输入音频无需输入路径,前端实时日志优化,保存推理用小模型后自动刷新模型列表,推理首页选择模型后自动检测匹配的index路径等);
数据特征提取、训练模型、索引阶段可中途掐断,重启继续进度;
GPU自动识别判断推理模式和精度;
修复依赖问题(例如pyworld,fairseq,matplotlib,pyav,onnxruntime-gpu环境修复等);
解决编码问题;
网页启动自动探寻可用端口;
单卡训练不用DDP;
基础模型不变,若干影响效果的修复,使用现有微调模型更新整合包/代码包版本重新推理,或者使用新版本重新训练再推理,均有可能效果会有提升;
支持FCPE音高提取算法;
实时变声模式gui支持cuda graph推理加速,算法推理延时指标最高加速4.7倍(4090D测试结果),同时显卡占用相对20~30%左右;
移除了已明显无用或过时的功能;
人声与伴奏分离后端由 UVR5 更换为 PyMSS,并支持推理时中断 (更好的人声分离算法能显著提高推理效果);
优化输入音频的读取与重采样流程,在条件允许时使用 GPU 处理,以提高推理效率并降低 CPU 占用;
修复 Windows 环境下训练进程的 libuv 兼容问题;
主要特点
数据需求少:推荐收集至少 10 分钟低噪音的说话/唱歌音频就能训练,不需要海量数据。
训练门槛低、速度快:在普通或较差的显卡上也能较快完成训练。
减少“音色泄漏”:用检索(top1 retrieval)的方法,把输入声音的特征替换成训练数据的特征,让转换后的声音更像目标音色,少串味。
简单网页界面:有友好的 WebUI,操作直观,训练、推理(转换声音)、模型管理都能在网页上完成。
支持实时变声:有专门的实时变声界面,端到端延迟可低至约 170ms(用好硬件和驱动甚至能到 90ms 左右)。
人声分离:内置工具可快速把歌曲里的人声和伴奏分开。
音高提取先进:用 RMVPE 等算法,有效减少哑音、跑调问题,速度快、占用资源少。
模型融合:可以把不同模型的音色“混合”,创造出新的声音效果。
兼容性较好:支持 NVIDIA 显卡(包括较新的 50 系)、部分 AMD/Intel 方案,也有 CPU 选项。
应用领域
AI 唱歌/翻唱:最常见用途,用某人的声音唱任何歌(例如训练某位歌手或角色的模型来翻唱)。
语音克隆与变声:把普通说话声变成特定人物的音色,用于配音、有声书、视频配音等。
实时语音变声:游戏、直播、语音聊天时实时改音色。
内容创作:短视频、二次元、虚拟角色配音,快速生成个性化声音。
实验与研究:语音合成、音色转换相关的 AI 实验。
使用教程:(支持N卡/A卡和I卡,建议显存6G起)
包含训练和推理,网盘内包含详细使用教程,教程来自“AI探索与发现”
下载地址:
迅雷云盘:https://pan.xunlei.com/s/VOySAWVDSF6hoAcGdAt65DBzA1?pwd=25dx
夸克网盘:
百度网盘:
|