马上注册,下载更多AI资源软件
您需要 登录 才可以下载或查看,没有账号?立即注册
×
AuK:多任务语音生成编辑,支持克隆、改词、换情绪与分离,内容编辑与增强全覆盖 ... ...
AuK 是腾讯混元团队开源的 1.5B 参数基础语音模型,专门用于语音生成和语音编辑。
它用统一的自然语言指令(像聊天一样告诉它你想干什么),就能完成多种语音任务,不用换不同工具。训练数据规模很大(数百万小时多样音频),支持零样本和指令控制。
AuK 就像“语音版的全能编辑器”,用一句话就能生成、修改、优化语音,开源后让开发者和创作者都能方便使用。
主要特点
统一接口:所有任务都通过自然语言指令 + 可选参考音频完成,简单好用。
两个版本:
AuK:高质量基础版。
AuK-Flash:蒸馏加速版,只需 4 步推理,速度快约 4.5 倍,适合实时场景。
多任务一体:生成、编辑、增强、分离等能力都在一个模型里。
支持的主要任务(按类别)
语音生成
零样本 TTS(用参考音频克隆音色说指定文字)
指令 TTS(只用文字描述声音,无需参考音频)
内容编辑
改说什么(替换、插入、删除文字)
改歌词(保留旋律和原声)
声学编辑
调音高、语速、音量
副语言编辑
换情绪、换音色、去口音、处理呼吸/笑声等非语言声音、正常语音↔耳语转换
增强与分离
降噪、去混响、语音增强
说话人分离、音乐中提取人声、目标说话人提取
应用领域
内容创作:短视频配音、有声书、播客、游戏角色语音、广告配音。
语音处理工具:快速修录音错误、改情绪风格、去口音、清理噪音。
多模态应用:配合视频/动画生成更自然的语音。
研究与开发:语音 AI 研究、定制化微调、工业级语音流水线。
个人/企业工具:快速语音克隆、内容本地化、无障碍辅助等。
使用教程:(建议N卡,显存8G起,支持50系显卡)
整合包包含所需所有节点,下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可。
WebUI模式:
双击启动进入WebUI,上传参考音频,选择编辑类型,运行生成即可。
ComfyUI模式:
双击启动ComfyUI,进入WebUI后,点击左侧的 工作流程,选择对应的工作流。
上传参考音频,选择编辑类型,运行即可。
编辑类型切换后,会有对应的文字说明,部分功能不太稳定,大家自行测试
稳定功能包含但不限于:
声音克隆、提高音量 / 降低音量、语音增强、歌声提取、说话人分离、仅降噪、音质修复
欠稳定功能包含但不限于:
保留所有人声、更换情感、目标说话人提取、调整语速、升调 / 降调、更换音色、删除语音、添加 / 删除非语言声音、去除口音、在前面 / 后面插入语音、替换语音、改写歌词、耳语转换(双向)
软件目录结构:
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── auk_base_int8.safetensors
│ │ └── auk_flash_int8.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen_omni_int8.safetensors
│ ├── 📂 vae/
│ │ └── auk_vae.safetensors
│ ├── 📂 whisper/
📂 deepface/
......
下载地址:
一键包在路上...
|