Audio8_TTS V2版:小而强,轻量多语言语音合成利器,小模型也能做出顶级多语言语音
Audio8-TTS是一个非常小巧的开源文本转语音(TTS)模型,主打“小而能用”的零样本声音克隆。它能把文字变成自然的语音,而且支持零样本声音克隆——只需提供一小段参考音频和对应文字,就能模仿那个人的声音说话,不需要额外训练。模型本身很小,比市面上很多多语言TTS模型小得多,但在中文和英语上表现已经比较可用。
今天分享的 Audio8_TTS V2版,和上个版本相比,V2版打包更轻更小更快的0.1B模型,支持无显卡设备使用CPU流畅运行,同时支持CUDA独显运行。该版为适配低配设备打包制作,适合无独立显卡设备运行。
主要特点
极致轻量:主生成模型约170M参数,整体远小于常见的0.6B–几B规模的TTS模型,更适合资源有限的场景。
零样本声音克隆:给一段参考音频就能克隆音色,无需微调。
多语言支持:
主要语言:中文、英语(效果最好)
实验性支持:德语、西班牙语、法语、意大利语、日语、韩语
高采样率音频:使用44.1 kHz神经音频编解码器,声音质量较清晰。
应用领域
个性化语音助手、虚拟角色配音
短视频/播客/有声内容的快速配音
多语言内容生成(尤其是中英)
教育、辅助工具(如把文字转成语音朗读)
原型开发和资源受限环境(手机、嵌入式设备、本地服务器)
使用教程:(支持无独显CPU运行,支持50系显卡)
输入需要合成的文字内容,上传参考音频,输入参考文本,生成即可。
注.因模型限制,建议生成不超过1分钟的音频,建议30秒左右。如需要生成超长文本,可分段处理。
支持CPU运行,下方“生成设置”展开切换到CPU
下载地址:
迅雷云盘:https://pan.xunlei.com/s/VP-s3khuE6yV48UEVz4B8vxKA1?pwd=smbg
夸克网盘:
**** 本内容需购买 ****
百度网盘:
**** 本内容需购买 ****
页:
[1]