无言以对 发表于 2026-8-12 10:52:35

IndexTTS-2.5:一句话克隆任意声音,跨语言还能精准控情绪,让声音克隆更自由更自然


IndexTTS-2.5 是由 Bilibili 的 IndexTeam 开发的一款开源零样本(zero-shot)文本转语音(TTS)模型。你只需要提供一小段参考音频(比如几秒钟的某人说话录音),模型就能“克隆”出这个人的声音,然后让它用这个声音朗读你输入的任意文字,还支持自定义情感控制,比如高兴,难过等。

IndexTTS-2.5 支持中文、英文、日语、西班牙语、阿拉伯语五种语言,还能做到跨语言声音迁移(例如用中文说话人的声音去说英文),并且可以控制情绪。
相比前代 IndexTTS-2,它主要新增了日语、西班牙语、阿拉伯语支持,推理速度更快,对中文拼音、英文音标、日语假名的控制也更精准。


主要特点

零样本声音克隆:只需一段参考音频,无需额外训练就能模仿该说话人的音色和风格。
多语言 + 跨语言:支持五种语言,且可以跨语言转换(比如中文参考音 → 英文输出)。
情绪可控:可通过情绪向量、情绪参考音频或文本情绪检测,灵活调节说话情绪(比如更激动、更平静等)。
精细发音控制:支持中文拼音标注、英文 CMU 音标、日语假名,帮助纠正多音字或特殊发音。
模型结构:自回归架构(GPT + DiT + BigVGAN),参数量约 0.8B,相对轻量。



应用领域

有声书、播客制作:快速生成不同声音的朗读内容。
配音与本地化:电影、动画、游戏的多语言配音。
对话式 AI / 虚拟助手:让智能助手拥有特定人物声音。
内容创作:短视频、自媒体等需要个性化语音的场景。




使用教程:(建议N卡,显存8G起,支持50系显卡)

包含主程序压缩包和模型(checkpoints文件夹),下载解压主程序后,将模型(checkpoints文件夹)移动到主程序目录下即可。

上传参考音频,输入生成文本,生成即可。
支持更丰富的情感控制,可以根据需要选择,比如与音色参考音频相同、使用情感参考音频、使用情感向量控制、使用情感描述文本控制等

支持预设功能,可以将生成的音频保存为音色预设,方便后期快速加载使用。




下载地址:
迅雷云盘:https://pan.xunlei.com/s/VP0M3e94NA8CS9da9kmdAiR-A1?pwd=x37b

夸克网盘:
**** 本内容需购买 ****

百度网盘:
**** 本内容需购买 ****

来日方长 发表于 2026-8-16 09:20:49

克隆效果退步了,都不像原声了
页: [1]
查看完整版本: IndexTTS-2.5:一句话克隆任意声音,跨语言还能精准控情绪,让声音克隆更自由更自然