Breeze TTS 2:一句话设计声音,支持自由情感控制,克隆、设计、导演三合一
Breeze TTS 2 是一个开源的文本转语音(TTS)模型,支持语音设计、语音克隆和语音定向三个功能。它在开源权重模型中排名第一(Artificial Analysis TTS 排行榜),甚至在某些方面超过了闭源商业系统。
简单来说:你给它文字,它就能生成自然、富有感情的人声。特别厉害的是,它能听懂自然语言指令,让你像“导演”一样控制声音。它是一个又快、又灵活、又能听懂指令的高质量开源语音生成模型,特别适合需要“实时互动 + 高度可控声音”的场景。
主要特点
声音克隆(Voice Clone)
给一段干净的参考音频 + 对应的文字稿,就能高度还原那个人的音色、节奏、情绪和说话风格。
声音设计(Voice Design)
不需要参考音频,直接用自然语言描述想要的声音,比如“一个温暖、沉稳、年轻的女性,声音清晰、语气平静”,模型就能凭空创造出符合描述的独特声音。
声音指导(Voice Direction)
在克隆某个声音的同时,还能额外指挥它的表现方式。例如“用缓慢、克制、严肃的语气说”,既保留原声音身份,又能灵活调整情绪、语速和风格。
支持表情和动作音效
可以在文字里直接插入提示,比如英文用 (laugh)、(sigh)、(cough),中文用 [笑]、[叹气]、[咳嗽],让语音更生动自然。
超低延迟 + 实时流式生成
首音延迟可低至 40 毫秒以内(H100 显卡优化后),生成速度约是实时的 3 倍,非常适合需要即时响应的场景。
中英双语支持
一个模型就能自然生成英语和中文语音。
应用领域
语音助手 / AI 对话机器人:实时、自然、可控制情绪的回复。
有声书 / 播客 / 视频配音:快速生成多角色、多情绪的旁白。
游戏 / 虚拟角色:动态生成符合角色性格和当前剧情的对话。
内容创作:短视频、广告、教育课程的快速配音。
无障碍辅助:把文字实时转成自然语音。
使用教程:(建议N卡,显存8G起,支持50系显卡)
包含主程序压缩包和模型(checkpoints 文件夹),下载解压主程序后,将模型(checkpoints 文件夹)移动到主程序目录下即可。
支持语音设计、语音克隆和语音定向三个功能
语音设计:输入一段需要生成的文字和描述内容(比如一位温柔自信的年轻女性,声音清晰,语气亲切,表达轻快而富有感染力),支持插入[笑]、[叹气]、[咳嗽]、[清嗓子]等副语言标签,点击生成即可;
语音克隆:上传参考音频,输入合成文字内容,点击生成即可;
语音定向:输入需要合成的文字内容,上传参考音频,输入定向指令(比如以克制、严肃的语调缓缓道来),点击生成即可。
下载地址:
迅雷云盘:https://pan.xunlei.com/s/VP0PKH4xcOZrM-RuHcFVKpNxA1?pwd=xj5j
夸克网盘:
**** 本内容需购买 ****
百度网盘:
**** 本内容需购买 ****
页:
[1]