JoyAI-Echo - 文字一键生成长达5分钟带声视频,实现人物一致、声音同步的电影级输出 一键整合包下载
JoyAI-Echo 是京东开源的一个 AI 视频生成工具,专门用来生成长达几分钟的、有声音的连贯视频(多镜头故事),在长视频生成领域达到了比较前沿的水平。想象一下,你给它一段文字描述(比如“一个女孩在雨中奔跑,遇到老朋友”),它就能自动生成一段带同步对话和背景音乐的视频,而且能连续生成多个镜头,像拍一部短电影一样,人物长相、声音风格前后保持一致,不会突然“变脸”或声音变掉。
JoyAI-Echo 的核心优势就是“长 + 连贯 + 带声音 + 快”,让 AI 生成的视频更像真正的电影片段,而不是零散的短 clip。适合对视频质量和一致性有较高要求的用户。
主要特点
能生成长视频:支持生成5分钟左右的多镜头连贯故事(以前很多 AI 容易在长视频里出错或不连贯)。
视频+音频一起生成:不仅出画面,还同步生成人物说话声音、音效和背景音乐。
记忆功能强:有个“跨模态记忆库”(像人物档案),能记住前面镜头里人物的样子和声音,让后续镜头保持一致性。
生成速度快:用了特殊优化技术,比传统方法快 7.5 倍 左右,效率很高。
效果好:在视觉美感、音频质量、指令遵循和人物一致性上,表现优于一些同类模型。
支持 ComfyUI:有图形界面插件,用起来更方便,还能边看边改提示词。
目前主要是文字生成视频(Text-to-Video),图像转视频功能还在开发中。
应用领域
短视频/影视创作:快速生成故事视频、广告、剧情短片。
内容创作:博主、导演、游戏开发者用来做样片、预览或完整片段。
交互式视频:未来结合对话代理,能边聊天边实时修改视频(类似“把这里改成晚上”就立刻调整)。
教育、娱乐、营销:做讲解视频、动画故事、产品演示等,效率远超传统拍摄。
使用教程:(建议N卡,显存8G起,支持50系显卡)
整合包包含所需所有节点,下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可。
双击启动,进入WebUI后,点击左侧的 工作流,选择对应的工作流。
输入提示词,设置相关参数,比如宽度、高度和时长(帧数),生成即可。
关于提示词,可按照以下模板填写,工作流中也有固定的模板做参考,你也可以借助大模型,比如DeepSeek等工具撰写提示词:
当前模型对硬件要求高,建议8G显存+32G运存
软件目录结构
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 audio_encoders/
│ │ └── joyai_echo_vocoder.safetensors
│ ├── 📂 text_encoders/
│ │ └── gemma3-12b-joyecho-Q5_1.gguf
│ │ └── joyai_echo_embeddings_processor.safetensors
│ ├── 📂 unet/
│ │ └── JoyAI-Echo-DiT-Q4_K_M.gguf
│ ├── 📂 vae/
│ │ └── joyai_echo_audio_vae.safetensors
│ │ └── joyai_echo_video_vae.safetensors
📂 deepface/
......
下载地址:
https://pan.quark.cn/s/6ab2ff1a2328 本帖最后由 cd37ycs 于 2026-6-20 15:12 编辑
用一键包默认的提示词测试了,4070 super 12G+ 64G 环境生成的视频质量堪忧啊,镜头运动是正确的,人物动作错误不说,关键还丑。有没有改进建议呐?:lol
5060Ti 16G显卡跑得动吗?估计也是慢得要死啊! leelong119 发表于 2026-7-21 16:41
5060Ti 16G显卡跑得动吗?估计也是慢得要死啊!
能跑,有点慢是正常的
页:
[1]