马上注册,下载更多AI资源软件
您需要 登录 才可以下载或查看,没有账号?立即注册
×
Wan2GP V48版:新增Animate 2 低配显卡玩转AI绘画/视频生成/音乐语音生成
Wan2GP 是一个由DeepBeepMeep开发开源的 “显卡门槛低的全能型 AI 创作工具”,最大的特点是“低显存也能跑”,支持多种模型(视频、图像、语音、音乐),旨在为GPU资源有限的用户提供高质量的 视频/绘画 生成体验。它囊括了多种绘画/视频生成模型,包括最新的MiniMax H3、阿里的Wan及其衍生模型、腾讯的Hunyuan Video和LTV Video等主流视频生成和Qwen-Image-Edit、Flux、Z-Image等模型,通过简洁易用的网页界面,用户无需深入了解复杂的模型细节,即可轻松生成想要的 绘画/视频内容。
Wan2GP 的问世,让广大低端显卡用户也能玩转高大上的视频生成项目了。就以HunyuanVideo 13B图生视频模型来说,原版需要至少50G显存才能跑得动的模型,现在 Wan2GP 把这个标准降低到10GB,而且生成的视频质量几乎没用任何的损失和降低。但缺点也是有的,生成时间会拉长,同时需要更大的运行内存。
Wan2GP 同时支持各种主流高质量的AI绘画和图像编辑模型以及语音和音乐生成模型,目前支持Flux和Qwen主流图像生成和图像编辑模型、Qwen-TTS和Index-TTS等主流语音模型、Ace-Step等音乐生成模型,涵盖视频生成、图像生成、语音音乐等综合领域All In One。
今天分享的 Wan2GP V48版,基于官方 8月4日的 V12.452 打包。新增角色动画生成模型 Wan2.2 Animate 2、以及最强开源视频生成模型 MiniMax H3 多个加速lora,大幅度提升生成速度;Gradio 优化及插件更新。
因后期版本整体做了模块化及大量内部重构,翻译的工作量难度也相应增大,翻译后的版本可能有一些问题, 如有影响使用的问题,请评论区回复,会第一时间修复。
在尽量保证功能完整的情况下,进一步对WebUI做了更多的汉化翻译,目前汉化率97%。新增“多开”功能,支持一次开启多个WebUI。
注. 从V6版到V39版,提供两种版本,免费版和付费版。区别为:免费版不再提供中文翻译,原汁原味官方原版,不包含模型;付费版为中文翻译版,包含一些常用的模型,后期会逐步加入更多模型,以及一些优化功能加入。
因个人精力优先,故从V40版起,不再发布任何免费版本的Wan2GP一键包。如需免费版,请移步历史版本。
8月11日更新内容
环境部分:
新增GGUF内核,优化Wan Pytorch 编译器,恢复稳定的环境 torch到2.7;更新 SageAttention;集成Git环境,无需手动安装Git即可实现插件安装配置
因官方已支持 Python 3.11、Pytorch 2.10、Cuda 13组合,对Blackwell架构显卡做了大量优化和性能提升,后期版本考虑单独制作一个基于Blackwell架构(50系显卡)版的Wan2GP。
主要更新内容:
MiniMax H3 拥有所有潜力等待释放。我们找到了钥匙。
滑动窗口/继续视频:FL2VA 和 Ref2VA 现在都可以制作更长的视频。 WanGP 将上一个窗口的关闭动作和匹配的音频传送到下一个窗口中。最重要的是,重叠不再局限于单个帧:使用多个重叠帧可以为 H3 提供跨连接的真实运动和声音背景,从而提供更平滑的过渡;
Ref2VA 的开始图像/结束图像:从所选图像启动新镜头,瞄准特定结局,或为连续视频提供其应有的目的地。 Ref2VA 会在每个滑动窗口中保留其选定的参考记忆,因此后面的窗口可以继续跟踪相同的人物、地点、动作和声音;
FL2VA 中的帧注入:将多个选定的图像放置在 FL2VA 视频中的确切时刻。输入帧位置以实现精确计时,或输入 L 来表示滑动窗口片段的末尾——无需便签的数字故事板;
音频源:FL2VA 可以从文本创建一切,遵循上传的音轨,使用带有原始音频的控制视频,或者在创作新音轨时保持视频不变。全长源音频保留在最终文件中;如果它提前耗尽,H3 会接管而不是保持沉默;
Spectrum v0.2.1 具有离线重放功能:H3 Spectrum 现在可以捕获干净的加速轨迹并执行无变压器的平滑重放。视频和音频独立重建,以获得更好的音频质量;
控制视频/降噪强度:随着强度的增加,FL2VA 可以保持靠近控制视频或远离控制视频。在 1.0 的 Whole Frame 中,视觉控制是不必要的,因此 WanGP 跳过了额外的工作——你的 GPU 现在可能需要短暂的喝咖啡休息一下;
视频遮罩/遮罩强度:选择整个帧、遮罩区域或非遮罩区域来决定 FL2VA 可能进行更改的位置以及剩余图像应遵循原始图像的牢固程度。
Wan2.2 Animate 2。Animate 回来了——它想要夺回 Scail 2 夺走的王冠。给它一个角色图像和一个驾驶视频,它会让该角色跟随视频的动作、表情和镜头动作:舞蹈动作、表演、手势、时尚剪辑、生物动画等等。
H3 现在拥有新的加速器和 RAM 压缩器。选择一个或堆叠它们 - 确切的增益取决于您的视频、硬件和设置。
第一个块缓存:在高级模式/步骤跳过下,H3 运行第一个块,并在几乎没有变化时重用其余块的先前结果 - 想想 TeaCache 的酷表兄弟,由第一个块的输出驱动。平衡(0.08)是上游默认值;更高的阈值可以跳过更多的工作并加快速度,并可能在运动或细节上进行权衡。缓存经过调整,只增加很少的 VRAM 开销。是的,跳过步骤开始时刻(以生成百分比表示)的含义正如其所言:它选择何时开始跳过,而不是加速因子;
Sol-Attn:在高级模式/杂项下。 / 覆盖注意力模式,稀疏注意力加速大型视觉序列。它需要 BF16、Triton 3.6+ 和兼容的 NVIDIA GPU(RTX 40/50 系列、H100/H200 或 B100/B200)。 RTX 40 系列的预期增益范围为 10-20%,RTX 50 系列的增益范围为 30% 左右,但可能会做出较小的质量权衡;
混合搭配:Spectrum 和 First Block Cache 是替代的跳步模式。从技术上讲,Sol-Attn 可以使用任何一种运行,但堆叠近似可能会降低质量,因此在依赖组合之前应使用相同的种子进行检查;
较低 RAM 视频 VAE:在高级模式/杂项下选择 FP8 混合精度。 /Video VAE 减少H3的Video VAE权重占用的RAM。感谢 Kijai 创建了这个量化 VAE;
新的 W4A8 INT8 支持:H3 现在可以加载非对称 W4A8 检查点。它们的 4 位权重减少了检查点大小和系统 RAM 使用,而 8 位激活在兼容的 NVIDIA GPU(RTX 30 系列或更高版本)上使用优化的 INT8 内核。内存严重不足?查找已在线提供的兼容社区 H3 W4A8/Q4 或 NVFP4 检查点;
LoRA 加速器:感谢 Lightx2v 和 larryvrh 为 Minimax H3 提供了第一批 LoRA 加速器。您可以在 WanGP 顶部的“设置”下拉框中找到它们作为预定义配置文件。如果对质量不满意和/或对 LoRA 乘数不满意,您可能需要将步数增加到 8(默认值为 0.5,因为 1.0 似乎太强)。
项目特点
低显存要求:只需 6GB 显存即可运行部分模型,适合“显卡贫民”(老款 NVIDIA RTX 10xx/20xx)。
多模型支持:兼容 Wan 2.1/2.2、Hunyuan Video、Flux、Qwen Image、LTX Video、Kandinsky 等主流开源生成模型。
多模态功能:不仅能生成视频,还支持图像编辑、语音合成(TTS)、音乐生成。
插件生态:内置画廊浏览器、模型管理器、CivitAI 下载器、Upscaler 等工具,方便扩展。
易用性:提供完整的网页界面和命令行模式,支持队列生成和批处理。
优化性能:支持量化(int8、fp8、NV FP4 等),提升速度同时降低显存占用。
应用领域
短视频创作:快速生成 AI 视频,用于社交媒体内容、广告或创意展示。
语音合成与配音:支持情感化 TTS,可生成多角色对话,适合播客、虚拟主播。
音乐生成:内置 Ace Step、Heart Mula 等模型,可自动生成歌曲和歌词。
学术研究与实验:为研究人员提供多模态生成平台,方便测试不同模型。
个性化创作:支持 Lora 微调和控制视频生成参数,满足定制化需求。
使用教程:(建议N卡,显存6G起,部分模型需内存32G起。支持50系显卡,基于CUDA12.8)
使用和之前发布的Wan2.1以及类似的视频生成软件类似,根据需要,点击最上方的模型列表,切换需要使用的模型,会根据切换的模型自动下载,模型较大,耐心等待下载完成。
注. 模型是通用的,更新新版后,只需要将之前旧版的模型目录(目录下的ckpts)移动到新软件目录下即可,无需重复下载
支持文生视频和图生视频。支持低端显卡运行阿里Wan、腾讯HunyuanVideo以及LTV Video等高精度模型。支持多种Lora类型扩展,请根据页面使用说明将lora模型放入对应的目录手动加载。
启动WebUI后,页面有“指南”选项卡,作者很详细的介绍了不同的模型参数和特点及应用领域、Lora模型的加载及使用以及VACE ControlNet的详细使用说明。UI我也做了大部分汉化,方便大家使用。
基于原版使用文档,我做了详细的翻译,建议大家仔细阅读,作为操作参考。
测试了30-50系显卡,均能正常运行。10-20没做测试,可自行测试
模型下载技巧:打开模型下载链接后,选择“按修改时间”排序,即可快速找到最新版本同步更新的模型,下载放到ckpts目录即可。
Wan2.2 提示词填写技巧,可以参考官方文档:
https://mp.weixin.qq.com/s/ucHuyomTZ6X2q_tL3wHQQg
https://alidocs.dingtalk.com/i/nodes/jb9Y4gmKWrx9eo4dCql9LlbYJGXn6lpz
软件目录结构:
📂 ckpts/
│ ├── 📂 chinese-wav2vec2-base/
│ │ └── pytorch_model.bin
│ ├── 📂 Qwen2.5-VL-7B-Instruct/
│ │ └── Qwen2.5-VL-7B-Instruct_quanto_bf16_int8.safetensors
│ └── 📂 umt5-xxl/
│ └── models_t5_umt5-xxl-enc-quanto_int8.safetensors
📂 models/
│ ├── 📂 qwen/
│ ├── 📂 wan/
│ ...
📂 loras/
📂 deepface/
......
下载地址:
夸克网盘:
🔒付费内容 游客, 上上宾会员 可免费下载该资源, 点此开通上上宾 免费下载全站99%的付费资源。或单独支付 99碎银 下载该资源
百度网盘:
🔒付费内容 游客, 上上宾会员 可免费下载该资源, 点此开通上上宾 免费下载全站99%的付费资源。或单独支付 99碎银 下载该资源
|