设为首页收藏本站 劰载中...

 找回密码
 立即注册
查看: 168|回复: 5

Wan2GP V47版:新增MiniMax H3 低配显卡玩转AI绘画/视频生成/音乐语音 支持50系显卡 一键整合包下载

[复制链接]

1060

主题

1880

回帖

13万

积分

武林盟主

积分
137288

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
发表于 昨天 11:40 | 显示全部楼层 |阅读模式

马上注册,下载更多AI资源软件

您需要 登录 才可以下载或查看,没有账号?立即注册

×

Wan2GP V47版:新增MiniMax H3 低配显卡玩转AI绘画/视频生成/音乐语音 支持50系显卡 一键整合包下载 ... .. ...

Wan2GP V47版:新增MiniMax H3 低配显卡玩转AI绘画/视频生成/音乐语音 支持50系显卡 一键整合包下载 ... .. ...

Wan2GP 是一个由DeepBeepMeep开发开源的 “显卡门槛低的全能型 AI 创作工具”,最大的特点是“低显存也能跑”,支持多种模型(视频、图像、语音、音乐),旨在为GPU资源有限的用户提供高质量的 视频/绘画 生成体验。它囊括了多种绘画/视频生成模型,包括最新的MiniMax H3、阿里的Wan及其衍生模型、腾讯的Hunyuan Video和LTV Video等主流视频生成和Qwen-Image-Edit、Flux、Z-Image等模型,通过简洁易用的网页界面,用户无需深入了解复杂的模型细节,即可轻松生成想要的 绘画/视频内容。

Wan2GP 的问世,让广大低端显卡用户也能玩转高大上的视频生成项目了。就以HunyuanVideo 13B图生视频模型来说,原版需要至少80G显存才能跑得动的模型,现在 Wan2GP 把这个标准降低到10GB,而且生成的视频质量几乎没用任何的损失和降低。但缺点也是有的,生成时间会拉长,同时需要更大的运行内存。
Wan2GP 同时支持各种主流高质量的AI绘画和图像编辑模型以及语音和音乐生成模型,目前支持Flux和Qwen主流图像生成和图像编辑模型、Qwen-TTS和Index-TTS等主流语音模型、Ace-Step等音乐生成模型,涵盖视频生成、图像生成、语音音乐等综合领域All In One。


今天分享的 Wan2GP V47版,基于官方 8月4日的 V12.41 打包。新增最强开源视频生成模型 MiniMax H3;Gradio 优化及插件更新。

因后期版本整体做了模块化及大量内部重构,翻译的工作量难度也相应增大,翻译后的版本可能有一些问题, 如有影响使用的问题,请评论区回复,会第一时间修复。

在尽量保证功能完整的情况下,进一步对WebUI做了更多的汉化翻译,目前汉化率97%。新增“多开”功能,支持一次开启多个WebUI。
注. 从V6版到V39版,提供两种版本,免费版和付费版。区别为:免费版不再提供中文翻译,原汁原味官方原版,不包含模型;付费版为中文翻译版,包含一些常用的模型,后期会逐步加入更多模型,以及一些优化功能加入。

因个人精力优先,故从V40版起,不再发布任何免费版本的Wan2GP一键包。如需免费版,请移步历史版本


8月4日更新内容

环境部分:

新增GGUF内核,优化Wan Pytorch 编译器,恢复稳定的环境 torch到2.7;更新 SageAttention;集成Git环境,无需手动安装Git即可实现插件安装配置

因官方已支持 Python 3.11、Pytorch 2.10、Cuda 13组合,对Blackwell架构显卡做了大量优化和性能提升,后期版本考虑单独制作一个基于Blackwell架构(50系显卡)版的Wan2GP。

主要更新内容:


MiniMax H3 是 Seedance 2 的顶级开放重量竞争者,在一个模型中结合了电影视频生成、令人信服的动作、强大的提示依从性和同步的原生立体声音轨

WanGP 版本一如既往地进行了超优化:5-6GB VRAM 仅支持 5 秒(124 帧),8-9GB VRAM 在 832x480 下可支持 15 秒


MiniMax H3 FL2VA:创建或继续镜头:选择此版本可仅从文本生成同步视频和立体声音频、从图像或上一个视频的最后一帧开始、定位结束图像或约束镜头的两端。它还支持带有滑动窗口的更长生成;
MiniMax H3 Ref2VA:重复使用人物、场景、动作或声音:当新视频应遵循参考图像、参考视频或参考音频时,请选择此版本。参考文献引导新生成的结果,而不是成为固定的框架;该版本不支持滑动窗口。

如果您的 RAM 不足,请检查“高级/杂项”选项卡,您会在底部找到一系列量化文本编码器

添加选择量化文本编码器




项目特点

低显存要求:只需 6GB 显存即可运行部分模型,适合“显卡贫民”(老款 NVIDIA RTX 10xx/20xx)。  
多模型支持:兼容 Wan 2.1/2.2、Hunyuan Video、Flux、Qwen Image、LTX Video、Kandinsky 等主流开源生成模型。  
多模态功能:不仅能生成视频,还支持图像编辑、语音合成(TTS)、音乐生成。  
插件生态:内置画廊浏览器、模型管理器、CivitAI 下载器、Upscaler 等工具,方便扩展。  
易用性:提供完整的网页界面和命令行模式,支持队列生成和批处理。  
优化性能:支持量化(int8、fp8、NV FP4 等),提升速度同时降低显存占用。



应用领域

短视频创作:快速生成 AI 视频,用于社交媒体内容、广告或创意展示。  
语音合成与配音:支持情感化 TTS,可生成多角色对话,适合播客、虚拟主播。  
音乐生成:内置 Ace Step、Heart Mula 等模型,可自动生成歌曲和歌词。  
学术研究与实验:为研究人员提供多模态生成平台,方便测试不同模型。  
个性化创作:支持 Lora 微调和控制视频生成参数,满足定制化需求。



使用教程:(建议N卡,显存6G起,部分模型需内存32G起。支持50系显卡,基于CUDA12.8)

使用和之前发布的Wan2.1以及类似的视频生成软件类似,根据需要,点击最上方的模型列表,切换需要使用的模型,会根据切换的模型自动下载,模型较大,耐心等待下载完成。
注. 模型是通用的,更新新版后,只需要将之前旧版的模型目录(目录下的ckpts)移动到新软件目录下即可,无需重复下载

支持文生视频和图生视频。支持低端显卡运行阿里Wan、腾讯HunyuanVideo以及LTV Video等高精度模型。支持多种Lora类型扩展,请根据页面使用说明将lora模型放入对应的目录手动加载。
启动WebUI后,页面有“指南”选项卡,作者很详细的介绍了不同的模型参数和特点及应用领域、Lora模型的加载及使用以及VACE ControlNet的详细使用说明。UI我也做了大部分汉化,方便大家使用。
基于原版使用文档,我做了详细的翻译,建议大家仔细阅读,作为操作参考。

测试了30-50系显卡,均能正常运行。10-20没做测试,可自行测试


模型下载技巧:打开模型下载链接后,选择“按修改时间”排序,即可快速找到最新版本同步更新的模型,下载放到ckpts目录即可。


Wan2.2 提示词填写技巧,可以参考官方文档:
https://mp.weixin.qq.com/s/ucHuyomTZ6X2q_tL3wHQQg
https://alidocs.dingtalk.com/i/nodes/jb9Y4gmKWrx9eo4dCql9LlbYJGXn6lpz


软件目录结构:

📂 ckpts/
│   ├── 📂 chinese-wav2vec2-base/
│   │      └── pytorch_model.bin
│   ├── 📂 Qwen2.5-VL-7B-Instruct/
│   │      └── Qwen2.5-VL-7B-Instruct_quanto_bf16_int8.safetensors
│   └── 📂 umt5-xxl/
│          └── models_t5_umt5-xxl-enc-quanto_int8.safetensors
📂 models/
│   ├── 📂 qwen/
│   ├── 📂 wan/

│    ...
📂 loras/
📂 deepface/
......





下载地址:
夸克网盘:
🔒付费内容
游客, 上上宾会员 可免费下载该资源,点此开通上上宾 免费下载全站99%的付费资源。或单独支付 99碎银 下载该资源


百度网盘:
🔒付费内容
游客, 上上宾会员 可免费下载该资源,点此开通上上宾 免费下载全站99%的付费资源。或单独支付 99碎银 下载该资源


DEEPFACE论坛免责声明
本论坛发布的所有内容,包括图片、软件、模型等部分来自网络,版权归原作者所有。
本论坛提供的内容仅用于个人学习和研究,请勿滥用,否则由此引发的责任需自行承担。
请合理合法使用AI技术,并遵守当地法律法规,不要用于违法用途!
如本站发布内容侵犯了你的合法权益,请联系我们删除。
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

1060

主题

1880

回帖

13万

积分

武林盟主

积分
137288

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
 楼主| 发表于 昨天 15:10 | 显示全部楼层
MiniMax H3提示词生成技巧(模板来自“超级面爸”公众号):

  1. 你是一个 MiniMax-H3 视频生成提示词专家。你的任务是根据用户的描述,生成符合 MiniMax-H3 格式要求的视频提示词。  ## 任务类型 根据用户提供的素材判断任务类型: - T2VA:纯文本生成视频,无参考图。提示词直接从三个核心字段开始。 - I2VA:一张首帧参考图。提示词第一行为对齐指令,然后空一行,再写三个核心字段。 - FL2VA:首帧+尾帧两张参考图。提示词第一行为对齐指令,然后空一行,再写三个核心字段。 - L2VA:一张尾帧参考图。提示词第一行为对齐指令,然后空一行,再写三个核心字段。  ## 对齐指令模板 - I2VA: For the target video, at 0.00 seconds into the target video, <Picture 1> (from [Shot 1]) is fully referenced.  - FL2VA(N 为实际最后一个镜头编号,S.SS 为视频时长,保留两位小数): How the reference pictures align with the target video — Picture 1 (from Shot 1) aligns with the 0.00-second mark of the target video; Picture 2 (from Shot N) aligns with the S.SS-second mark of the target video.  - L2VA(N 为实际最后一个镜头编号,S.SS 为视频时长,保留两位小数): How the reference pictures align with the target video — <Picture 1> (from [Shot N]) aligns with the S.SS-second mark of the target video.  ## 三个核心字段 1. integrated_multimodal_description:沿时间线描述画面风格、构图、人物、动作、镜头运动、对白和现场声音。 2. overall_soundscape:1-4 句英文,概括全视频的环境音、动作音和非语言人声。对白和唱歌不写这里。 3. non_diegetic_music:1-3 句英文,描述只有观众能听到的背景音乐,聚焦乐器、速度、节奏和动态变化。无配乐写 N/A。  ## 写作规则 1. [Shot 1] 开头先定风格(Cinematic/live-action/2D-animated/3D CG/claymation/watercolor/vintage film)和初始构图。 2. 第一个镜头不加时间戳;后续镜头用 [Shot N] At MM:SS.mmm, the camera cuts to... 格式,时间严格递增。 3. 镜头运动写成自然英文动作句,格式为:运动类型 + with small/large amplitude + at slow/fast speed。中等幅度和正常速度可省略。可用类型:Zoom In/Out, Push In/Pull Out, Pan Left/Right, Truck Left/Right, Tilt Up/Down, Pedestal Up/Down, Arc Shot, Tracking Shot, Static Shot, Shake Slightly/Strongly, POV, Roll Clockwise/Counterclockwise。 4. 说话人用稳定 ID (S1)(S2),多人同说用 (S1,S2)。首次出场需描述年龄、性别、音色等身份信息。对白格式:<d>[语言] 原文内容</d>,原文一字不改不翻译。 5. 旁白用 says in an off-screen voiceover,其后必须写明画面中人物嘴唇保持闭合。 6. 对白跨镜头用 <scenetrans> 标记并写明声音延续;被结尾截断用 <cutoff>。 7. 画面内可见文字(招牌、字幕、标签)用英文双引号包裹,保留原文不翻译。 8. I2VA:Shot 1 须声明人物外貌、服装、位置、场景与 Picture 1 保持一致,然后从首帧发展动作。结构:首帧锚定→动作起始→连续发展→结果或反应。 9. FL2VA:通常用单镜头,写从首帧到尾帧的运动路径。结构:首帧状态→中间变化→差异缩小→尾帧状态。末尾须明确对齐到 Picture 2。 10. L2VA:反推兼容的前情状态,让动作逐步收敛到尾帧。结构:合理前情→动作和过渡→逐步收敛→尾帧着陆。末尾须明确对齐到 Picture 1。 11. 整个提示词用英文撰写(<d> 内的对白原文和画面内文字保留原始语言)。  ## 输出格式 直接输出完整提示词,不要加任何解释、注释或 markdown 代码块标记。格式如下:  [对齐指令——仅 I2VA/FL2VA/L2VA 需要,T2VA 跳过]  integrated_multimodal_description: [Shot 1] ...  overall_soundscape: ...  non_diegetic_music: ...  ## 用户输入 {用户会在这里描述想要的视频内容、提供参考图信息、指定视频时长等}
复制代码


1、复制上面的提示词模板,发给大模型,比如豆包,deepseek,千问等
2、输入你需要生成的视频内容主题,比如 “生成一段美女热舞的视频,美女一边跳舞,一边冲着镜头说[come on baby]” 等。如果是文生视频,带上图片,输入主题内容
3、等待大模型生成提示词,复制到提示词即可。

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

0

主题

29

回帖

134

积分

上上宾

积分
134

上上宾

发表于 昨天 12:38 | 显示全部楼层
哇靠哥你也太快了,昨晚还在说这个,今天就来了

12

主题

154

回帖

2641

积分

超级版主

积分
2641

突出贡献

发表于 昨天 15:05 | 显示全部楼层
效率好高啊

0

主题

21

回帖

226

积分

上上宾

积分
226

上上宾

发表于 昨天 15:19 | 显示全部楼层
辛苦辛苦,这必须充电支持了!

1060

主题

1880

回帖

13万

积分

武林盟主

积分
137288

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
 楼主| 发表于 昨天 15:21 | 显示全部楼层
215069003 发表于 2026-8-4 15:19
辛苦辛苦,这必须充电支持了!

感谢老板支持!

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|前沿AI软件资源站

GMT+8, 2026-8-5 04:48 , Processed in 0.056041 second(s), 7 queries , Redis On.

Powered by Discuz! X3.5

©2001-2023 Discuz! Team

快速回复 返回顶部 返回列表