MiniMax-H3 V5版:让视频创作变得超简单,文生视频 / 首尾帧视频生成 / 多图-音频-视频参考视频生成
MiniMax-H3 是 MiniMax 公司推出的一款通用、全能型(omni-modal)多模态生成模型,可以同时理解和处理文字、图片、视频、音频,并生成带原生立体声音频的视频。
它像一个“全能视频创作助手”:你给它文字描述、参考图片、参考视频,甚至参考音频,它就能生成最长15秒、最高2K分辨率、带立体声的视频。它在预训练阶段就具备很强的多模态理解和复杂指令跟随能力,不只是简单的“文字转视频”。
MiniMax-H3 经过多次权威机构测试,应该是目前开源模型里能力最强的“文字/图片/视频/音频 → 带声音视频”全能生成工具,适合需要高质量、可控、带音频的短视频创作场景。
今天分享的 MiniMax-H3 V5版 基于H3模型整合打包,支持文生视频、图生视频和多图/音频/视频参考视频生成(支持最多3张参考图,3个音频参考和3个参考视频)。新增多项加速和内存优化技术,新增二次采样扩展,新增多个“去AI味儿”lora,生成的视频画质细节更丰富(告别塑料画质),画面更清晰,新增PDD加速lora,支持最低8G显存运行使用,大幅度 降低 生成速度。WebUI支持更自由的模型切换,适配不同的硬件设备使用!
主要特点
多模态输入输出:支持文字、图片、视频、音频的混合输入,输出同步的视频 + 立体声音频(32kHz)。
灵活的生成模式:
纯文字生成视频(Text-to-Video)
首帧/末帧/首尾帧控制生成
多参考(最多9张图、3段视频、3段音频等)控制生成
画质与规格:默认768p,可通过二次生成达到2K;支持多种宽高比(横屏、竖屏、方形等);24帧/秒;时长4–15秒。
语言支持:稳定支持11种语言(中、英、日、韩、法、德、西、意、葡、俄、阿),其他语言也有一定支持。
系统架构:分为三个模块——上下文理解与优化(H3-Context-IR)、基础生成(H3-Base,约33B参数)、2K高清再生成。开源的是基础生成部分,完整高清流程可通过官方API使用。
应用领域
内容创作:短视频、广告、宣传片、社交媒体内容快速生成。
影视与动画:预可视化、分镜、特效参考、简单动画片段。
游戏与虚拟现实:角色动画、场景演示、交互内容原型。
教育与培训:教学视频、演示动画。
营销与电商:产品展示视频、个性化广告。
多模态研究与开发:作为开源基座模型进行微调或二次开发。
使用教程:(建议N卡,显存8G起,运存32G起,支持50系显卡)
整合包包含所需所有节点,下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可。
WebUI模式:
双击启动跳转,进入WebUI后,根据需要选择生成模式(支持文生视频/首尾帧视频生成/多图、音视频参考生成),上传图像,输入提示词,设置相关参数,运行生成即可。
高级参数支持二次采样详细设置,比如首次采样“宽高比”(视频分辨率)和采样步数,建议首次不要设置太高,尤其是显存低于12G的设备,建议0.2起;二采可以设置高一些,但也要根据显卡设置,不要盲目设置过大。总采样步数=一采步数+二采步数(比如一采设置8,总数为12,则默认二采样即为4步,一采建议不低于6)
支持自定义模型切换(DiT和GGUF两种模式),文生视频和首尾帧视频生成使用模型模型即可;参考模式则需手动切换 前缀带有“minimax_h3_ref2va”的模型,比如“minimax_h3_ref2va_pruned_int8_convrot.safetensors或MiniMax-H3-REF2VA-Q4_K_M.gguf”。
lora模型新增“MysticXXX_MMH3-V1.safetensors”,可去除生成“AI味儿”,尤其适合生成人物特写,比如人脸近景等画面。如生成运动幅度过大的视频,可降低该lora的模型强度,比如0.5左右。
8G显存显卡用户,建议开启高级设置里的“低显存模式”选项
ComfyUI模式:
双击启动ComfyUI,进入页面后,点击左侧的 工作流程,选择对应的工作流
根据需要开启图像和音视频节点,上传图像,输入提示词,设置相关参数,运行生成即可。
支持自定义模型切换(DiT和GGUF两种模式,需手动切换节点),文生视频和首尾帧视频生成使用默认模型即可;参考模式则需手动切换 前缀带有“minimax_h3_ref2va”的模型,比如“minimax_h3_ref2va_pruned_int8_convrot.safetensors或MiniMax-H3-REF2VA-Q4_K_M.gguf”。
lora模型新增“MysticXXX_MMH3-V1.safetensors”,可去除生成“AI味儿”,尤其适合生成人物特写,比如人脸近景等画面。如生成运动幅度过大的视频,可降低该lora的模型强度,比如0.5左右。
实测8G显存可以运行,但需要开启共享显存,且运存需要32G起。
V5版WebUI支持更自由的自定义模型,6G显存+32G运存用户,可使用 Q3模型,下载后放到 ComfyUI/models/unet 目录,前台切换,Q3模型生成质量略低。
V5版WebUI 新增 Diffusion 版模型切换功能支持,可在WebUI端自由使用社区大佬的的二创模型,比如 红潮系列、Remix系列和Dsiwa系列等,下载后,放到 ComfyUI/models/diffusion_models 目录,前台切换即可。
V5版WebUI 新增自定义 Lora扩展,可自由下载切换第三方Lora模型,Lora模型下载后,放到 ComfyUI/models/loras 目录,前台切换即可。
如需调整二采参数,比如 “百万像素”和“宽高比”,请遵循以下原则,先使用默认数值,比如 “百万像素比”,一次采样保持0.2,二次采样再调高,如果报OOM显存不足错误,可降低二次采样“百万像素比”数值。
关于提示词:可使用本站发布的 MiniMax-H3提示词增强器,也可以借助大模型生成。
百万像素和宽高比 对应参数 供大家参考
| 0.2 | 16:9 | 608 x 352 |
| 0.3 | 16:9 | 736 x 416 |
| 0.4 | 16:9 | 864 x 480 |
| 0.5 | 16:9 | 960 x 544 |
| 0.6 | 16:9 | 1056 x 608 |
| 0.7 | 16:9 | 1152 x 640 |
| 0.8 | 16:9 | 1216 x 672 |
| 0.9 | 16:9 | 1280 x 736 |
| 0.98 | 16:9 | 1344 x 768 |
| 1.0 | 16:9 | 1376 x 768 |
| 1.2 | 16:9 | 1504 x 832 |
| 1.5 | 16:9 | 1664 x 928 |
| 1.8 | 16:9 | 1824 x 1024 |
| 2.0 | 16:9 | 1920 x 1088 |
软件目录结构:
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 unet/
│ │ └── MiniMax-H3-REF2VA-Q4_K_M.gguf
│ │ └── MiniMax-H3-FL2VA-Q4_K_M.gguf
│ ├── 📂 loras/
│ │ └── minimax_h3_fl2v_turbo_4step_v1.1_768p_comfyui_bf16.safetensors
│ │ └── MiniMax-H3-FL2VA-Acc-8Step_pruned_comfy.safetensors
│ │ └── MiniMax-H3-Ref2VA-Acc-8Step_pruned_comfy.safetensors
│ │ └── MysticXXX_MMH3-V1.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_int8_convrot.safetensors
│ │ └── qwen3vl-32B-MiniMax-H3-Q4_K_M.gguf
│ ├── 📂 latent_upscale_models/
│ │ └── minimax_h3_latent_upscaler_3d_bf16.safetensors
│ └── 📂 vae/
│ └── minimax_h3_audio_vae_fp32.safetensors
│ └── minimax_h3_video_vae_int8_convrot.safetensors
📂 deepface/
......
下载地址:
夸克网盘:
**** 本内容需购买 ****
百度网盘:
**** 本内容需购买 ****
赞一个 新增文生视频模式
页:
[1]