马上注册,下载更多AI资源软件
您需要 登录 才可以下载或查看,没有账号?立即注册
×
MiniMax-H3 V4版:让视频创作变得超简单,新增二次采样,提升画质,文字图片一键生成带声高清视频 ... ... ...
MiniMax-H3 是 MiniMax 公司推出的一款通用、全能型(omni-modal)多模态生成模型,可以同时理解和处理文字、图片、视频、音频,并生成带原生立体声音频的视频。
它像一个“全能视频创作助手”:你给它文字描述、参考图片、参考视频,甚至参考音频,它就能生成最长15秒、最高2K分辨率、带立体声的视频。它在预训练阶段就具备很强的多模态理解和复杂指令跟随能力,不只是简单的“文字转视频”。
MiniMax-H3 V4版:让视频创作变得超简单,新增二次采样,提升画质,文字图片一键生成带声高清视频 ... ... ...
MiniMax-H3 经过多次权威机构测试,应该是目前开源模型里能力最强的“文字/图片/视频/音频 → 带声音视频”全能生成工具,适合需要高质量、可控、带音频的短视频创作场景。
今天分享的 MiniMax-H3 V4版 基于H3模型添加二次采样扩展,生成的视频画质细节更丰富(告别塑料画质),画面更清晰。支持最低8G显存运行使用。同时新增最新加速技术和加速lora,大幅度 降低 生成速度。WebUI支持更自由的模型切换,适配不同的硬件设备使用!
主要特点
多模态输入输出:支持文字、图片、视频、音频的混合输入,输出同步的视频 + 立体声音频(32kHz)。
灵活的生成模式:
纯文字生成视频(Text-to-Video)
首帧/末帧/首尾帧控制生成
多参考(最多9张图、3段视频、3段音频等)控制生成
画质与规格:默认768p,可通过二次生成达到2K;支持多种宽高比(横屏、竖屏、方形等);24帧/秒;时长4–15秒。
语言支持:稳定支持11种语言(中、英、日、韩、法、德、西、意、葡、俄、阿),其他语言也有一定支持。
系统架构:分为三个模块——上下文理解与优化(H3-Context-IR)、基础生成(H3-Base,约33B参数)、2K高清再生成。开源的是基础生成部分,完整高清流程可通过官方API使用。
应用领域
内容创作:短视频、广告、宣传片、社交媒体内容快速生成。
影视与动画:预可视化、分镜、特效参考、简单动画片段。
游戏与虚拟现实:角色动画、场景演示、交互内容原型。
教育与培训:教学视频、演示动画。
营销与电商:产品展示视频、个性化广告。
多模态研究与开发:作为开源基座模型进行微调或二次开发。
使用教程:(建议N卡,显存8G起,运存32G起,支持50系显卡)
整合包包含所需所有节点,下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可。
WebUI模式:
双击启动跳转,进入WebUI后,根据需要上传图像,输入提示词,设置相关参数,运行生成即可。
ComfyUI模式:
双击启动ComfyUI,进入WebUI后,点击左侧的 工作流程,选择对应的工作流
根据需要上传图像,输入提示词,设置相关参数,运行生成即可。
实测8G显存可以运行,但需要开启共享显存,且运存需要32G起。
V4版WebUI支持更自由的自定义模型,6G显存+32G运存用户,可使用 Q3模型,下载后放到 ComfyUI/models/unet 目录,前台切换,Q3模型生成质量略低。
V4版WebUI 新增 Diffusion 版模型切换功能支持,可在WebUI端自由使用社区大佬的的二创模型,比如 红潮系列、Remix系列和Dsiwa系列等,下载后,放到 ComfyUI/models/diffusion_models 目录,前台切换即可。
V4版WebUI 新增自定义 Lora扩展,可自由下载切换第三方Lora模型,Lora模型下载后,放到 ComfyUI/models/loras 目录,前台切换即可。
如需调整二采参数,比如 “百万像素”和“宽高比”,请遵循以下原则,先使用默认数值,比如 “百万像素比”,一次采样保持0.2,二次采样再调高,如果报OOM显存不足错误,可降低二次采样“百万像素比”数值。两次“宽高比”需保持一致。
关于提示词:可使用本站发布的 MiniMax-H3提示词增强器,也可以借助大模型生成。
百万像素和宽高比 对应参数 供大家参考
| 0.2 | 16:9 | 608 x 352 |
| 0.3 | 16:9 | 736 x 416 |
| 0.4 | 16:9 | 864 x 480 |
| 0.5 | 16:9 | 960 x 544 |
| 0.6 | 16:9 | 1056 x 608 |
| 0.7 | 16:9 | 1152 x 640 |
| 0.8 | 16:9 | 1216 x 672 |
| 0.9 | 16:9 | 1280 x 736 |
| 0.98 | 16:9 | 1344 x 768 |
| 1.0 | 16:9 | 1376 x 768 |
| 1.2 | 16:9 | 1504 x 832 |
| 1.5 | 16:9 | 1664 x 928 |
| 1.8 | 16:9 | 1824 x 1024 |
| 2.0 | 16:9 | 1920 x 1088 |
软件目录结构:
📂 ComfyUI/
├── 📂 models/
│ ├── 📂 diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors
│ ├── 📂 unet/
│ │ └── MiniMax-H3-REF2VA-Q4_K_M.gguf
│ │ └── MiniMax-H3-FL2VA-Q4_K_M.gguf
│ ├── 📂 loras/
│ │ └── minimax_h3_fl2v_turbo_4step_v1.1_768p_comfyui_bf16.safetensors
│ ├── 📂 text_encoders/
│ │ └── qwen3vl-32B-MiniMax-H3-Q4_K_M.gguf
│ ├── 📂 latent_upscale_models/
│ │ └── minimax_h3_latent_upscaler_3d_bf16.safetensors
│ └── 📂 vae/
│ └── minimax_h3_audio_vae_fp32.safetensors
│ └── minimax_h3_video_vae_int8_convrot.safetensors
📂 deepface/
......
下载地址:
迅雷云盘:https://pan.xunlei.com/s/VP05-0DRTjMIycX8ePhT3v0JA1?pwd=3rp6
夸克网盘:
🔒付费内容 游客, 上上宾会员 可免费下载该资源, 点此开通上上宾 免费下载全站99%的付费资源。或单独支付 40碎银 下载该资源
|