设为首页收藏本站 劰载中...

 找回密码
 立即注册
查看: 55|回复: 7

MiniMax-H3 V2版:让视频创作变得超简单,支持音频/视频参考,文字图片一键生成带声高清视频

[复制链接]

1061

主题

1889

回帖

13万

积分

武林盟主

积分
137555

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
发表于 昨天 23:01 | 显示全部楼层 |阅读模式

马上注册,下载更多AI资源软件

您需要 登录 才可以下载或查看,没有账号?立即注册

×

MiniMax-H3 V2版:让视频创作变得超简单,支持音频/视频参考,文字图片一键生成带声高清视频 ... ...

MiniMax-H3 V2版:让视频创作变得超简单,支持音频/视频参考,文字图片一键生成带声高清视频 ... ...

MiniMax-H3 是 MiniMax 公司推出的一款通用、全能型(omni-modal)多模态生成模型,可以同时理解和处理文字、图片、视频、音频,并生成带原生立体声音频的视频。
它像一个“全能视频创作助手”:你给它文字描述、参考图片、参考视频,甚至参考音频,它就能生成最长15秒、最高2K分辨率、带立体声的视频。它在预训练阶段就具备很强的多模态理解和复杂指令跟随能力,不只是简单的“文字转视频”。

MiniMax-H3 经过多次权威机构测试,应该是目前开源模型里能力最强的“文字/图片/视频/音频 → 带声音视频”全能生成工具,适合需要高质量、可控、带音频的短视频创作场景。



今天分享的 MiniMax-H3 V2版 基于社区大佬分享的 GGUF版模型打包制作,最低8G显存可运行使用,新增 Sage加速,新增多图(最高3张参考图)、音频、视频参考功能



主要特点

多模态输入输出:支持文字、图片、视频、音频的混合输入,输出同步的视频 + 立体声音频(32kHz)。
灵活的生成模式:
纯文字生成视频(Text-to-Video)
首帧/末帧/首尾帧控制生成
多参考(最多9张图、3段视频、3段音频等)控制生成

画质与规格:默认768p,可通过二次生成达到2K;支持多种宽高比(横屏、竖屏、方形等);24帧/秒;时长4–15秒。
语言支持:稳定支持11种语言(中、英、日、韩、法、德、西、意、葡、俄、阿),其他语言也有一定支持。
系统架构:分为三个模块——上下文理解与优化(H3-Context-IR)、基础生成(H3-Base,约33B参数)、2K高清再生成。开源的是基础生成部分,完整高清流程可通过官方API使用。



应用领域

内容创作:短视频、广告、宣传片、社交媒体内容快速生成。
影视与动画:预可视化、分镜、特效参考、简单动画片段。
游戏与虚拟现实:角色动画、场景演示、交互内容原型。
教育与培训:教学视频、演示动画。
营销与电商:产品展示视频、个性化广告。
多模态研究与开发:作为开源基座模型进行微调或二次开发。



使用教程:(建议N卡,显存8G起,运存32G起,支持50系显卡)

整合包包含所需所有节点,下载主程序和模型(ComfyUI文件夹),解压主程序一键包,将ComfyUI文件夹移动到主程序目录下即可。

WebUI模式:
双击启动跳转,进入WebUI后,根据需要上传图像,音频参考或参考视频,输入提示词,设置相关参数,运行生成即可。

ComfyUI模式:
双击启动ComfyUI,进入WebUI后,点击左侧的 工作流程,选择对应的工作流
根据需要上传图像,音频参考或参考视频,输入提示词,设置相关参数,运行生成即可。

实测8G显存可以运行,但需要开启共享显存,且运存需要32G起。使用音频参考8G显存有机率出现显存不足的报错,建议12G显存起使用音频/视频参考功能。

开启Sage加速需要本地有C++编译环境



百万像素和宽高比 对应参数 供大家参考

| 0.2 | 16:9 | 608 x 352 |
| 0.3 | 16:9 | 736 x 416 |
| 0.4 | 16:9 | 864 x 480 |
| 0.5 | 16:9 | 960 x 544 |
| 0.6 | 16:9 | 1056 x 608 |
| 0.7 | 16:9 | 1152 x 640 |
| 0.8 | 16:9 | 1216 x 672 |
| 0.9 | 16:9 | 1280 x 736 |
| 0.98 | 16:9 | 1344 x 768 |
| 1.0 | 16:9 | 1376 x 768 |
| 1.2 | 16:9 | 1504 x 832 |
| 1.5 | 16:9 | 1664 x 928 |
| 1.8 | 16:9 | 1824 x 1024 |
| 2.0 | 16:9 | 1920 x 1088 |



软件目录结构:

📂 ComfyUI/
├── 📂 models/
│   ├── 📂 unet/
│   │      └── MiniMax-H3-REF2VA-Q4_K_M.gguf
│   │      └── MiniMax-H3-FL2VA-Q4_K_M.gguf
│   ├── 📂 text_encoders/
│   │      └── qwen3vl-32B-MiniMax-H3-Q4_K_M.gguf
│   └── 📂 vae/
│          └── minimax_h3_audio_vae_fp32.safetensors
│          └── minimax_h3_video_vae_fp16.safetensors
📂 deepface/
......




下载地址:
一键包在路上...
DEEPFACE论坛免责声明
本论坛发布的所有内容,包括图片、软件、模型等部分来自网络,版权归原作者所有。
本论坛提供的内容仅用于个人学习和研究,请勿滥用,否则由此引发的责任需自行承担。
请合理合法使用AI技术,并遵守当地法律法规,不要用于违法用途!
如本站发布内容侵犯了你的合法权益,请联系我们删除。
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

1061

主题

1889

回帖

13万

积分

武林盟主

积分
137555

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
 楼主| 发表于 昨天 23:08 | 显示全部楼层
MiniMax H3提示词生成技巧(模板来自“超级面爸”公众号):

  1. You are an expert prompt engineer for MiniMax-H3 Full-Reference Mode (multi-parameter mode) video generation. Your task is to convert the user's natural-language request and reference assets into a structured six-section prompt.  Output exactly these six sections in order:  1. subject_definitions - Define every referenced content unit that must be tracked separately: people, objects, scenes, styles, actions, and audio tracks. - Use <Subject N> for reusable visible content; <Picture N> for images serving as concrete frame anchors (first frame, keyframe, last frame); <Video N> for source/structural video references; <Audio N> for audio assets. - One item per line. State what the label denotes, its reference role, and key features. If a picture only defines a subject, cite it inside that subject's definition instead of creating a standalone entry.  2. summary - Begin with a square-bracketed task-type prefix. Available types: keyframe completion, reference generation, video editing, video continuation, audio reuse, audio reference. Combine multiple with " + ". - Write one short English paragraph summarizing the target video and reference relationships using the labels defined above. Do not introduce new labels here.  3. retention_analysis - One line per reference label. - Visible content (<Subject N>, <Picture N>, <Video N>): use fully_preserved, partially_preserved, attribute_transfer, or weak_reference. - Audio (<Audio N>): use fully_copy, partially_copy, reference, or weak_reference. - State which shots each item appears in.  4. detailed_description - Write in English. Preserve the original language only for dialogue, lyrics, and visible on-screen text. - Use [Shot 1] for the opening shot. Later shots: [Shot N] At MM:SS.mmm. - For each shot describe: composition, subject position and appearance, lighting, actions and state changes, camera movement, and sound. - Insert reference labels at first appearance and where their roles apply. Do not redefine labels in later shots. - Assign speaker IDs (S1, S2, ...) in order of first vocal event and reuse throughout. Write dialogue as <d>[Language] text</d>. Use [unclear] for unintelligible speech. - Target 350-500 English words for generation tasks.  5. overall_soundscape - Summarize ambient and physical sounds across the full video. Do not repeat dialogue here.  6. non_diegetic_music - Describe audience-only background music (instrumentation, tempo, dynamics). Write "N/A" if none.  Rules: - Once a label is assigned, keep its meaning consistent across all six sections. - Do not introduce new reference labels in summary, retention_analysis, or the audio sections. - An ordinary reference video with sound does not create <Audio N> unless the audio is explicitly reused or referenced. - Standardize dialogue punctuation to basic marks (, . ? !). Remove decorative or repeated punctuation. - Target-video additions (new actions, backgrounds, plot events) do not count as losses of reference fidelity.  Now, given the user's request and reference assets below, generate the complete six-section prompt.
复制代码



1、复制上面的提示词模板,发给大模型,比如豆包,deepseek,千问等
2、输入你需要生成的视频内容主题,比如 “手机跟拍视角,一镜到底,图中婴儿坐在人力三轮货车车厢里,手持玩具小吉他,忘情歌唱,三轮车缓缓向前骑行,视频时长13秒,一开始就有音乐,要求婴儿口型与音乐同步” 等。如果是文生视频,带上图片,输入主题内容
3、等待大模型生成提示词,复制到提示词即可。

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

0

主题

234

回帖

602

积分

上上宾

积分
602

上上宾

发表于 昨天 23:15 | 显示全部楼层
这个GGUF版本质量会有损失吗?

1061

主题

1889

回帖

13万

积分

武林盟主

积分
137555

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
 楼主| 发表于 昨天 23:16 | 显示全部楼层
轩辕 发表于 2026-8-5 23:15
这个GGUF版本质量会有损失吗?

有损失,向低配硬件妥协的量化模型
显卡好的,用之前发的版本

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

0

主题

234

回帖

602

积分

上上宾

积分
602

上上宾

发表于 昨天 23:19 | 显示全部楼层
无言以对 发表于 2026-8-5 23:16
有损失,向低配硬件妥协的量化模型
显卡好的,用之前发的版本

之前那个版本能增加优化加速和上参考图,视频,音频参考功能吗?

1061

主题

1889

回帖

13万

积分

武林盟主

积分
137555

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
 楼主| 发表于 昨天 23:20 | 显示全部楼层
轩辕 发表于 2026-8-5 23:19
之前那个版本能增加优化加速和上参考图,视频,音频参考功能吗?

Wan2GP有这些功能
后期等lora出来后,会做一个

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)

0

主题

234

回帖

602

积分

上上宾

积分
602

上上宾

发表于 昨天 23:23 | 显示全部楼层
无言以对 发表于 2026-8-5 23:20
Wan2GP有这些功能
后期等lora出来后,会做一个

Wan2GP的模型是满血的吗?

1061

主题

1889

回帖

13万

积分

武林盟主

积分
137555

宣传达人灌水之王突出贡献荣誉管理论坛元老

QQ
 楼主| 发表于 8 分钟前 | 显示全部楼层
轩辕 发表于 2026-8-5 23:23
Wan2GP的模型是满血的吗?

满血的最少三张5090 32G显存才能跑
都是量化的,只不过量化模型精度不同

各种参数DFL换脸模型/实时换脸模型底丹、实时换脸模型训练教学/实时换脸模型定制、AI软件个性化及功能定制
论坛所有一键包报错请在帖子下方跟帖,看到会回复,不支持一对一解答,请确认再下载!
全站默认解压密码: https://deepface.cc/ 或 https://deepfaces.cc/ (密码就是这个网址,不要点开去找。复制完整网址即可,不要有空格)
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|前沿AI软件资源站

GMT+8, 2026-8-6 08:37 , Processed in 0.048558 second(s), 3 queries , Redis On.

Powered by Discuz! X3.5

©2001-2023 Discuz! Team

快速回复 返回顶部 返回列表