使用ComfyUI+MinMax-H3音视频模型生成视频

前言

之前我们介绍过使用ComfyUI+SD1.5文生图模型+AnimateDiff节点生成视频的方案, 只能生成几秒, 本质上属于动图的范畴, 而且只有纯画面没有声音, 有兴趣可参见文章《ComfyUI实现根据文字生成跳舞视频

现在很多文生视频模型已经问世了, 比如Seedance2.5模型、MinMax-H3模型、Wan2.2模型、LTX-2模型、HuanYanVideo模型等等, 尤其是最近刚出的Seedance2.5模型, 效果很不错, 人物的表情和动作比上一代更加自然

不过Seedance2.5属于付费模型, 调用成本属实有点高, 作为平民用户,还是老老实实使用 ComfyUI+免费模型的方案,让子弹飞一会儿,用不了多久,免费模型也能实现好的效果

以下是开源视频模型对比表格参考:

模型 厂商 原生音频 对口型 画质定位 开源协议 商用/地域限制 最佳场景
MiniMax H3 MiniMax ✅ 音画同出 ✅ Ref2VA 参考音频驱动 写实中上,文字/Logo 准 MiniMax H3 社区许可(非 Apache) 年收>2000 万美元需书面授权;美/欧/英/韩排除在本地权重许可外;界面须标”MiniMax H3” 带声成片/MV/对口型/广告
Wan 2.2 阿里 ❌ 纯视觉 ⚠️ S2V 单人准,快歌会飘 纯视觉天花板 Apache-2.0 无营收/地域门槛,最干净 无声电影感、物理仿真、控动作
LTX-2 Lightricks ✅ 音画同出(19B) ⚠️ 同步有,对口型弱于 H3/S2V 中(快但偏平滑) LTX-2 社区许可(非 Apache) 年收入>1000万美元需商业授权 抽卡草稿、快速预览
HunyuanVideo 1.5 腾讯 ❌ 纯视觉 ❌ 不支持 高(1080p 纹理细) 腾讯混元社区许可(非 Apache,EU/UK/韩排除) 月活>1 亿需授权 高性价比 1080p 空镜、超分底片

目前所有开源的音视频模型中, 音画效果最好的当属MinMax-H3了, 矮个子里面挑高个子😂, 所以今天我们就来聊聊如何使用该模型在ComfyUI平台上进行有声视频的生成

模型和节点清单

模型:

通用三大类模型 = 扩散模型 + 条件编码模型 + VAE 模型 , 所有SD工作流都离不开该框架

角色 模型 作用 放置目录
扩散模型 minimax_h3_fl2va_pruned_int8_convrot.safetensors (~19.5G) 扩散主干(DiT)——在潜空间联合去噪,同时生成视频帧与音频;FL2VA 版支持文字/首帧/尾帧生视频 models/diffusion_models/
条件编码模型 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors (~14.6G) 文本编码器——把提示词(含分镜、运镜、音乐描述)翻译成模型能理解的 conditioning models/text_encoders/
VAE模型) minimax_h3_video_vae_fp16.safetensors (4.9G)
minimax_h3_audio_vae_fp32.safetensors (
0.6G)
视频 VAE 解码器——把采样出的视频潜变量还原成 RGB 帧序列
音频 VAE 解码器——把音频潜变量还原成 32kHz 立体声(跳舞配乐、脚步声)
(两个文件由一个 VAE Loader 加载)
models/vae/
可选 · 加速模型 minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 负责对现有模型能力进行补充扩展 · Turbo LoRA——8 步加速预览,画质略降 models/loras/

以前SD1.5模型内置条件编码模型和VAE模型, 一个模型顶三个用, 而如今的视频模型由于体积太大, 都是独立存在

节点

通用四大类节点=加载器+条件构建+采样+解码, 同样也是所有SD工作流通用

环节 作用 包含的具体节点(以H3为例)
1. 加载器(Loader) 把模型权重从硬盘读进显存 模型加载器、文本编码器加载器、双VAE加载器
2. 条件构建(Conditioning) 把提示词、参考图、尺寸变成模型能读的数值向量 文本编码 + 条件注入 + 分辨率选择器
3. 采样(Sampling) 在潜空间里一步步去噪,生成最终特征张量 KSampler(采样器)
4. 解码(Decode) 把潜空间数值还原成人能看的图片/视频/音频 VAE 解码 + 音视频合并输出

哪怕以后出现更复杂的模型(比如多模态联合生成),这四步也会像「地基」一样垫底。区别只在于每一步内部塞多少东西——H3 因为要同时出视频和音频,所以它的 Loader 多了个音频 VAE,采样时多了音频 shift 参数而已。


工作流

工作流核心链路是4 个加载器 → 条件构建 → 采样 → AV 解码→视频保存

① 加载区(3 个 Loader = 三大件)

节点 加载的模型 输出口
UNET Loade minimax_h3_fl2va_pruned_int8_convrot.safetensors MODEL
CLIP Loader qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors CLIP
VAE Loader minimax_h3_video_vae_fp16.safetensors (4.9G)
minimax_h3_audio_vae_fp32.safetensors (
0.6G)
(视频 VAE + 音频 VAE,两个文件)
VAE

image-20260901131710797

② 条件与参数区

节点 作用 输入来源
MiniMaxH3ImageToVideoT2V/I2V 官方封装节点 内置三段式提示词文本框;把 prompt + 三大件 + 分辨率 + 首/尾帧拼成完整 conditioning 与空 AV latent,输出 CONDITIONING + LATENT model、clip、vae(视频)、prompt、width、height、length,可选 first_frame / last_frame

image-20260901165156159

③ 采样区

节点 作用 关键参数
KSampler 联合视频/音频双 sigma 采样去噪 seed=12345, steps=20, cfg=1.0, sampler=res_multistep, scheduler=simple

iShot_2026-09-02_10.08.35

④ 解码 + 保存区

节点 作用 输入
VAEDecode(画面)+ VAEDecodeAudio(声音) 分两路解码 → IMAGE 帧 + AUDIO 波形 samples + 视频 VAE / 音频 VAE
VHS_VideoCombine(VHS 插件) 合成 24fps MP4 并保存 video(IMAGE)+ 可选 audio(AUDIO)

image-20260901170301026

连线关系(一图流)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
┌─── ① 加载区(三大件)──────────────┐
│ UNETLoader │
│ CLIPLoader │
│ VAELoader (video) │
│ VAELoader (audio) │
└────────────────────────────────────┘
↓ MODEL
┌─── ② 条件构建 ────────────────────┐
│ MiniMaxH3ImageToVideo │
│ (prompt, width/height/length) │
└────────────────────────────────────┘
↓ CONDITIONING / LATENT
┌─── ③ 采样 ────────────────────────┐
│ KSampler (20步, cfg=1.0) │
└────────────────────────────────────┘
↓ SAMPLES
┌─── ④ 解码 + 保存 ─────────────────┐
│ VAEDecode ─→ VHS_VideoCombine │
│ VAEDecodeAudio ─→ (混入音频) │
└────────────────────────────────────┘

image-20260901170520441

关键采样参数(针对跳舞场景)

参数 说明
cfg (guidance) 1.0 ⚠️ H3 已做 guidance distillation,千万别设 7.5,否则边缘硬化、动作崩坏
steps 20(质量)/ 4-8(Turbo LoRA 加速) 默认 20
sampler / scheduler res_multistep / simple 求快可用 euler / simple
帧数 17n+5 网格对齐,5秒≈124帧 Resolution Selector 自动吸附
分辨率 测试 0.4MP(832×480);成品 1344×768 (16:9) 本地最高 768p 短边;别用 1.0MP(会超 768×1344 像素面积上限)
FPS 24 固定

具体工作流json代码如下:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
{
"1": {
"inputs": {
"unet_name": "minimax_h3_fl2va_pruned_int8_convrot.safetensors",
"weight_dtype": "default"
},
"class_type": "UNETLoader",
"_meta": {
"title": "UNet加载器"
}
},
"2": {
"inputs": {
"clip_name": "qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors",
"type": "minimax",
"device": "default"
},
"class_type": "CLIPLoader",
"_meta": {
"title": "加载CLIP"
}
},
"3": {
"inputs": {
"vae_name": "minimax_h3_video_vae_fp16.safetensors"
},
"class_type": "VAELoader",
"_meta": {
"title": "加载VAE"
}
},
"4": {
"inputs": {
"vae_name": "minimax_h3_audio_vae_fp32.safetensors"
},
"class_type": "VAELoader",
"_meta": {
"title": "加载VAE"
}
},
"7": {
"inputs": {
"prompt": "integrated_multimodal_description: cinematic realism, soft natural light, a young woman in a red velvet long dress, dancing alone in a minimalist white studio. medium-full shot, fixed camera with slight push-in. [Shot 1] 0-2s: facing camera, arms rising slowly to shoulder height, weight shifting right to left, elegant. [Shot 2] 2-4s: a fluid 360-degree pirouette, dress spreading outward, hair flowing, stable landing. [Shot 3] 4-5s: return to start, arms descending from overhead, smile to camera, freeze frame. continuous motion, clear rhythm, no limb deformation, consistent identity costume lighting. overall_soundscape: bare feet soft steps on floor, dress rustling air, synced to spin. non_diegetic_music: lyrical piano ~96BPM, bright melody, clear bass on beat 1, aligned to dance, fade out at end.",
"width": 1344,
"height": 768,
"length": 124,
"clip": [
"2",
0
],
"vae": [
"3",
0
]
},
"class_type": "MiniMaxH3ImageToVideo",
"_meta": {
"title": "MiniMax H3 Image to Video"
}
},
"8": {
"inputs": {
"seed": 180855514009551,
"steps": 20,
"cfg": 1,
"sampler_name": "res_multistep",
"scheduler": "simple",
"denoise": 1,
"model": [
"1",
0
],
"positive": [
"7",
0
],
"negative": [
"7",
0
],
"latent_image": [
"7",
1
]
},
"class_type": "KSampler",
"_meta": {
"title": "K采样器"
}
},
"9": {
"inputs": {
"samples": [
"8",
0
],
"vae": [
"3",
0
]
},
"class_type": "VAEDecode",
"_meta": {
"title": "VAE解码"
}
},
"10": {
"inputs": {
"samples": [
"8",
0
],
"vae": [
"4",
0
]
},
"class_type": "VAEDecodeAudio",
"_meta": {
"title": "VAE解码(音频)"
}
},
"11": {
"inputs": {
"frame_rate": 24,
"loop_count": 0,
"filename_prefix": "MiniMax_H3/dancing",
"format": "video/h264-mp4",
"pix_fmt": "yuv420p",
"crf": 20,
"save_metadata": true,
"trim_to_audio": false,
"pingpong": false,
"save_output": true,
"images": [
"9",
0
],
"audio": [
"10",
0
]
},
"class_type": "VHS_VideoCombine",
"_meta": {
"title": "Video Combine 🎥🅥🅗🅢"
}
}
}

复制上面的代码, 点击ComfyUI画布粘贴即可使用

提示词

采用 H3 官方三段式结构:integrated_multimodal_description / overall_soundscape / non_diegetic_music

跳舞必须写清「分镜 + 动作节拍 + 配乐」,否则只会原地抖动

提示词如下:

1
2
3
4
5
6
7
8
9
10
integrated_multimodal_description: 写实电影感, 柔和自然光, 一位身穿红色丝绒长裙的年轻女性,
在极简白色舞蹈工作室中央独舞. 中全景, 固定机位轻微推近.
[Shot 1] 0-2秒: 面朝镜头, 双臂由体侧缓缓抬至肩高, 重心由右脚移至左脚, 舒展优雅.
[Shot 2] 2-4秒: 以腰部为轴做一个流畅的360度平转 pirouette, 裙摆随旋转向外展开, 长发轻扬, 落地稳定收束.
[Shot 3] 4-5秒: 回到起始姿态, 双臂由头顶缓缓落下, 面向镜头微笑, 定格结束.
动作连贯, 节奏明确, 肢体无变形, 身份服装光线保持一致.

overall_soundscape: 赤脚踩地板轻微脚步声, 裙摆与空气摩擦细响, 随旋转同步.

non_diegetic_music: 中速约96BPM抒情钢琴曲, 旋律明亮, 每小节第一拍清晰低音, 与舞蹈节拍对齐, 结尾渐弱收束.

如果想要指定人物长相(脸保持一致), 需要把扩散模型由minimax_h3_fl2va_pruned_int8_convrot.safetensors替换成minimax_h3_ref2va_pruned_int8_convrot.safetensors ,并指定参考图

云端生成

视频模型对显卡算力要求比较高, 至少24G显存, 普通电脑完全没法玩, 建议大家使用云端ComfyUI, 比如阿里无影灵构工作站, 每天签到就能领算力, 相当于免费

image-20260831222721359

直接使用现成的镜像包即可:

image-20260901151419011

目前新用户可直接一次性领取200灵豆算力, 可以试试:

image-20260901151551902

image-20260901152118409

如果模型缺失, 还可以上传自定义模型:

image-20260901151945802

通过官方的无影云盘实现本地电脑和云端数据交互:

image-20260901154052026

image-20260901154147217

官网: 点击进入

使用第三方AI平台

目前比较知名的AI视频创作平台有:

  • Tapnow:深圳添科智能 旗下的 AI 原生商业视觉创作引擎
  • Libtv:LiblibAI(哩布哩布 AI)出品的 AI 视频创作平台,无限画布 + Skill 接口,内部集成了市面主流的数十种视频模型
  • Running Hub:基于 ComfyUI架构的 AI 创作平台,兼容ComfyUI JSON、预装 7000-9000+ 节点,其实就是云端 ComfyUI
  • 即梦AI:字节的闭源消费级 AI 视频/图像产品
  • Updream :B 站出品的面向 UP 主的AI 视频创作平台
  • Seko: 商汤科技出品的 AI 创编一体短剧/短视频创作 Agent,无限画布 + 创作 Agent + Skill 生态,主打短剧/漫剧/音乐 MV/出海多集连续生产

我们需要明白的是, 视频生成的效果和使用的视频模型有关,和你使用什么平台没有太大关系,这就好比同样是聊天工具,扣扣、微信、抖音,你说哪个聊天更强?它们从技术上其实没有本质区别,全看你个人需求,这些 AI 平台也是同样的道理,选一个自己用的顺手且个人认为性价比高的用就行。

平台的目的只是为了降低大众用户的使用门槛,用户不需要了解具体的底层原理,也无需花时间精力自己搭建调试部署软件下载模型等,只要提供相应的需求以及镜头语言提示词即可进行创作

如果你是程序员或者懂底层原理,强烈建议使用 ComfyUI 自己手搓,更加灵活可控,足以应对未来 AI 变化

如果你只是想快速体验一把文生视频的快感, 那么直接上豆包, 方便快捷, 每天有免费的视频生成额度, 一个账号不够, 那就多开几个账号玩😂, 可以用它练练提示词

效果展示

由于我们在工作流中设置的视频生成总帧数是124, 而帧率是24, 所以总共生成5秒的视频, 如果你想生成15秒, 需要在MiniMaxH3ImageToVideo节点中将总帧数改为362, 并将提示词补充够15秒镜头

image-20260901173829756

15秒的跳舞视频如下:

上方15秒视频提示词参考:

1
2
3
4
5
integrated_multimodal_description: 真人电影感, 高对比霓虹夜店美学, 暗调环境光配电光蓝/品红/青绿扫光. [Shot 1] 0-2秒: 低角度广角仰拍, 一位身穿黑色反光夹克的女性DJ在升高DJ台后推推子, 手指在CDJ转盘上快速刮碟, 头戴LED环形耳机, 霓虹管字 "NEON" 在身后脉动. 镜头以中幅快速横移(Truck Right)扫过DJ台, 频闪灯每拍切一次颜色. [Shot 2] 2-4秒: 硬切到舞池全景, 几十名年轻人在135BPM节拍下齐跳, 双手举过头顶交叉摆动, 身体左右晃肩, 有人原地蹦跳, 有人做wave. 相机手持跟拍(Tracking Shot)穿入人群, 小幅快速推进, 激光束从头顶扫过雾机, 镜头边缘有意象光晕与色散. [Shot 3] 4-5秒: 切到人群中景, 一位穿银色吊带短裙的舞者正对镜头甩头顿足, 霓虹在她脸上交替投下蓝/粉光斑, 背景虚化的人海继续跳动. 镜头在最后一拍做轻微慢动作(Roll Counterclockwise小幅)后切回实时, 定格在众人跃起瞬间. 全程人物服装/发型/光线一致, 肢体无变形, 动作与135BPM鼓点严格对齐.

overall_soundscape: 厚底靴踩地闷响, 液体在玻璃杯里晃动, 雾机喷气嘶声, 人群合唱式喊拍"嘿!嘿!", 近距离衣物摩擦与呼吸声, 音箱低频在胸腔共振的体感轰鸣.

non_diegetic_music: 135BPM 商业DJ舞曲, 四四拍底鼓每拍清晰, 副歌前_buildup_用滚奏hi-hat与上升synth riser, drop段重低音bassline+失真lead+紧凑clap, 间奏切到filter sweep与crowd vocal chop, 整体动态从intro克制到drop全频炸开, 结尾留2拍echo尾音.

本文为作者原创 转载时请注明出处 谢谢

ACG作坊– 分享动漫制作的博客站

0%