前言
紧接着上一篇文章《使用ComfyUI+MinMax-H3音视频模型生成视频》
我们会发现, 目前MinMax-H3模型一次性能生成最长15秒的视频, 假设要用它来生成几分钟的短剧该如何实现呢?
思考
此时我们可以使用串联生成多个视频的方式, 最后统一合并, 但是这里存在一个问题, 那就是画面的连贯性, 强制合并的话画面硬切会影响观感, 所以我们需要锁定起始帧, 也就是前一段的最后一个帧画面作为后一段视频的参考画面, 这样整体看起来更加自然流畅
那么我们来实战一下
工作流
草图:
1 | ┌─── ① 加载区 ──────────────────────┐ |
由于多段的视频生成耗时较长, 为了加快推理速度, 我这里使用了Lora加速模型:

同时给ComfyUI启动参数开启了--use-sage-attention, 目的也是为了加速生成

具体工作流json代码如下, 代码有点长, 文末还有更多详细内容和效果展示:
1 | { |
复制上面代码粘贴到ComfyUI中即可使用, 或者前往网盘下载工作流文件合集: 点击进入下载(访问密码: 312306)
工作流概览图:

三大基础模型+Lora加速模型:

使用minmax-h3生成5帧图片,并截取其中一帧当做视频起始参考图, 当然你也可以使用SD文生图, 这里为了确保统一性, 直接复用h3模型:

接下来每一段视频都是一样的流程, 15秒, 只有提示词不同:

最后对五段的音频和视频分别进行拼接合成:

提示词
为了方便测试, 我直接让AI给我生成视频提示词
背景是非主流时代, 1 分钟短片,分5 段续帧,角色锁定红发杀马特少年/铆钉皮衣/蓝紫霓虹调。
首帧参考图(角色设定图)生成提示词
用于
MiniMaxH3ImageToVideo的first_frame输入,或先用文生图节点出 PNG 再 LoadImage。
1 | integrated_multimodal_description: |
第一段 网吧开场(0-15s)
1 | integrated_multimodal_description: |
第二段 大头贴初见(15-30s)
1 | integrated_multimodal_description: |
第三段 经济危机(30-45s)
1 | integrated_multimodal_description: |
第四段 天台告白(45-60s)
1 | integrated_multimodal_description: |
第五段 空镜收尾(60-75s)
1 | integrated_multimodal_description: |
效果展示
由于视频都是一次性生成, 存在瑕疵属于正常现象, 实际的商业短剧, 都是要对每段进行多次抽卡选取, 然后再进行后期剪辑合成
不管怎么说, 视频整体质感还是不错的, 真实感和微表情都比较到位, 至于剧情连贯性, 好好打磨提示词和设计分镜都能解决
完整版:
问题
细心的同学不难发现, 这种首尾帧相连的方式生成的视频, 存在一个严重问题, 那就是人物角色五官存在漂移的情况, 因为每次视频生成都会出现轻微失真偏移,
假设某一段视频的最后一帧画面没有人物, 只有场景, 那么下一段视频生成的人物长相只能参考提示词, 那这种情况下必然会出现换脸的现象
想要解决这个问题, 那就得换模型, 将文生视频模型换成图生视频模型,也就是将minimax_h3_fl2va_pruned_int8_convrot.safetensors换成minimax_h3_ref2va_pruned_int8_convrot.safetensors, 这两个都是MinMax-H3下的子模型
这样一来, 每段视频都有了统一的人物/场景参考图, 就不容易出现明显的人物或场景偏移
文章同步更新至公众号【乱码三千】,欢迎关注~
本文为作者原创 转载时请注明出处 谢谢
