前言
之前写了一篇小说, 严格来讲, 是借助AI写的一篇玄幻小说, 打算借AI来将其视觉化
如今AI视频的发展为玄幻和科幻领域增添了很强的助力, 现在这个时代, 不怕你想的离谱, 就怕你不敢想, 脑洞越大, 收益越高.
比如, 人类真的是猿类进化而来的吗? 有没有一种可能是硅基生命的退化体? 或者是恐龙? 恐龙其实没有灭绝, 人就是恐龙的基因复制体, 人类的祖籍在川渝之类的, 大胆延伸啊, 这不剧本就来了, 嘿嘿
AI是个好东西, 它让精神分裂患者也有了生存的空间, 可谓是人类的福音啊😂
好了, 回归正题.
本篇算是ComfyUI+MinMax-H3的进阶篇, 不同于基础篇的如何使用ComfyUI+MinMax-H3, 本文主要侧重于分镜和提示词的设计
关于基础篇的内容, 可以翻阅之前的文章:
剧本
以下是我用AI写的套路修仙前两章内容
1 | 《炼化失败率九成九》 |
分镜设计
把上面的内容发给大模型AI, 比如豆包或者元宝之类的, 让它基于MinMax-H5模型按照15秒一段设计分镜语言, 一般来说, 每段的镜头数量最多不要超过三个, 不然节奏过渡会很不自然.
因为视频模型的时间感知是通常是每5秒一个语义单元, 秉着宁可少,不可多的原则, 确保画面平稳过渡, 同时让人物的情绪有足够长的酝酿空间
比如被分手后的痛哭画面, 从错愕到不舍到心酸再到嚎啕大哭, 层层递进的情绪爆发, 如果只给她几秒钟的时间发挥, 给观众的感觉就跟开玩笑没啥区别
分镜数量适用参考表格:
| 分镜数 | 适用场景 | 说明 |
|---|---|---|
| 1个 | 长对话、情绪特写、缓慢空镜 | 一个镜头盯住人物,对话慢慢说 |
| 2个 | 对话+动作切换、场景过渡 | 前半段对话,后半段动作/转场 |
| 3个 | 标准叙事(起承转合) | 最稳,但不代表必须塞满 |
| 4个以上 | ❌ 不建议 | 每个镜头太短,画面跳变、口型对不上 |
分镜主要包含四大点: 景别+表情+动作+对话
想要人物根据我们的需求实现表演的真实感和鲜活感, 就必须把抽象的感觉转成具体的表情和动作, 比如你不能说: “沈炼很疲惫, 他有些不开心”, 模型看到这句话也有点懵, 怎么个疲惫法? 怎么个不开心法?, 我们需要形象化, 比如:
1 | 沈炼眼皮半垂,眼神涣散,肩膀塌陷,背部微驼,脚步拖沓地走在青石路上,鞋底蹭着地面发出沙沙声。他嘴角下压,眉头微蹙,低头看着地面,双手无力垂下,手指微微蜷缩。走到一棵枯树下,他停下脚步,长叹一口气,胸口起伏明显,随即踢开脚边一颗石子,石子滚落路边。 |
要用具体的动作和表情去传达情绪, 而不是对着镜头说一句我很难过就完事了, 观众怎么可能共鸣
虽然模型现在越来越聪明, 哪怕你只写个抽象的词, 他也能生成非常细腻的表情动作, 但它生成的也许并不是你想要的那种感觉
当然了, 如果你真不确定用什么表情和动作来描述当下的人物状态会更贴切, 那交给模型来自由发挥也许会得到意想不到的效果
我们使用AI, 不是在教AI怎么做事, 而是相互学习, 所以放心大胆去尝试
下面是我让元宝生成的第一章节分镜表格, 总共六段:
第一段:乱葬岗苏醒
| 镜头 | 时间 | 景别 | 内容 | 对话 |
|---|---|---|---|---|
| Shot1 | 0-5s | 全景 | 阴云密布,冷灰色调,微弱天光从云缝漏下。乱葬岗,枯树乌鸦,泥土湿润。沈炼黑发凌乱沾泥,灰褐粗布麻衣破损,从土堆中挣扎爬出,双手撑地,指节发白,泥土从衣摆簌簌落下,眼皮半垂,眼神涣散 | 无 |
| Shot2 | 5-10s | 特写 | 沈炼眉心金色竖痕突然亮起,微光闪烁,他猛地捂住额头,眉头紧蹙,嘴唇微张,呼吸急促,声音沙哑 | “我……没死?” |
| Shot3 | 10-15s | 中景 | 沈炼跪地,双手撑地,大口喘气,胸口剧烈起伏,缓缓抬头环顾坟丘和枯树,瞳孔猛缩,身体微微后仰,手指抠进泥土里 |
情绪线:茫然 → 震惊 → 恐惧
第二段:残魂对话
| 镜头 | 时间 | 景别 | 内容 | 对话 |
|---|---|---|---|---|
| Shot1 | 0-15s | 中景 | 阴云渐散,雾气流动,一缕冷光从云隙斜射而下。沈炼坐在地上,后背靠半截墓碑,衣袍沾泥。一团半透明淡青色残魂悬浮面前,边缘微微波动。沈炼瞪大眼睛,身体后仰,双手撑地,喉结滚动。残魂缓缓飘近,沈炼愣住,嘴唇微张,缓缓低头看向摊开的双手,手指微微颤抖 | 沈炼:”你是谁?是你救了我?” 残魂:”不,是你自己活过来的。” 沈炼:”我自己……活过来的?” |
情绪线:震惊 → 疑惑 → 不安
说明:这段对话信息量大,切镜头会打断情绪,用一个固定中景让对话自然流动,靠表情变化推进。
第三段:确认穿越
| 镜头 | 时间 | 景别 | 内容 | 对话 |
|---|---|---|---|---|
| Shot1 | 0-8s | 近景 | 雾气渐薄,晨光从侧面穿透林间,在沈炼脸上打出明暗分界。沈炼坐在地上,低头看着身上灰褐粗布麻衣,双手扯了扯衣襟,抬手摸脸,手指从额头滑到下巴,指尖微微停顿,嘴角扯出一丝苦涩弧度,声音低哑 | “穿越……我竟然穿越了。” “这身体……不是我的。” |
| Shot2 | 8-15s | 中景 | 沈炼双手撑地站起来,膝盖微微打颤,握紧拳头,指节发白,深吸一口气,缓缓抬头,眼神从涣散逐渐聚焦,目光沉稳,望向远方 | “既然来了,那就活下去。” |
情绪线:苦涩 → 坚定
第四段:远眺青云宗
| 镜头 | 时间 | 景别 | 内容 | 对话 |
|---|---|---|---|---|
| Shot1 | 0-8s | 全景 | 清晨雾气未散,晨光从沈炼背后洒下,在地面拉出长影。沈炼踩过湿润泥土,脚步带起泥点,走出坟丘地带,站在山坡上,晨风拂动衣摆和散落发丝。他眯起眼睛,身体微微前倾,望向远处云雾缭绕的山峰,山顶隐约矗立巍峨宗门,殿宇隐于云雾之间 | “那就是青云宗?” |
| Shot2 | 8-15s | 近景 | 沈炼嘴角微微上扬,眼神沉稳,踩过碎石路面,脚步带起尘土,迈步向宗门方向走去,衣摆擦过齐腰野草,草叶沙沙作响 |
情绪线:期待 → 决意
第五段: 山门登记
| 镜头 | 时间 | 景别 | 内容 | 对话 |
|---|---|---|---|---|
| Shot1 | 0-8s | 中景 | 晨光明亮,从门楼上方斜照而下,在青石台阶上拉出整齐光影。青云宗山门,青石台阶,飞檐翘角门楼,门匾”青云宗”三字,两个灰衣弟子站门侧,目光淡漠。沈炼衣袍整洁,双手递上入门凭证,微微躬身,目光低垂,语气恭敬。中年执事坐桌后,低头翻看名册,指尖划过纸页,头也不抬 | 沈炼:”弟子沈炼,前来拜入宗门。” |
| Shot2 | 8-15s | 近景 | 执事随手在名册上划了一下,笔尖划过纸面发出沙沙声,冷淡开口。沈炼双手微微一顿,指尖轻轻蜷缩,但很快恢复平静,垂下眼帘,声音平稳 |
情绪线:恭敬 → 失落 → 隐忍
第六段: 杂役房独处
| 镜头 | 时间 | 景别 | 内容 | 对话 |
|---|---|---|---|---|
| Shot1 | 0-8s | 全景 | 黄昏暮色,昏黄光线从破旧木窗斜射而入,在地面拉出长长光影,灰尘在光柱中浮动。破旧杂役房,木床、旧桌、墙角蛛网。沈炼推开吱呀作响的木门,门轴发出刺耳摩擦声,迈步走进,踩过凹凸不平的泥土地面,环顾四周,目光扫过破旧床铺和堆满杂物的角落,肩膀微微塌下 | 无 |
| Shot2 | 8-15s | 特写 | 沈炼坐在床边,木床发出轻微吱呀声,低头看着手中杂役令牌,拇指摩挲令牌表面粗糙木纹,嘴角扯出一丝自嘲弧度,声音低沉。他抬起头,眼神从涣散逐渐聚焦,目光沉稳,握紧令牌,指节发白 | “杂役……也行,总比在坟地里强。” “先活下去,再想办法。” |
情绪线:落寞 → 自嘲 → 坚定
画面真实感四要素总结:
| 要素 | 核心要求 | 示例 |
|---|---|---|
| 动作具体化 | 拒绝抽象词,写具体动作 | 不是“疲惫”,是“眼皮半垂,脚步拖沓” |
| 人境交互 | 人物与环境产生物理互动 | 踩碎石带起尘土,拨开齐腰野草 |
| 光线具体化 | 写明光源方向、强度、颜色 | 晨光从背后洒下,拉出长影 |
| 声音空间感 | 声音有远近、有层次、有来源 | 近处脚步声,远处钟声,风声掠过草尖 |
提示词
设计好分镜头后, 我们将其包装成模型可识别的规范提示词
MinMax-H3官方标准的三段式提示词结构如下:
- integrated_multimodal_description:画面、画幅、风格、分镜镜头、人物动作、台词、运镜,全部放这里
- overall_soundscape:场景内原生音效(风声、脚步声、环境音、人物说话),画面里面世界真实存在的声音
- non_diegetic_music:背景音乐,观众专属、场景本身不存在的配乐
注意: 对话内容需要使用<d>标签来包裹, 切头切换使用At 00:05.000(分:秒.毫秒)的格式, 这是MinMax-H3官方标准的写法,
如果你使用的是三方平台, 比如即梦等, 可以使用非标准时间格式, 比如0-5s这种, 兼容性反而会更好, 但是我们使用的是ComfyUI, 所以最好跟着官方来走.
提示词示例:
1 | integrated_multimodal_description: |
首先, 整部短剧的色彩和人物风格要保持一致, 比如电影写实古风,清胶片质感等等, 同一个场景的环境氛围要保持一致, 比如清晨微光,雾气朦胧等, 这些必须在每段提示词中说明, 否则光靠模型自由发挥大概率会出问题.
三大统一原则:
- 全局统一
- 场景统一
- 段与段之间统一
详细表格如下:
| 层级 | 范围 | 涉及对象 | 实现方式 |
|---|---|---|---|
| 全局统一 | 整部剧(第一章到第N章) | 角色 + 画风 | 角色定妆照、和画风需要每段重复锚定 |
| 场景统一 | 多段视频构成的同一个场景 | 场景环境 + 人物状态 | 每段提示词写清场景+人物状态 |
| 段间统一 | 相邻两段之间 | 画面连续性 | 首帧接力(上一段末帧作为下一段起始帧) |
理论上首尾帧接力能保持画风和人物能七成以上的统一, 前提是最后一帧的画面和初始风格不会有太大偏移, 否则, 就会随着段数的增加越偏越大
所以针对角色, 我们需要通过定妆照+状态提示词的方式来锁定形象. 而针对画风和非特殊场景, 通过提示词来锁定即可
为什么要定妆照+状态词, 光提示词可不可以, 我们先来看看角色形象锁定的两种方案对比:
| 方案 | 做法 | 优点 | 缺点 |
|---|---|---|---|
| 方案A:纯文字 | 每段提示词里完整写清外貌+状态 | 不依赖参考图,流程简单 | 每段都要写一大段,容易啰嗦;模型理解有偏差时容易漂移 |
| 方案B:定妆照+状态 | 每段喂同一张定妆照,提示词只写状态变化 | 外貌锁定最稳,文字量少 | 需要额外准备定妆照;REF 模式下状态描述不能省 |
方案A提示词示例:
1 | 沈炼,男,约二十岁,黑发束冠,发丝略显凌乱,青白粗布长袍,袖口有磨损, |
方案B提示词示例:
1 | 沈炼浑身沾满泥土,衣衫破损,黑发凌乱 |
哪种方案好, 一目了然.
总之, 一段提示词中, 画风+场景+人物形象状态必不可少, 同时配合上定妆照参考图以及首尾帧的衔接, 这样基本上就能保证画面的自然流动
1 | 准备定妆照(角色标准形象) |
剩下的就是具体的镜头语言了, 直接把之前AI生成的分镜组装进去就可以了, 当然这些体力活完全可以交给AI来做, 目前我们是在讨论原理
至于最后的音效和背景配乐部分, 如果你没有灵感, 最好交给AI来处理, 因为在你没有明确想法的情况下自己定音效和音乐, 大概率效果不如AI好
下面是我让元宝生成的第一章节视频提示词, 总共六段:
第一段:乱葬岗苏醒
1 | integrated_multimodal_description: |
第二段:残魂对话
1 | integrated_multimodal_description: |
第三段:确认穿越
1 | integrated_multimodal_description: |
第四段:远眺青云宗
1 | integrated_multimodal_description: |
第五段: 山门登记
1 | integrated_multimodal_description: |
第六段: 杂役房独处
1 | integrated_multimodal_description: |
提示词模板
我们在实际的操作中, 分镜和提示词并不是独立开的, 它们两者是一体的, 提示词中就已经包括了镜头语言在里面, 所以我们在和AI对话时, 直接让它按照我们的要求生成提示词就行
如果你不知道怎么说, 可以将以下提示词模板发给豆包或者元宝:
1 | # 角色 |
AI收到你的模板后会让你确定剧本、画风、人物资产内容, 你可以按照下面这种格式回复它:
1 | 1. 剧本正文 |
模板中先生成分镜再生成提示词的目的一方面是为了有问题能及时纠错, 另一方面是兼容不同的AI能力. 有些笨一点的AI, 如果直接一步到位让它生成提示词很容易掌握不好剧情节奏
如果你用的是AI智能体, 那么可以将该模板封装进技能, 或者直接给角色本身赋能, 这样就不用每次发重复的内容了, 能懒一点是一点😂
视频资产
我们需要准备的资产主要分为三大块
- 角色图: 也就是人物定妆照, 确保全局人物长相统一
- 场景图: 出现两次以上的场景需要使用场景参考图锁定, 比如青云宗建筑参考图, 不然每个视频不一样就很奇怪
- 道具图: 一般来说, 道具使用提示词就足够了, 但有一些核心道具, 比如主人公的玉佩, 假设该道具贯穿主线, 频繁出现在镜头前, 那就要使用参考图来锁定它
模型和节点
这次我们使用了:
- 主模型:
minimax_h3_fl2va_pruned_int8_convrot.safetensors图生视频模型以及minimax_h3_ref2va_pruned_int8_convrot.safetensors, 图生视频两个主模型 - 文本条件编码模型:
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors Vae音视频解码模型:minimax_h3_video_vae_fp16.safetensors(~4.9G)和minimax_h3_audio_vae_fp32.safetensorsLora加速模型:minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16
这算是MinMax-H3视频生成必备六件套模型了, 总共接近70G左右
至于节点, 和之前文章《使用ComfyUI+MinMax-H3音视频模型生成一分钟的短剧中使用的是同一套, 唯一不同的是, 文生视频模型使用的是Image to Video节点, 而图生视频则需要换成Reference Video节点, 外加一个参考图上传, 如下:
文生视频工作流概览:

图生视频工作流概览:

首帧模式和参考模式
图生视频工作流涉及参考图/参考音视频的上传, 而文生视频工作流涉及到首帧图的上传, 当然这个节点不是必须的, 你不上传的话就依靠模型自由发挥
关于这两种参考模式的区别, 我们需要深入了解, 方便我们后续的创作
首帧图和参考图/参考视频的区别:
| 首帧图 | 参考图 | |
|---|---|---|
| 是不是视频第 0 帧 | ✅ 是 | ❌ 不是 |
| 作用 | 决定视频从哪里开始 | 决定视频里的东西长什么样 |
| 剧情延续 | 从这一帧直接延续 | 不延续,只作为锚点参考 |
| 类比 | 接力赛的第一棒 | 参赛选手的身份证照片 |
首帧模式和参考模式的对比:
| FL2VA(首帧模式) | RE2VA/REF(参考模式) | |
|---|---|---|
| 核心机制 | 上一段尾帧 = 下一段首帧 | 定妆图 / 参考视频 = 全程特征锚点 |
| 衔接自然度 | ⭐⭐⭐⭐⭐ 像素级连续,最自然 | ⭐⭐⭐ 软衔接,需要提示词缓冲 |
| 人物 / 场景锁定 | ⭐⭐⭐ 一般,多段后可能漂移 | ⭐⭐⭐⭐⭐ 好,定妆图全程约束 |
| 需要准备什么 | 第一段首帧图(或占位图) | 角色定妆图、场景参考图 |
| 提示词要求 | 中等(描述动作方向就行) | 高(必须精确描述每段开头状态) |
| 适合场景 | 动作连续、镜头衔接要求高 | 人物多、场景多、要求角色稳定 |
| 使用的模型和节点 | fl2va模型+Image To Video节点 |
ref2va 模型 + Reference Video |
两者各有优势,想要实现技能衔接像 FL 一样自然又能保证人物锁定像 REF 一样稳, 使用常规模式很难实现 ,但是我们可以采用曲线救国, 比如:
全程使用首帧模式, 确保过渡自然, 场景和人物的锁定通过定妆照中继接力的方式避免漂移
比如视频生成两段之后感觉人物要漂了, 那赶紧截取尾帧图片配合定妆照/场景图以图生图的模式生成符合我们要求的新尾帧图, 在以此作为下一段视频的首帧, 相当于是把人物和场景拉了回来, 这个过程虽然麻烦, 但是能实现我们的需求, 适合尾帧存在明确的人物和场景画面的情况
假如尾帧没有明确的人物和场景, 以黑屏或者其他的方式结束, 那就需要使用参考模式来锁定下一段的角色和场景
如果两段衔接和人物场景锁定都没问题, 偏偏里面一个特殊道具的模样偏差过大, 比如这个道具是你自创的, 模型从来没见过
这个时候你需要自己手工制图并传给模型, 可是此时你用的是首帧模式,
Image to Video节点传不了参考图怎么办, 那这个时候别忘了该节点还有一个last_frame参数入口, 用来锁定尾帧, 我们可以好好利用上它:
不过这种方式对镜头编排要求比较高, 需要好好琢磨一下画面的设计
所以真正我们在实际创作的时候往往是两种模式一块使用, 首帧模式为主, 参考模式为辅, 此为混合模式
两种模式使用场景详细参考表:
| 上一段结尾情况 | 人物状态 | 用什么模式 | 怎么做 |
|---|---|---|---|
| 尾帧有明确人物 + 场景 | 脸还稳,没漂 | 首帧模式 | 直接尾帧接力,啥也不用干 |
| 尾帧有明确人物 + 场景 | 感觉要漂 / 已经糊了 | 首帧模式 + 图生图修复 | 尾帧做底图 + 定妆照做参考,图生图重绘生成新首帧,再接力 |
| 尾帧是黑屏 / 白屏 / 空镜(无明确人物) | 无所谓 | 参考模式 | 用定妆照 + 场景图做参考,生成下一段,黑屏天然掩盖跳变 |
| 尾帧是远景 / 背影(人物特征不明确) | 可能要漂 | 参考模式或图生图高重绘 | 人物特征提取不到,直接用参考模式锁定下一段 |
| 场景大切换(从坟墓跳到山门) | 无所谓 | 图生图生成新首帧 | 定妆照 + 场景描述,图生图生成新场景首帧,再接力 |
核心原则:能首帧接力就首帧接力,要漂了就图生图拉一把,没人物了就切参考模式。
但不管哪种模式, 提示词才是最关键的, 如果你给的首帧图是站着,而提示词是写的是坐着,神仙来了都难救
当提示词和图像输入打架时,模型的表现通常是这三种:
| 冲突情况 | 模型的挣扎 | 结果 |
|---|---|---|
| 首帧是站着,提示词写 “坐着” | 第 0 帧还是站着,第 1 帧强行往下坐 | 开头突兀,像按了快进 |
| 参考图是人物 A,提示词写 “金发碧眼的女人” | 想保持人物 A 的脸,又想变成金发 | 五官崩坏、脸四不像 |
| 首帧是白天室内,提示词写 “夜晚星空下” | 第 0 帧白天,第 1 帧突然天黑 | 闪屏、光影跳变 |
关于种子
在没有参考图锁定的情况下, 当我们使用模型生成的角色和场景不符合预期的时候, 我们会考虑换采样种子(seed), 从而得到不一样的人物形象
因此, 我们也不难明白, 如果想要让每段视频的人物与场景尽可能地保持一致, 那么每段视频的采样种子一定不要换
其实这个道理很简单, 我们只是把一个长视频拆分成了无数个15秒视频而已, 它们本身都归属于同一个视频, 所以种子只能是同一个
假如你因为中途某段视频生成的不满意而换了种子, 而且后面的视频也没调回来, 那么视频人物换脸的概率大大增加
种子它就类似于随机数的起点, 同一个种子下模型则每次都会从同一个随机形状开始生成
所以种子很重要, 很多人会忽视它的重要性
你可以将其看成是角色弱锁定手段, 强锁定的方式那就是参考图
总结
因此角色/场景锁定的方式有以下几点:
- 参考图/参考视频
- 首尾帧的指定
- 提示词锁定: 人物发型、五官、肤色、服饰、年龄等描述全套保持统一,不要不同镜头写不一样的外貌描述
- 种子、步数等采样参数的一致性
- 自己训练角色/场景/画风Lora模型: 专门学习某一个人的五官, 某种美术风格以及特定场景建筑等
- 使用IP‑Adapter 人物 IP 适配器: 和
Ref2VA参考图逻辑类似,专门提取人物身份特征
每种方式权重不一样, 简单归类总结表如下:
| 手段 | 锁定人脸身份 | 锁定场景画风 | 备注 |
|---|---|---|---|
| 参考图 Ref2VA | ✅强 | ✅ | 短剧首选,每段传入 |
| 角色私训 LoRA | ✅强 | ✅ | 搭配参考图效果最优 |
| 首帧继承接力 | ✅连续镜头 | ✅ | 大转场禁用 |
| 参考视频 | ⚠️偏弱 | ✅强 | 擅长锁动作运镜,锁脸一般 |
| 固定 Seed | ✅辅助 | ✅辅助 | 统一画面气质 |
| 提示词约束 | ⚠️软性约束 | ⚠️软性约束 | 所有方案都要配合 |
| IP‑Adapter | ✅强 | ✅ | 额外第三方节点依赖 |
工作流
由于这次的工作流内容比较多, 就不直接贴上来了, 有兴趣的小伙伴可以前往网盘下载:
工作流合集: 点击进入下载(访问密码: 312306)
效果展示
视频生成中, 稍等几天😂
总结
这不, 有了此等妙技, 想看什么剧情自己生成, 岂不快哉!😜
以上就是本篇全部内容, 有兴趣的小伙伴可以去尝试一下玩玩, 说不定能创作出好的作品, 然后上传到红果平台顺带赚取外快.
1 | 收到。请提供以下四项输入内容: |
附加
常见抽象词 → 具体动作 对照表:
| 抽象词 | 具体动作/表情 |
|---|---|
| 疲惫 | 眼皮半垂,脚步拖沓,肩膀下垂,呼吸沉重 |
| 震惊 | 瞳孔猛缩,身体后仰,嘴唇微张,愣住不动 |
| 恐惧 | 呼吸急促,身体发抖,瞳孔放大,后退半步 |
| 愤怒 | 眉头紧锁,咬紧牙关,握紧拳头,青筋暴起 |
| 悲伤 | 眼眶泛红,嘴唇颤抖,低头沉默,肩膀微微抽动 |
| 坚定 | 眼神锐利,下巴微抬,握紧拳头,步伐沉稳 |
| 疑惑 | 眯起眼睛,歪头,眉头微皱,嘴唇抿紧 |
| 恭敬 | 微微躬身,双手递物,目光低垂,语气谦卑 |
| 紧张 | 手指攥紧衣角,喉结滚动,呼吸变浅,眼神游移 |
| 释然 | 长舒一口气,肩膀放松,嘴角微微上扬,眼神柔和 |
相信大家在抖音上经常能看到有动物或者小孩子模仿网红舞蹈,
今天我们用ComfyUI+MinMax-H3来实现这种效果, 家里有宝宝的可以用来给宝宝生成跳舞视频😬
说到宝宝, 又是一段伤心往事😭
本文为作者原创 转载时请注明出处 谢谢
