Minimax H3新版加速优化工作流与长视频制作教程
本文是Minimax H3视频生成工作流的进阶教程,涵盖新版加速优化、视频延长制作及官方Scale实战应用。工作流包含基础版(文生/图生/首尾帧)和参考版(图像/视频/音频参考)两大模块。教程重点讲解了最新优化加速技术(比传统CGT型更快且画质更优)的配置方法、兼容性修复(INT8模型补丁、CLIP显存卸载节点)、Turbo LoRA选型建议。视频延长部分详细解析了22帧截取重复原理、潜空间信息传递机制、音频帧同步技巧及无缝拼接方法。通过“天气预报主持人”完整案例,演示了从首次生成到续写镜头切换(近景→中景→特写)、道具引入的全流程,并总结了六大长视频制作心得。适合已有一定基础的AI视频创作者进阶学习。

一、开篇:工作流整体架构介绍
这节课我们主要学习Minimax H3的新版加速优化工作流,还有长视频的制作。此外,我们也会讲解一些官方提示词Scale的实战应用技巧。
工作流依然是两个。左边是基础的文生、图生、首尾帧视频,右边是图像视频和音频的参考工作流。每个工作流上面都有它的一个开启和关闭,下面是视频延长的开启和关闭。我们可以通过这个箭头快速达到我们的工作流所在地。
工作流左边的绿色部分都是用户的输入部分,包括提示词和参数的输入,包括这边模型和Loader的加载,包括下面图像的输入。上面是优化加速相关的,我们使用的最新的这个加速技术,它的效果比之前的CGT型还要出色。中间是核心的视频生成区域,右边是视频的一个快速预览。在下面是视频的延长板块。
了解完整体后,我们开始具体的使用。
二、模型选择与优化加速配置
兼容默认模型和GGUF模型。如果说你的显存在16G以上,最推荐使用这个模型。如果说你的显存比较小,那推荐使用GGUF的模型。CLIP也是一样的。这里CLIP需要重点说明一下,在官方的CLIP里面,它有三个模型,它们的大小不一样,对显存的负担也不一样。但是只要你的显卡支持,就优先使用大的模型,因为模型越大,它对提示词的理解、推理能力就越好,我们的最终效果就会好很多。
至于大模型所带来的显存压力,我这里加了一个CLIP显存的卸载节点。通过这个节点以后,它会完全卸载掉CLIP所带来的这个显存压力,它不会影响后面的生成。因此,这个模型你能使用多大就使用多大。
然后是Turbo加速LoRA。最近LTX-V发布了他们的一个新加速LoRA,来到了一点零版。但是我查了一下社区资料,这个LoRA有一些明显的问题,比如说脸部发糊、塑料感、细节也不好。综合来看,还是官方之前推荐的这个LoRA,它的效果是最好的。因此我们工作流依然采用是这个LoRA,权重为一。
然后是优化加速这块儿,ComfyUI给H3出了一个更好的加速技术。把你的ComfyUI更新到最新版本,你可以通过管理器更新ComfyUI,更新以后就可以加载这个节点,选择这个优化加速技术。这个加速是和Scheduled Running相冲突的,我们就要把之前Scheduled Running相关的给删掉。这个加速它和这个加速节点是非常适配的。有的人使用这个节点会报错,那你们可以把这个值改为4,把这个改为force,这样可以修复有些报错。但我这边没问题,还是保持默认。
这个新加速社区实测是要比传统的CGT型要快不少的。这个帖子下面也有很多人跟着做一些测评,结论大致是:使用这个新加速需要将近两分钟,而传统的CGT型则需要两分十一秒,并且画质也是超过传统加速的。总体来讲,尽管这个新功能它的速度会更快、视频质量更好,但是它仍然是实验性的,它可能会崩溃。所以说,只要我们的电脑允许,强烈推荐使用这个新版的加速效果。
三、修复兼容性问题与补丁方法
它目前情况下对这个INT8的模型支持并不好,可能会报错。官方也讲解了这样一个修复方法,但是可惜目前还没有合并到最新的ComfyUI里面,可能下个版本会合并。如果说你们的版本依然没有合并的话,那我们可以手动的来打这个补丁。我们需要找到ComfyUI的这个文件,我这里以云端来做演示。
进入文件管理,找到这个root进入,然后我们就进入了ComfyUI文件夹。根据这个目录,我们来找一下,然后找到这个文件。建议复制一下这个文件,命名为备份,以防万一。然后我们双击进入这个文件,在大约五百八十八行的地方,找到这一串的这个数据。这里的话,就这个单词。我们在这后面再加上这一串数据。前面这个中文只是为了注释,它没有什么意义,可以不管。我们只加这一段在中间就可以了。加上以后,点击右上角的“储存”,然后再退出,然后再重启ComfyUI就可以了。
如果说这个加速始终安装不上的话,那可以把这整块的优化加速替换为之前的工作流的CGT型加速。然后这边是一个可选加速,它有加速效果,但它的质量损失要相对大一点。我这里是开启的。然后这边是一个低显存,建议开启的一个预防OOM的两个节点。实测,它除了可以预防OOM以外,也可以帮助我们使用更大的一个分辨率。目前我的云端是4090,我依然把这两个开启,来帮助我生成一个更大分辨率的视频。
四、提示词工具:官方Scale实战应用
既然是文生视频,那这一块的图像加载就可以关闭。然后核心在于我们的提示词这一块。不得不感谢这次H3的开源,真的是非常彻底。官方也发布了非常专业的这个Scale。这些本质上是一些技能包,最核心的是这一个,H3的一个提示词的一个工具,我们可以点开看一下。它包含两个技能,第一个对应的是基础工作流,第二个对应的是这个参考工作流。有了这两个工具以后,我们提示词生成开始变得简单。
除了这个核心的基础生成以外,它还包含了一些风格化的一些提示词生成,MV的、游戏的、科幻风格的等等。这些风格化效果,我目前测试,它们只能通过AI来来进行生成,目前还在研究当中。我们暂时跳过。我们还是讲解一下这个比较核心的这个工具的使用。
这个工具是可以直接使用语言模型就可以使用。我们这次是一个文生视频的案例,那么我们就使用这个基础指令。这里我以自己最常用的谷歌Gemini为例,这个网站它的智能,我觉得目前是优于豆包的。而且它的文字表达能力也是非常出色,它的逻辑推理能力错误率要高于GPT和Grok。但总体来讲,这个网站是非常不错的。
首先上传这个基础指令,这个文件内容和这边的内容是完全一样的。然后输入:“请用这个基础指令帮我生成提示词。”然后发送。这个英文我看不太懂,我再让他给我一下中文的翻译,检查一下是否需要修改。那我们使用提示词的时候,尽量使用英文版,因为官方文件说得很清楚:“它在英文表现下是最佳的。”确认无误以后,我们复制提示词,回到ComfyUI,输入。

五、视频生成基础操作
这里时长设为15秒。如果说你的显存比较差,可能15秒是带不动的,那你可以设置为10秒。然后分辨率这一块,我这里设的是这一个。如果显存较差,就把这个分辨率给降低。确认好以后,点击运行。这里在生成前就能看到预览效果。这里VAE使用的是这个VAE,它会比较清晰。这个效果比较满意,那就让它继续生成。
那我们这个15秒的视频生成完毕。
六、视频延长核心原理
那接着第二步,我需要延长这个视频。那这里我们要使用到模型Context这个节点。回到ComfyUI,我们打开这个视频延长部分。它的核心是使用这个节点来帮助我们延长视频。它功能的本质是,我们生成的第一段视频,它会截取这段视频的最后一段,包括图像,包括音频,然后以这一段信息为基础,接着去生成下一段的视频。那对于我们视频二来说,它是一个连续的;而对于视频一来说,这两段同样是一个连续的。最终我们把视频二的这个给砍掉,把这个往上提。最终是变成这样一个效果。那这三段一、二、三,它的画面和音频都是连续的。
在我们第一次生成的时候,这里加了一个储存潜空间信息节点。这里的序号,我们第一次生成最好是1。但这序号其实问题不大,它会储存我们刚才这段视频所生成的整个内存信息。这里名字为2,那我们就储存为2吧。这个信息它的储存位置是在ComfyUI/output下面,有这样一个文件夹。这个2就是我们刚才所储存的,通过这个节点来加载我们这里所储存的信息。那这里储存是2,那这里的话也应该是2。然后这个节点再连接到我们的主工作流里面,来进行再次生成。
七、视频延长关键参数设置
它下面有两个重要的参数:视频的长度和音频的长度。就是当我们加载这整段信息的时候,我们并不是整个使用,而是截取这一小段来进行使用。其中截取的是22帧的一个画面,24帧的一个音频。这个视频长度22帧是最推荐的数值。这个数值太小、太高都不是特别好。同样,音频24帧是一个推荐的数值,数值比这个视频数值要大一点,因为这两个是完全独立的。音频的损失是比画面的损失要大一些的,因此这个帧数多一点也挺好的。
目前工作流的设置都是用的官方的推荐参数来做,这是对于新手最为推荐的,也是最为保险的。当我们加载了这个Latent以后,那我们上面这个图像和音频接口就不要再接了。但是如果说你之前没有储存这个Latent,那你就可以加载一个视频,再把视频的图像和音频做对应的连接,也可以达到一个不错的效果。
那之后第二段视频生成好以后,我们再通过这个节点和这边的板块,再合并这两个视频。那这个地方就要加载刚才所生成的视频,把这个保存一下。这是我们第一段所生成的视频。这个节点它会裁剪掉我们第二段所生成的视频,因为新的视频会重复前一个视频的22帧,所以需要通过这个节点来裁掉这个帧数。裁剪好以后,再和第一段视频进行一个拼接,就是一个完整视频了。
八、操作流程与无限续写
你们在操作这个工作流的时候,你们只需要操作这个绿色部分,把这个设置对应的值,然后这边再加载对应的值,然后这边再输入新的条件信息,再重新传到我们工作流里面,仅重新生成。新生成的视频会再次保存。那这个的话也会储存新的一个空间信息。需要把这个再加一个数值为3。它是运行以后,这个3才会被保存。有了这个3以后,我们还可以继续往后面进行生成。那再把这改为3,我们又可以生成15秒了。这样就可以生成一个非常长的视频。
那像我们这个案例,我们这个提示词本身就是可以无限续写的,这个比较简单,感觉可以无限续写的提示词,我们就可以不用管。那我们第一个案例就先不动这个最难的板块,我们就先保持默认不变,然后再点击运行。那么看,这次我们就成功的把这两段给拼上了,看起来也是非常的连贯。
九、常见问题与解决方案
如果说你们在运行的时候报错,可能是一些兼容性问题。视频延续的分辨率一定要和之前的加载一致,它和之前的加速节点有冲突。第三点,它和一个合并节点也有严重冲突,必须卸载。不过这个工作流里面这二三点都不存在,所以不用管。主要是第一点,分辨率一定要一致。
官方的这个节点有清楚说明,每一段的连接都会导致质量下降,主要是音频的一个下降。另外,它有概率产生一个小的音频偏移,大概延迟8毫秒。如果说你们发现你们生成视频有明显的卡顿和拼接感的话,那建议您把原视频的第一段视频和第二段视频都保存,就不通过这个节点来进行拼接了。你们自己在剪辑里面自己手动的来进行拼接。剪辑里面就不是剪去这个22帧的,因为它存在着误差。你们需要在22帧基础上左右移动一下,看哪一帧对接会更好来解决这个问题。
另外一个可能遇到的问题是,这个节点同样会降低音频质量,就是这个优化加速节点。如果说因为它出现一些误差问题的话,那你们可以把这个加速节点给删掉。
视频延长的操作是非常简单,我们只需要简单的处理这三个绿色的部分就可以了。但实际上,它的难点是集中在这个提示词部分的。

十、进阶案例:天气预报视频制作
那接下来,我们使用这边的参考案例来进阶讲解一下这个视频延长的使用。那这次的案例,我们想做让这个女孩来播放天气预报。那这次使用的是参考工作流。那这里我们就上传官方的参考指令和这个女孩的形象图,可以是四视图,也可以是一张单人的肖像图。
提示词要求:“一个亚洲美女主持人正在直播天气预报,她用的是中文说话。我要求的是镜头慢慢拉远,从一开始的近景慢慢变为中景。”然后她给了我英文和中文的提示词。
那如果说你熟悉官方的这个提示词指令的话,你会发现提示词是有格式的问题的。官方在图像引用的时候清楚说明:如果说图像仅是定义角色的话,是不需要单独创建条目的。但是它这里的话还是创建了一个图像的条目。这句话应该是要删除的。另外,官方的示例里面,它都是完整的引用。其实这可能会给语言模型一些误导,他认为所有的图像都是完整引用。但实际上,官方说明除了完整引用以外,也可以部分引用,还有其他的两种引用形式。
那这里的话,他就错误的把这个角色完整引用了。他这里是担任天气主持人,不能穿这样的一个休闲服去做主持人的。实际上,这个案例它是部分引用,除了这个相貌和发型以外,他的衣着是要改变的。于是我告诉他:“他有两处错误:第一个是图片不需要再描述;第二个,这个角色是部分引用,衣服应该改变。其他的话,就台词他太少了,台词增加一点,差不多13秒说完。”
除此之外,有的时候他的一个语言引用也会出现格式错误。这一次他是正确的。但是,你们有的时候在生成这个语言的时候,可能会出现格式问题,你们也要去纠正它。出现这个问题真的并不奇怪,你们只需要记住这三个常见的错误点,那基本上就没什么问题了。
那接下来它是修改后的一个提示词,就拷贝一下,拷贝过来。最下面两项是音效和音乐,音效可以保留,音乐的话,我建议后期合成会更自由一些,改为这个无,没有背景音乐。分辨率是16比9的608P,时长15秒,种子为1。我们第一次生成是不需要视频延长的,我们加载这个参考图,也不需要视频和音频的参考。那第一次保存还是建议为1,这样不容易混乱一点。那全部设置完毕以后,我们再点击运行。
“大家好,欢迎收看今天的天气预报。受冷空气影响,预计明后两天,我国北方部分地区将迎来明显的降温和局地降雨,而南方大部地区依然维持晴热天气。请大家注意适时增减衣物,出门带好雨具。”
那第一段视频出来了,与预期一样,是一个由近景到中景的一个拉镜头。
十一、进阶续写:镜头切换与道具引入
那接着我的续写要比这些要难一点。新镜头,我希望突然切换到特写,然后再让这个女孩拿着道具再说一段话。那接着的话,我们就开启视频延长部分,然后设置一下绿色部分的参数,这个设置为第二段。我们加载刚才的第一段,然后这边参数的保持默认,不必修改。这个节点加载刚才生成的视频,那基本上我们就把参数给调好了。
重点还是回到提示词这儿,官方给了一些提示词的写作建议,我这里做了一下总结。就是上一段和新的下一段,如果说景别不同,那在新的一段的时候,你不能一开始就说新的这个镜头。新的镜头应该先描述上一个镜头结尾时的状态,做大概两秒的一个惯性效果,两秒的过渡完成以后,才开始做自己的新内容,就是后面的才是我们真正要做的内容。
会这样的原因,因为之前我们讲过,我们第一段视频生成到最后22帧,它会强制作为我们下一段视频的开头。比如说第一段视频,它是一个中景,而我们第二个镜头我们想要做的是一个特写,那我们最开始它必然是特写,因为它使用了上一段的内容。因此,我们不能在一开始就说特写,这样的话又中景又特写就会出问题。要知道这22帧是强制生效的,它是一个硬约束。因此,我们把这个动画的一个惯性给描述一下。这段描述完以后,之后我们再描写我们自己的特写内容。这个就是官方提示词里面最核心的原则。
那回到我们提示词里面,我就告诉AI我要做什么。同样的要求,我需要修改提示词,告诉他我的镜头突然要改变为特写,然后是这个女性惊讶的表情,然后说一个新的台词。接着他拿起耳机,就是另外一张参考图,我们来增加这个难度,然后说这是我们的这个礼物。然后他就给了我们对应的提示词,他这里表现还是很出色的。这段格式正确,有两个角色:一个是我们的主持人,一个是我们的这个耳机。女性角色是部分保留,这个耳机是完全保留。
十二、提示词精细调整与续写成功
镜头过渡就是两个镜头。第一个镜头是一个中景的一个景别,所以这段我们之后要自己手动的改。我们角色一,这个说话内容我们肯定是要删除的,因为这两秒肯定不会说这么多话,所以我们要把这段话给删掉。然后是第二段,他说在第六秒开始,这个时间我们要改,改为两秒左右。然后音效这里,他说“第六秒开始新的一个音效”,其实是两秒左右。那因此我们要修改的是镜头一,把这个给去掉,还有后面的这个语言给去掉。我们要描述我们第一个镜头最后的一点状态的一个惯性状态。接着要更改的是这个时长,我们要改为两秒左右。
那完成以后,我们再复制提示词,回到ComfyUI进行粘贴,再做相应的一个修改。镜头一的内容,同样是描述这个女子的一个形象,保持摄像机的移动一致。然后镜头二的话,我们只需要修改这个时间,改为两秒左右。下面的音效也改为两秒左右。最后把这个音乐改为无。还有这一个图像,我们需要上传第二张参考图。都修改完成以后,我们再点击运行。
“大家好,欢迎收看今天的天气预报。受冷空气影响,预计明后两天,我国北方部分地区将迎来明显的降温和局地降雨,而南方大部地区依然维持晴热天气,请大家注意适时增减衣物,出门带好雨具。”
“太好了,你就是观看本节目的第一万个观众。我们将送你这个耳机。”
那这里的音频有一点问题,有可能是种子问题,有可能是这个节点所带来的问题。那这里的话,把这个节点给关闭一下。种子这里再随机切换一下。这里的时长是12秒,因为之前15秒它直接OOM了,分辨率要保持不变。我们再一次运行一下。
“大家好,欢迎收看今天的天气预报。受冷空气影响,预计明后两天,我国北方部分地区将迎来明显的降温和局地降雨,而南方大部地区依然维持晴热天气,请大家注意适时增减衣物,出门带好雨具。”
“太好了,你就是观看本节目的第一万个观众。我们将送你这个耳机。”
结果非常好,声音的质量也得到了提升。另外,在参数这里,我把镜头二设置在第一秒后开始,简短的这个时间,这里也做了相应的简短。发现效果比官方说的两秒阶段要好一点。
十三、长视频制作心得总结
给大家分享一些长视频的使用心得:
-
在续写视频的时候,不要使用首帧图,因为前面的帧已经被固定了。你在强制使用首帧的话,就会导致冲突,发生一些问题。
-
因为每次续写都会少22帧。当你要固定总时间的时候,也要计算好这个缺失的部分。
-
分辨率必须统一。
-
官方推荐重复帧是22帧,但是如果说更小的话,更加适合做硬切的镜头。
-
我们每一次续写音频质量都会下降,其中Turbo LoRA这个加速会进一步影响音频的质量。我们在做长视频的时候,Turbo的步数可以适当增加,因为当步数增多的时候,主要是在影响音频。这个节点尽量不要去使用。
-
每一次续写的新片段,我们是要花一些功夫去琢磨的,特别是参考模式下,每个参考都会影响整个片段。我们上一段视频生成的末尾,会沿用到下一段视频的生成里面。因此,我们下一段视频的开头会说一点废话,就是描述这段重复的内容。一定要留意。



