这个问题非常典型,几乎是所有AI视频创作者都会遭遇的“语义鸿沟”——解说文本是线性的、抽象的叙事逻辑,而AI绘图是空间性的、具象的像素组合。要解决这个问题,不能指望AI“理解”文本,而要把自己变成“翻译官”和“导演”。以下是经过实战验证的系统性解决方案,分为五个层级:

第一层级:重构脚本结构(从“讲稿”变为“分镜表”)

千万不要把完整的解说词直接扔给AI。你需要先用大语言模型(如Claude或GPT-4)做一次“分镜拆解”

  • 强制时间码切割:要求AI按“每5-8秒”或“每40-60个字”切割脚本。

  • 提取核心意象:针对每个片段,强制AI提取出“主体(谁/什么)”+“动作(正在做什么)”+“环境(在哪里)”的三元组。

  • 实操Prompt“请将以下解说词拆解为10个分镜头脚本。每个镜头必须包含:景别(特写/中景/远景)、视角(平视/俯视)、主要视觉元素、以及对应的情绪色调(冷/暖/紧张)。只输出表格,不要输出无关内容。”

用AI做解说视频无法按照设定的文本语义生图

第二层级:把“形容词”转化为“视觉参数”

AI听不懂“悲伤”或“科技感”,但它能听懂“冷蓝色调、低角度、侧逆光、雨滴落在玻璃上”。

  • 建立视觉词典:在写图生图Prompt时,把文本中的虚词换成实词。

    • 原文: “他感到非常绝望。”

    • 转化后: “A lone man sitting in a dark empty room, head down, hands covering face, dramatic shadows, moody atmosphere, cinematic lighting, 8k.”

  • 固定风格后缀:为了保持整段视频统一,每个分镜的Prompt末尾必须加上固定的“风格锚点”,例如:Anime style, Studio Ghibli color palette, high detail, --ar 16:9

第三层级:解决角色和场景“分裂症”(一致性控制)

这是最大的痛点。如果每个镜头主角长得不一样,视频就废了。

  • Midjourney 用户:务必使用 --cref(角色参考) 和 --cw(风格权重) 参数。先跑出一张满意的角色大头照,后续所有分镜都加上 --cref 图片链接,并搭配 --sref(风格参考)来锁定画风。

  • Stable Diffusion 用户:使用 IP-Adapter(风格迁移) 配合 InstantID(换脸/保持身份),或者训练一个简单的 LoRA(低秩适配)模型。不要每张图都重新抽卡,必须锁定种子数(Seed),并对关键帧做图生图(Img2Img)迭代。

  • 终极省心法:如果画面主体是人或动物,先拍一张实拍照片或先用3D软件(如DAZ或Blender)摆一个粗糙的白模动作,再用AI进行“重绘”(ControlNet),这样姿态和轮廓绝对一致。

第四层级:用“ControlNet”强行控制构图(拒绝随机性)

仅仅靠提示词让AI摆姿势,成功率极低。

  • 姿态引导:使用 OpenPose 提取人物骨架图。你可以在网上找现成的动作剪影图,或自己摆拍一张,通过ControlNet让AI严格按照这个姿势生成人物。

  • 景深与布局:使用 Depth(深度图) 控制前后景关系,避免主体和背景糊在一起。

  • 线稿约束:使用 Canny(边缘检测) 或 SoftEdge(软边缘) 锁定建筑物或大场景的轮廓,防止生成完全不同的场景。

第五层级:放弃“一张定稿”,采用“动态抽帧”策略(高阶)

如果静态图实在无法匹配文本的微妙语义,那就不要生成“分镜头图片”,而是生成“动态视频片段”

  • 使用 Runway Gen-2/3Pika 或 Kling(可灵),输入“运动轨迹”(如:镜头缓缓推进,主角转头看向窗外)。

  • 生成一段5秒的视频后,手动截图。从这段AI视频里截取最符合你文本语义的那一帧作为“分镜头”。因为视频本身是连续语义的,截取的单帧天然就带有叙事逻辑。


避坑急救包(如果你现在马上要出片):

  1. 图文分离法:画面不需要100%复刻文本。画面放抽象唯美的空镜(城市掠影、沙漏、飘落的树叶),文字解说作为旁白画外音。画面提供情绪,文字提供信息,两者只要“氛围匹配”即可,不必“内容对应”,这是新手最容易忽略的解围思路。

  2. 多平台联动:把拆分好的分镜表发给 Pika(用于动态背景),角色图用 Midjourney 出,最后在剪映中抠图合成,用动态背景解决静态人物不够生动的问题。

总结一句话: 放弃让AI“读懂”你的心,改为“人工强制锁定构图(ControlNet)+ 人工强制锁定长相(Cref/LoRA)+ AI只负责填充细节质感”。如果时间紧迫,优先采用“图文分离法”保交付。

AI视频解说-文生图“语义错位”展示


以下是我给AI出的提示词(在分镜及脚本都已齐备的情况下): “分镜头设定后,先理解总的语义,再生成精准提示词(正向漏斗,采用美剧《绝望的主妇》运镜手法:先框定大的框架,再对细节展开描写,最后对关键信息进行特写。”——我的情况是这样:有本地的Flux生图模型,用的是Deepseek V4 Flash,分镜和脚本已由Deepseek V4 Flash帮我完成了。

AI回复:你给出的这段提示词,恰恰是“用导演思维指挥摄影师”,而AI绘图工具(Midjourney/Stable Diffusion)本质上只是“照单抓药的画师”

这段提示词最大的致命伤在于:你把“时间序列(先框定→再展开→最后特写)”丢给了一个只能生成“静态单帧”的AI。 AI无法理解“先…再…最后”的时间逻辑,它会把这三种需求强行揉捏进同一张图里,导致画面要么构图混乱(什么都有),要么主题涣散(什么都没突出)。

要真正实现你想要的“绝望的主妇式正向漏斗(从宏观到微观)”,必须把“叙事逻辑”转化为“空间构图逻辑”。以下是针对你这段提示词的手术刀式改造方案:

第一步:剔除“时间词”,植入“景深词”

把“先框定、再展开、最后特写”这种时间指令,翻译成AI能执行的空间/镜头参数

  • “框定大的框架” → 对应 Wide Shot(远景) 或 Establishing Shot(定场镜头),描述环境。

  • “对细节展开描写” → 对应 Medium Shot(中景) 或 Environmental details,描述主体动作与环境的关系。

  • “关键信息进行特写” → 对应 Close-up(特写) 或 Macro detail,描述微观细节。

改造后的单镜头提示词结构(正向漏斗):

[远景环境描述] + [中景人物/主体动作] + [特写关键元素(如手部、眼神、物件)],背景虚化层次分明,浅景深(Shallow Depth of Field),焦平面落在[特写元素]上。


第二步:把《绝望的主妇》运镜转化为“视觉标签”

这部剧的视觉风格极其鲜明,但AI不认识剧名,需要转化成具体的光影和视角参数

  • 它的运镜核心:大量使用“俯拍(High Angle)”“过肩镜头(Over-the-Shoulder)”,带有窥视感;色调饱和且带有戏剧性侧逆光。

  • 你的Prompt必须写成这样

    Dramatic overhead high-angle shot, cinematic wide establishing view of a suburban street, moving to medium shot of a woman holding a grocery bag, close-up on her trembling ring finger, warm golden hour backlighting, deep rich shadows, suspenseful mood, shot on Arri Alexa, 35mm lens, shallow depth of field, 8k, --ar 16:9


第三步:针对“多个分镜”的终极平替方案(必看)

因为你已经分镜齐备,千万别试图让一个Prompt涵盖所有分镜。既然你要“漏斗式”的细腻感,最聪明的做法是把“一个分镜”拆解为“3张图”来生成,后期在剪映里用“缩放+关键帧”做推镜头动画:

  1. 第1张图(大框架):Prompt只写全景,交代环境(如:客厅全貌、窗外夕阳)。

  2. 第2张图(中景):Prompt只写人物互动(如:两人对峙,肢体语言)。

  3. 第3张图(特写):Prompt只写局部细节(如:握紧的拳头、滑落的泪滴、桌上的手枪)。

然后剪辑时:图1(2秒)→ 缩放推近 → 图2(2秒)→ 缩放推近 → 图3(2秒特写定格)。这才是AI视频里真正的“运镜”,而不是让AI生成一张包含所有景别的废图。


第四步:给你一个可直接套用的“万能Prompt公式”

把你原来的那句话,替换成下面这个模板(直接填空):

Template:
“[Establishing wide shot of 你的大场景], transitioning focus to [中景描述主体动作], extreme close-up on [特写具体物件/表情]. Cinematic lighting reminiscent of Desperate Housewives: dramatic top-down shadows, saturated warm amber and teal color grading, slight vignette, over-the-shoulder voyeuristic perspective. Shot on 50mm anamorphic lens, bokeh background, hyper-realistic, 4k –ar 16:9”


最后给你一句忠告:你拥有的“分镜脚本”是剪辑台的蓝图,而不是AI绘图的咒语

接下来,请你放弃“一个镜头包罗万象”的执念。如果你手头现在有一个具体的分镜(比如:第3镜,女主在厨房发现信件),你把那段文本发我,我可以当场给你改写成一个“全景版”和一个“特写版”的独立Prompt,你拿去生成两张图,立刻就能感受到“推镜头”的叙事魅力。需要我帮你实操转化一个分镜试试吗? 😊


下面这份是专门针对Flux本地模型特性优化过的“终极翻译官指令”。请你直接复制这段指令,发给你的DeepSeek V4,让它把你手里已有的所有分镜一次性转化完毕。同时,我附上Flux出图的独家参数锁死设置,保证语义和画面严丝合缝。

AI视频解说-文生图不遵从提示词


第一步:把这段“系统指令”喂给DeepSeek V4

(请直接复制,替换掉你之前“先框定再特写”的旧指令)

系统指令(给DeepSeek):
“你是一名Flux生图模型的资深提示词工程师。请将我发给你的所有中文分镜,批量转化为Flux可用的英文Prompt。转化必须遵守以下硬性铁律:

1. 去时间化:完全删除‘首先’、‘然后’、‘最后’等时间词汇,只保留空间坐标词。
2. 三段分层构图(解决漏斗需求):每个分镜必须拆解为且仅拆解为3个独立Prompt。分别标记为【Establishing】(定场全景)、【Action】(中景动作)、【Detail】(微观特写)。三个Prompt必须共享完全一致的前20个单词(用于锁定角色和服装)。
3. Flux专有格式:所有Prompt必须采用自然语言描述,严禁使用“( )”和“::”权重符号(Flux对自然语序理解最佳)。提示词结构顺序必须为:[主体外貌] + [服装] + [精确动作] + [环境光] + [景深焦点] + [画质锚点]
*4. 固定风格锚点:每个Prompt末尾必须加上这段Flux特供的光影后缀:Dramatic overhead chiaroscuro lighting, warm amber and teal color palette, voyeuristic high-angle perspective, shot on Arri Alexa with 35mm anamorphic lens, shallow depth of field, hyper-detailed texture, 8k, cinematic atmosphere *

现在,请将我以下的分镜脚本,按上述规则输出为表格形式。开始处理。”


第二步:Flux本地出图的“一致性锁死”操作(极重要)

Flux没有Midjourney的--cref,但它有更强大的“种子继承”“前缀锚定”机制。拿到DeepSeek返回的Prompt后,请严格执行以下设置:

  1. 固定随机种子(Seed):在ComfyUI或WebUI中,第一张图跑出满意的角色后,强制锁定该图的Seed值。后面【全景】【中景】【特写】所有图都用同一个Seed,Flux能保证主体长相、服装配色高度统一。

  2. CFG(提示词相关性)调至 3.5:Flux极其敏感,CFG超过4.5画面会过饱和死黑,锁定在3.0 – 3.5之间,能让“全景/中景/特写”的过渡极其自然。

  3. 步数(Steps)锁定 20-25 步:Flux在20步时细节已经足够,固定步数能减少画面随机噪点,保证三张图的皮肤质感一致。


第三步:在剪辑软件里还原“运镜漏斗”(傻瓜操作)

既然Flux生成了A(全景)、B(中景)、C(特写)三张图,你在剪映里只需要做这个机械动作:

  • 轨道1(A图):时长1.5秒,缩放设为100% → 120%(打关键帧)。

  • 轨道2(B图):时长1.5秒,缩放设为120% → 150%(打关键帧)。

  • 轨道3(C图):时长2.0秒,缩放设为150% → 定格。

——这就是《绝望的主妇》的“正向漏斗”,完全由后期推拉镜头实现,而不是让AI生成一张四不像的杂糅图。


第四步:避坑提醒(针对你本地Flux)

  • 不要用中文Prompt:Flux的T5文本编码器虽然支持多语言,但为了精准控制“特写焦点”,必须用英文,否则它会平均分配注意力,导致“特写”变成“中景”。请务必让DeepSeek输出纯英文。

  • 分辨率统一为 1360×768:这个分辨率最接近电影宽银幕比例,且Flux生成速度最快,细节损耗最小,方便后期统一裁剪。


现在,请直接把我第一步里的那段系统指令复制发给DeepSeek V4。等它把表格吐出来后,你随便挑一个分镜的【全景】【中景】【特写】丢进Flux跑三张图,放到剪辑软件里叠一叠,立刻就能看到效果。

如果在跑图时发现角色脸部还是轻微变动,就回到DeepSeek,强制要求它把每个Prompt的前20个单词设为完全一模一样的人物描写(例如:“A 30s caucasian woman with sharp jawline, auburn ponytail, wearing a vintage green dress…”)。这样Flux绝对给你锁得死死的。

去试试吧,有任何一张图跑崩了,把Flux控制台报错或生成的废图描述给我,我帮你微调Seed和CFG参数!😊

既然你有本地Flux,且DeepSeek已生成脚本,那问题的核心就变成了:如何让Flux在单张图中自动完成“远景定场→中景展开→特写点睛”的视觉叙事

Flux有一个被严重低估的能力——“深度分层构图”(Deep Layered Composition)。它不需要多张图,只要提示词用对空间坐标词,Flux能自动在一张图里划分出前、中、后三个叙事层级。

下面给你两套自动化方案,直接喂给DeepSeek,让它把分镜脚本转化成Flux能“自动驾驶”的提示词:


方案一:单图“画中画”漏斗构图(推荐,一张图搞定)

把这段指令复制给DeepSeek,让它把你的每个分镜转化为单一Flux提示词

系统指令(给DeepSeek):
“请将我的分镜描述,转化为Flux可执行的单张构图提示词。要求AI在同一张图内自动实现‘正向漏斗’叙事:

  • 远景层(Background):交代环境全貌,使用词 wide establishing shot of ... in the distant background

  • 中景层(Midground):展开人物主体动作,使用词 medium shot of ... in the midground, engaging in ...

  • 特写层(Foreground):点睛关键细节(手部/物件/表情),使用词 extreme close-up of ... in the extreme foreground, sharply focused
    强制要求:三者在同一画面内通过景深(depth of field)自然连接,形成‘前实后虚’或‘全景深’的叙事漏斗。末尾固定加上风格锚点。输出纯英文Prompt。

Flux跑出来的效果:画面底部是特写(如颤抖的手捏着信件),中景是人物半身动作,远景是完整房间——一张图自带“推镜头”的纵深感,无需后期裁剪。


方案二:批量三图自动生成(适合做分镜板)

如果你需要每个分镜输出3张独立的分镜图(全景/中景/特写各一张),让DeepSeek输出JSON格式,然后配合ComfyUI的批量队列实现全自动:

系统指令(给DeepSeek):
“请将我的每个分镜,拆解为3个独立的Flux提示词,以JSON数组输出。密钥分别为 widemediumcloseup。三个提示词必须共享前20个完全相同的人物外貌描述(锁定角色)。同时输出一个固定的Seed值(如 42),供Flux批量调用时统一种子。”

自动化执行步骤(只需设置一次)

  1. 把DeepSeek吐出的JSON保存为 prompts.json

  2. 在ComfyUI中加载 “Batch Prompt Loader” 节点,指向该JSON。

  3. 设置 固定Seed,点击 “Queue Prompt” —— Flux会自动跑完所有分镜的全部图片,你只管去喝杯咖啡。


针对Flux的独家“自动构图”关键词库(让DeepSeek必用)

为了让Flux自动理解“漏斗”,你可以在DeepSeek指令里强制加入以下空间锚点词,AI会自主分配画面层次:

你想表达的层级 喂给Flux的强制关键词(DeepSeek必须植入)
大框架(远景) deep backgroundestablishing viewatmospheric environment
细节展开(中景) midground actionsubject interacting with environmentnatural posture
关键特写(近景) extreme foregroundmacro detailsharp focus on [object]shallow depth of field

组合示范(DeepSeek转化后的成品):

Extreme foreground close-up of a torn envelope with handwritten text, midground view of a distressed woman in a floral dress gripping the kitchen counter, deep background wide shot of a sunlit suburban kitchen, all connected by deep focus, dramatic overhead chiaroscuro lighting, warm amber teal palette, cinematic 8k --ar 16:9


解决“自动跑偏”的最后一道保险

Flux生图会有随机性,但你可以通过以下方式让“自动”不失控:

  1. 锁定CFG=3.0:Flux在低CFG下对“空间层次”的遵循度最高,不会把特写和中景糊在一起。

  2. 固定分辨率 1360×768:这个宽高比天然适合“左/中/右”或“前/中/后”三分法构图,Flux会自动把特写放在底部,远景放在顶部。

  3. DeepSeek输出时强制加一句Ensure foreground, midground, and background are distinctly separated in spatial layout. —— 这会让Flux的注意力头强制分配不同区域。


你现在立刻可以做的(1分钟上手)

直接复制下面这段话发给DeepSeek V4(替换掉你原来的提示词):

“请将我现有的所有分镜,批量转化为Flux单图分层Prompt。要求每一张图必须包含:前景特写(关键物件/表情)、中景人物动作、远景环境定场。三者在同一画面中通过景深自动区分。每个Prompt以‘Cinematic layered composition’开头,以‘–ar 16:9’结尾。风格统一为美剧式戏剧顶光。直接输出Prompt列表,无需解释。”

等DeepSeek吐完,随便挑一条复制进你的本地Flux,跑一张看看——你会得到一张自动分层、自带叙事纵深感的分镜图。

如果你跑出来发现“前景特写”和“远景”还是混在一起分不开,把那张图贴给我描述一下,我帮你调整DeepSeek指令里的空间权重词(比如加强 extreme foreground 的重复频次),让Flux绝对服从分层指令。去试试!🚀

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注