
1,锁定两个起始画面
一个是从卡利普索的肩膀后面看过去,另一个是从奥德修斯的肩膀后面看过去。
整场戏所有镜头都从这两个画面出发去生成,人物站的位置、大小比例、背景关系从头到尾都不会乱。
2,双角度同步跑对话
任何需要两人说话的片段,提示词顶部就明确写清“两个角色依次说话,绝不重叠”,并严格规定谁在镜头内、谁是场外声,以及语气、停顿、口音。
3,动作提示双向镜像
擦眼泪这种细微动作,两个角度的提示里写完全一样的手部描述(松拳、只伸食指、鼻子旁一次短而慢的向下抚摸)。这样剪在一起就像同一段连续调度。

不要把 AI 当成“生成器”,而要把它当成一个不稳定的摄影团队。你需要像导演一样控制镜头、角色、空间、动作连续性。
也就是竞争力,从“会写 Prompt”变成“会导演”。
镜头。角色。空间。动作。连续性。


一个穿红色风衣的女孩,
正在雨夜街头快速穿过马路,
公交车从身后经过形成运动模糊,
黄昏路灯和商店灯光交错,
35mm电影镜头,
柯达胶片色彩,
人物位于画面左侧三分之一。


也就是引出了 pdf 里的一个提示词公式:

主体 + 动作 + 环境 + 光线 + 构图 + 风格 (谁 + 在哪里 + 做什么 + 怎么拍 + 什么感觉)
第二条是:不要告诉 AI “我要大片”,告诉 AI “大片是怎么拍出来的”。
像这种“生成一张高级感照片”,得说明白高级感是啥:
35mm film still
低机位
浅景深
自然光
轻微运动模糊
人物偏左构图


三:AI 的默认答案永远是平均值,你的任务就是不断增加限制,让它远离平均。
比如这个平均值:
人站中间
正面对镜头
均匀打光
完美但没有故事
解决方法就是指定构图、动作、镜头等:
人物站在画面右侧三分之一,大量留白

女孩刚刚跑过雨中的街道,
头发被风吹起,
身后的公交车

四:文字不是普通描述,而应该像设计师制作版式一样描述。
1. 文字必须加引号
标题:“MORNINGS, UPGRADED”
2. 指定位置
巨大标题位于画面顶部
3. 指定层级
标题占据上半部分,
产品位于右下角,
保持大量留白

五:修改图片,不要重新生成:保留什么 + 修改什么
错误示范:改一下背景。
更好的表达是:
保持产品和阴影完全不变,
替换背景为柔和阳光照射的灰色摄影棚。
换衣服:
保持人物脸部、姿势、光线不变,
替换服装为黑色西装。
换场景:
保持人物完全一致,
将背景改成巴黎街头。
六:多图保持一致:不要靠运气
做:
IP角色
连续漫画
产品系列
视频人物
必须锁定:
人物:保持脸型、发型、年龄一致
产品:保持包装、logo、颜色一致
就是说,如果你想让同一个人(或者同一个产品)在很多张不同的画面里反复出现,样子必须一模一样,不能这张脸变了、那张衣服颜色跑了,那就需要先给AI一张“标准照”当参照,把这个人的长相、服装、特征彻底固定住。以后生成任何新画面时,都拿这张标准照去提醒AI:“就是这个人,别给我乱变。”
七:回到前面的那个观点:
视频 Prompt 的核心~你不是生成画面,而是在导演镜头。
图片 Prompt 是告诉 AI“拍什么”;视频 Prompt 是告诉 AI“这一幕如何发生”。
其实就是在图片的基础上多了几个维度,比如时间,镜头怎么移动,连贯性,当然还有声音。

【镜头】
竖屏9:16,中景
【镜头运动】
镜头缓慢推进
【主体】
一个……
【动作】
正在……
【场景】
地点 + 时间 + 环境
【光线】
……
【风格】
……
【声音】
……
比如这个光,就可以有:
清晨:柔和的晨光
电影:戏剧化电影光影
悬疑:低调暗光,强烈阴影
梦幻:柔和漫射光
「人物 + 在哪里 + 做什么动作 + 镜头怎么拍 + 整体什么感觉」

关于首尾帧,以及多图参考的图形说明。

关于镜头移动的,这是 12 个常用的。不要只描述画面,要指定镜头运动;一个镜头一个动作,慢速运镜更容易生成电影感。

相机和镜头参数不是重点,关键是用“焦段 + 光圈 + 景别 + 机位角度”控制画面的视觉语言:决定人物距离、空间关系、背景虚化和情绪氛围。
给我整体的感觉就是那一句话「“不要告诉AI我要大片,告诉它大片是怎么拍出来的”」,我要会拍大片了,那我不就是大导演了么。
难怪很多 AI 视频,一些导演们做的就都挺好的。估计后面会有越来越多知名导演的 AI 神作出现。
这么理解下来,如果把“导演思维”拆开,感觉就是导演最基本的能力不是会拍摄,也不是懂器材,而是:把脑中的抽象想法,翻译成一套所有人都能执行的视觉语言。只不过放在 AI 里,就是 AI 能听得懂能执行的。
以前导演面对的是摄影师、演员、灯光师、剪辑师。 现在咱面对的是 AI。