返回模板库
详情页
空间/镜头调度
2026-08-18 14:27

有问题,而且不是审美问题,主要是**“动作—时长—空间连...

用于锁定画面空间、左右关系、人物站位和镜头轴线,减少 AI 视频空间漂移。

空间/镜头调度
空间
参考图
15秒
3,7917 min
有问题,而且不是审美问题,主要是**“动作—时长—空间连续性”之间有几处互相打架**。整体方向是对的,但现在直接拿去生成,最容易翻车的不是画面质感,而是人物动作跳步、电话动作来不及、机位空间错乱。

我先给判决:文本设计约 8.3/10;作为 15 秒一次生成的可执行 Prompt,我只给 7.2~7.6/10。 最大问题是你在最后 7 秒里塞了接近正常影视 12~18 秒才能舒服完成的表演。

最严重的是这几个。

1. 10–12 秒里突然出现一句“拿出手机报号”,但这一镜根本没时间,也和下一镜冲突。

你这一段:

10-12秒|驾驶室内反打近景
……遮光手先撤离玻璃……
拿出手机报号

然后 12–15 秒又写:

慌忙低头去掏手机
……掏出手机后立刻拨打电话

这就是明确的连续性错误。

手机到底什么时候拿?

如果 10–12 秒已经“拿出手机报号”,12 秒就不能再“掏手机”。

我建议非常明确:

10–12 秒彻底删掉“拿出手机报号”。

这一镜只完成一个事件:

看见刘哥 → 认知冻结 → 吸气 → 撤手 → 准备下车。

电话全部留给最后一镜。

2. 12–15 秒根本塞不下现在这些动作 + 完整对白。

现在 3 秒里你要求:

抓支架 → 左脚下踏板 → 失衡 → 右脚跳地 → 踉跄 → 肩膀绷紧 → 呼吸急促 → 低头 → 掏手机 → 解锁/拨号 → 等接通 → 说:

“喂,110吗?咸阳服务区这边有个卡友……人好像已经没了。”

单这句话,按惊慌但能听懂的真人语速,都差不多要 4~5 秒。

再算动作,正常最少得 6~8 秒。

所以模型会采用几种非常典型的作弊方式:

人直接瞬移到地上;
手机凭空出现在手里;
动作疯狂加速;
说话时人还在跳车;
刚拨号就直接开始说;
丢掉你写的若干动作;
对白截断;
为满足对白把镜头时间偷偷拉长。

这不是 Prompt 再强调“动作连续”能解决的,是物理时间预算不成立。

如果死锁 15 秒,我会把对白砍成:

“110吗?咸阳服务区……有个司机,好像没了。”

甚至更自然的是最后只说到:

“110吗?咸阳服务区这边……”

然后 cut。

下一段再继续报警。

反而更像电影,因为观众已经完全知道发生什么了,没必要第一段把报警信息念完整。

3. 8–10 秒动作也偏满。

两秒内要求:

走到门边 → 跟拍 → 停 → 拍两次门 → 停半拍 → 喊两次 → 低头确认踏板 → 放水杯 → 左脚上踏板 → 抓支架 → 手遮反光 → 向里看。

两秒钟,真人基本是在表演杂技 😂

而且你还指定了:

“所有动作连续完成,不跳姿势。”

这反而会暴露时间预算的问题。

这一段建议至少给 3 秒左右。

4. 你真正重要的“发现死亡”情绪节拍太短了。

你这个剧情最值钱的其实不是苍蝇,也不是报警。

真正的戏眼是:

他只是觉得奇怪 → 凑近看 → 大脑识别出不对劲 → 人僵住。

这需要时间。

现在:

8–10 看车里
10–12 发现死人
12 秒立刻慌忙下来报警

也就是说“看清—理解—恐惧”只有不到两秒。

而且你写:

瞳孔停住、停止眨眼、嘴微张、胸口短促吸气

这些细节本身很好,但模型需要一个微停顿才能表现出来。

最好给大约:

0.5–0.8 秒的冻结。

别急着让他动。

这个停顿反而会让死亡感更重。

5. 水杯落地的因果链没闭。

前面是:

把水杯放到踏板边缘

后面:

音效:水杯落地声

问题来了:

谁碰掉的?什么时候掉?

这属于模型最容易自己脑补的东西。

结果可能是:

水杯无缘无故自己掉;
人落地以后水杯才突然飞下来;
水杯一镜在踏板,一镜又回手里;
根本消失。

你需要直接写因果:

卡友慌乱下踏板时右腿/鞋跟擦到刚才放在踏板边缘的水杯,水杯被碰落到水泥地。

这一句就闭环。

6. “没呼吸,以无生命体征”既不自然,也很难视觉化。

你这里:

刘哥只作为驾驶室内部趴在方向盘上不动虚焦肩背轮廓存在,不露脸。没呼吸,以无生命体征

“无生命体征”属于判断性语言,不是镜头能够直接表现的视觉事实。

模型更吃:

刘哥全程完全静止,肩背没有可见呼吸起伏,不回应敲门和呼喊。

这样才是可见证据。

而且别直接要求模型“表现死亡”,让它表现“不动、无呼吸起伏、不响应”,会稳定很多。

7. 苍蝇的量和状态最好克制一点,否则非常容易进入腐败尸体/恐怖片语义。

你写:

大量苍蝇随机落下、爬动、飞起

“大量苍蝇 + 车内死人”非常容易让模型脑补:

腐败、污渍、尸斑、脏玻璃、血迹、恶臭视觉化。

虽然你后面写了“不要血腥腐败特写”,但生成模型常常已经被前面的语义拉过去。

更稳的是:

十余只苍蝇聚集在门缝、玻璃胶条和后视镜支架周边,间歇落下、爬动、重新飞起;车辆与驾驶室保持正常外观,不出现腐败、血迹或污秽。

信息还是一样,但不会一下掉进恐怖片。

8. “中国平头重卡”还不够强锁车型。

你已经写:

暗红色中国平头重卡
车辆型号、车头结构、后视镜、轮轴不能变化。

这个意识是对的。

但是“型号不能变化”存在一个逻辑问题:

你根本没定义型号是什么。

模型不能锁一个没被初始化的东西。

最好第一镜就建立明确资产:

暗红色国产重型平头牵引车,四点式驾驶室、双侧大型外后视镜、前二后八/具体轴型……后续所有镜头保持同一车辆身份。

如果已有资产参考图,就更简单:

“车辆严格继承参考资产,不重新设计。”

这是最稳的。

9. 机位空间有一处可能造成轴线跳变。

你有:

外景从主通道右侧朝左前拍;
卡友从右向左走;
到驾驶室;
驾驶室内从副驾驶座后方朝前拍;
最后一镜又在“驾驶室外左前侧”拍卡友。

问题不一定必然出错,但模型没有明确知道:

驾驶室哪侧是驾驶员门,卡友在哪一侧攀爬。

中国左舵重卡通常驾驶员门在车辆左侧。

所以最好把空间定死:

卡友始终从车辆驾驶员侧(车辆左侧)接近、敲门、踩踏板查看,并从同一侧下车。

否则很可能:

上一镜他在车左边。

内反打之后。

下一镜突然从车右边下来。

典型 AI 空间穿帮。

10. 10–12 秒这个“驾驶室内部反打”视觉上很好,但有一个实现风险。

你要求:

摄影机位于副驾驶座后方约40厘米
前景虚焦只见刘哥……
焦点落在玻璃外卡友脸上。

这个画面实际上很好。

但是模型需要同时理解:

刘哥在驾驶座前景 → 卡友在驾驶员侧窗/前挡区域 → 摄影机在副驾驶后 → 卡友脸隔玻璃清楚可见。

你前面却写的是:

另一手贴挡风玻璃遮住天空反光向里看。

正常卡友如果站驾驶员侧踏板,更自然往往会从驾驶员侧车窗/挡风玻璃左侧区域往里看。

所以这里最好统一:

不是笼统“挡风玻璃”,而明确卡友查看位置。

否则摄影机空间有一定概率自己扭曲。

还有一个比较隐蔽的问题:

你把摄影参数写得很好,但是现在已经有一点摄影语言强度 > 戏剧动作执行优先级了。

ARRI、Cooke、Pro-Mist、Vision3、HEX、中间调、阴影、曝光差、滚降……

这些不会错。

但如果这是视频生成模型,真正决定成败的是:

人物是谁 → 人在哪 → 手里有什么 → 上一秒身体状态 → 下一秒身体状态 → 为什么动 → 动到哪里。

所以如果模型的上下文/服从能力有限,我宁可把:

#8998A3
#1E2528
#C4B59D

这一类描述砍掉一点,也绝不会砍:

右手水杯 → 放踏板 → 攀爬 → 看见 → 僵住 → 下车碰掉水杯 → 掏手机。

后者才是这一条片子的骨头。

我会把你这 15 秒重新分成:

0–3秒:孤车异常建立
空旷服务区 + 孤零零红车 + 苍蝇声出现。

3–5秒:苍蝇证据
不解释,只让观众意识到“不对劲”。

5–8秒:卡友发现异常并停下
走 → 听 → 看 → 停。

8–11秒:靠近、敲门、攀上查看
敲门 → 无回应 → 放杯 → 上踏板 → 看进去。

11–13秒:死亡认知瞬间
刘哥虚焦静止 → 卡友冻结 → 吸气 → 撤手。

13–15秒:慌乱下车
急下踏板 → 碰掉水杯 → 踉跄 → 掏手机。

然后直接 CUT。

报警对白进第二段。

这个版本反而会明显高级。

因为第一段的终点不是“交代完报警”,而应该是:

一个普通司机意识到:这里出事了。

这是这一幕真正的 dramatic beat。

你原版最大的错误,本质上就是舍不得把剧情切开,所以最后三秒像要把后面一整场戏全吃进去。

另外两个小修:

“水印、Logo”应该写成:

不要水印、不要Logo。

以及:

没呼吸,以无生命体征

改掉,语法和视觉执行都不够准确。

所以如果问我哪些值得保留:整体色彩方案、孤车构图、苍蝇微距、卡友先眼动再转头、摄影机晚停20cm、玻璃内外反打、刘哥不露脸,这些全部值得保留。 尤其“人物先停、摄影机晚停一点”这个处理很像真正拍片,而不是 AI Prompt 常见的机械同步。

真正需要重构的主要就是最后 8–15 秒的动作时钟和连续性状态机。 @嗦粉