空间/镜头调度
2026-08-18 14:27有问题,而且不是审美问题,主要是**“动作—时长—空间连...
用于锁定画面空间、左右关系、人物站位和镜头轴线,减少 AI 视频空间漂移。
空间/镜头调度
空间
参考图
15秒
3,791 字7 min
有问题,而且不是审美问题,主要是**“动作—时长—空间连续性”之间有几处互相打架**。整体方向是对的,但现在直接拿去生成,最容易翻车的不是画面质感,而是人物动作跳步、电话动作来不及、机位空间错乱。 我先给判决:文本设计约 8.3/10;作为 15 秒一次生成的可执行 Prompt,我只给 7.2~7.6/10。 最大问题是你在最后 7 秒里塞了接近正常影视 12~18 秒才能舒服完成的表演。 最严重的是这几个。 1. 10–12 秒里突然出现一句“拿出手机报号”,但这一镜根本没时间,也和下一镜冲突。 你这一段: 10-12秒|驾驶室内反打近景 ……遮光手先撤离玻璃…… 拿出手机报号 然后 12–15 秒又写: 慌忙低头去掏手机 ……掏出手机后立刻拨打电话 这就是明确的连续性错误。 手机到底什么时候拿? 如果 10–12 秒已经“拿出手机报号”,12 秒就不能再“掏手机”。 我建议非常明确: 10–12 秒彻底删掉“拿出手机报号”。 这一镜只完成一个事件: 看见刘哥 → 认知冻结 → 吸气 → 撤手 → 准备下车。 电话全部留给最后一镜。 2. 12–15 秒根本塞不下现在这些动作 + 完整对白。 现在 3 秒里你要求: 抓支架 → 左脚下踏板 → 失衡 → 右脚跳地 → 踉跄 → 肩膀绷紧 → 呼吸急促 → 低头 → 掏手机 → 解锁/拨号 → 等接通 → 说: “喂,110吗?咸阳服务区这边有个卡友……人好像已经没了。” 单这句话,按惊慌但能听懂的真人语速,都差不多要 4~5 秒。 再算动作,正常最少得 6~8 秒。 所以模型会采用几种非常典型的作弊方式: 人直接瞬移到地上; 手机凭空出现在手里; 动作疯狂加速; 说话时人还在跳车; 刚拨号就直接开始说; 丢掉你写的若干动作; 对白截断; 为满足对白把镜头时间偷偷拉长。 这不是 Prompt 再强调“动作连续”能解决的,是物理时间预算不成立。 如果死锁 15 秒,我会把对白砍成: “110吗?咸阳服务区……有个司机,好像没了。” 甚至更自然的是最后只说到: “110吗?咸阳服务区这边……” 然后 cut。 下一段再继续报警。 反而更像电影,因为观众已经完全知道发生什么了,没必要第一段把报警信息念完整。 3. 8–10 秒动作也偏满。 两秒内要求: 走到门边 → 跟拍 → 停 → 拍两次门 → 停半拍 → 喊两次 → 低头确认踏板 → 放水杯 → 左脚上踏板 → 抓支架 → 手遮反光 → 向里看。 两秒钟,真人基本是在表演杂技 😂 而且你还指定了: “所有动作连续完成,不跳姿势。” 这反而会暴露时间预算的问题。 这一段建议至少给 3 秒左右。 4. 你真正重要的“发现死亡”情绪节拍太短了。 你这个剧情最值钱的其实不是苍蝇,也不是报警。 真正的戏眼是: 他只是觉得奇怪 → 凑近看 → 大脑识别出不对劲 → 人僵住。 这需要时间。 现在: 8–10 看车里 10–12 发现死人 12 秒立刻慌忙下来报警 也就是说“看清—理解—恐惧”只有不到两秒。 而且你写: 瞳孔停住、停止眨眼、嘴微张、胸口短促吸气 这些细节本身很好,但模型需要一个微停顿才能表现出来。 最好给大约: 0.5–0.8 秒的冻结。 别急着让他动。 这个停顿反而会让死亡感更重。 5. 水杯落地的因果链没闭。 前面是: 把水杯放到踏板边缘 后面: 音效:水杯落地声 问题来了: 谁碰掉的?什么时候掉? 这属于模型最容易自己脑补的东西。 结果可能是: 水杯无缘无故自己掉; 人落地以后水杯才突然飞下来; 水杯一镜在踏板,一镜又回手里; 根本消失。 你需要直接写因果: 卡友慌乱下踏板时右腿/鞋跟擦到刚才放在踏板边缘的水杯,水杯被碰落到水泥地。 这一句就闭环。 6. “没呼吸,以无生命体征”既不自然,也很难视觉化。 你这里: 刘哥只作为驾驶室内部趴在方向盘上不动虚焦肩背轮廓存在,不露脸。没呼吸,以无生命体征 “无生命体征”属于判断性语言,不是镜头能够直接表现的视觉事实。 模型更吃: 刘哥全程完全静止,肩背没有可见呼吸起伏,不回应敲门和呼喊。 这样才是可见证据。 而且别直接要求模型“表现死亡”,让它表现“不动、无呼吸起伏、不响应”,会稳定很多。 7. 苍蝇的量和状态最好克制一点,否则非常容易进入腐败尸体/恐怖片语义。 你写: 大量苍蝇随机落下、爬动、飞起 “大量苍蝇 + 车内死人”非常容易让模型脑补: 腐败、污渍、尸斑、脏玻璃、血迹、恶臭视觉化。 虽然你后面写了“不要血腥腐败特写”,但生成模型常常已经被前面的语义拉过去。 更稳的是: 十余只苍蝇聚集在门缝、玻璃胶条和后视镜支架周边,间歇落下、爬动、重新飞起;车辆与驾驶室保持正常外观,不出现腐败、血迹或污秽。 信息还是一样,但不会一下掉进恐怖片。 8. “中国平头重卡”还不够强锁车型。 你已经写: 暗红色中国平头重卡 车辆型号、车头结构、后视镜、轮轴不能变化。 这个意识是对的。 但是“型号不能变化”存在一个逻辑问题: 你根本没定义型号是什么。 模型不能锁一个没被初始化的东西。 最好第一镜就建立明确资产: 暗红色国产重型平头牵引车,四点式驾驶室、双侧大型外后视镜、前二后八/具体轴型……后续所有镜头保持同一车辆身份。 如果已有资产参考图,就更简单: “车辆严格继承参考资产,不重新设计。” 这是最稳的。 9. 机位空间有一处可能造成轴线跳变。 你有: 外景从主通道右侧朝左前拍; 卡友从右向左走; 到驾驶室; 驾驶室内从副驾驶座后方朝前拍; 最后一镜又在“驾驶室外左前侧”拍卡友。 问题不一定必然出错,但模型没有明确知道: 驾驶室哪侧是驾驶员门,卡友在哪一侧攀爬。 中国左舵重卡通常驾驶员门在车辆左侧。 所以最好把空间定死: 卡友始终从车辆驾驶员侧(车辆左侧)接近、敲门、踩踏板查看,并从同一侧下车。 否则很可能: 上一镜他在车左边。 内反打之后。 下一镜突然从车右边下来。 典型 AI 空间穿帮。 10. 10–12 秒这个“驾驶室内部反打”视觉上很好,但有一个实现风险。 你要求: 摄影机位于副驾驶座后方约40厘米 前景虚焦只见刘哥…… 焦点落在玻璃外卡友脸上。 这个画面实际上很好。 但是模型需要同时理解: 刘哥在驾驶座前景 → 卡友在驾驶员侧窗/前挡区域 → 摄影机在副驾驶后 → 卡友脸隔玻璃清楚可见。 你前面却写的是: 另一手贴挡风玻璃遮住天空反光向里看。 正常卡友如果站驾驶员侧踏板,更自然往往会从驾驶员侧车窗/挡风玻璃左侧区域往里看。 所以这里最好统一: 不是笼统“挡风玻璃”,而明确卡友查看位置。 否则摄影机空间有一定概率自己扭曲。 还有一个比较隐蔽的问题: 你把摄影参数写得很好,但是现在已经有一点摄影语言强度 > 戏剧动作执行优先级了。 ARRI、Cooke、Pro-Mist、Vision3、HEX、中间调、阴影、曝光差、滚降…… 这些不会错。 但如果这是视频生成模型,真正决定成败的是: 人物是谁 → 人在哪 → 手里有什么 → 上一秒身体状态 → 下一秒身体状态 → 为什么动 → 动到哪里。 所以如果模型的上下文/服从能力有限,我宁可把: #8998A3 #1E2528 #C4B59D 这一类描述砍掉一点,也绝不会砍: 右手水杯 → 放踏板 → 攀爬 → 看见 → 僵住 → 下车碰掉水杯 → 掏手机。 后者才是这一条片子的骨头。 我会把你这 15 秒重新分成: 0–3秒:孤车异常建立 空旷服务区 + 孤零零红车 + 苍蝇声出现。 3–5秒:苍蝇证据 不解释,只让观众意识到“不对劲”。 5–8秒:卡友发现异常并停下 走 → 听 → 看 → 停。 8–11秒:靠近、敲门、攀上查看 敲门 → 无回应 → 放杯 → 上踏板 → 看进去。 11–13秒:死亡认知瞬间 刘哥虚焦静止 → 卡友冻结 → 吸气 → 撤手。 13–15秒:慌乱下车 急下踏板 → 碰掉水杯 → 踉跄 → 掏手机。 然后直接 CUT。 报警对白进第二段。 这个版本反而会明显高级。 因为第一段的终点不是“交代完报警”,而应该是: 一个普通司机意识到:这里出事了。 这是这一幕真正的 dramatic beat。 你原版最大的错误,本质上就是舍不得把剧情切开,所以最后三秒像要把后面一整场戏全吃进去。 另外两个小修: “水印、Logo”应该写成: 不要水印、不要Logo。 以及: 没呼吸,以无生命体征 改掉,语法和视觉执行都不够准确。 所以如果问我哪些值得保留:整体色彩方案、孤车构图、苍蝇微距、卡友先眼动再转头、摄影机晚停20cm、玻璃内外反打、刘哥不露脸,这些全部值得保留。 尤其“人物先停、摄影机晚停一点”这个处理很像真正拍片,而不是 AI Prompt 常见的机械同步。 真正需要重构的主要就是最后 8–15 秒的动作时钟和连续性状态机。 @嗦粉