返回博客

怎样写出真正“会动”的 AI 视频提示词

用一套可重复的镜头写法,明确主体动作、摄影机、节奏、光线和声音,而不是把提示词写成一整页剧本。

2026年8月4日Video Lite 编辑部
怎样写出真正“会动”的 AI 视频提示词

图片提示词只需要说明“画面里有什么”,视频提示词还必须说明“接下来发生什么”。如果提示词只有漂亮场景却没有事件,模型就只能自己发明运动,而人物漂移、物体变形和摄影机乱跑,往往就从这里开始。

解决方法不是写得更长,而是把镜头说得更清楚。

用五个决定搭出一个镜头

建议按这个顺序写:

主体与地点 → 可见动作 → 摄影机 → 光线与氛围 → 节奏或声音。

先看一个只有静态画面的提示词:

魔法面包房里有一只可爱的橙色小怪物,电影感 3D 动画。

它描述了一张图,还没有描述一条视频。把它改成镜头调度:

一只橙色小怪物站在月光下的石炉旁。圆形蛋糕突然升起,喷出一团柔软的面粉;小怪物后退一步,眨两次眼,然后露出笑容。摄影机从腰部高度缓慢推进。暖色炉火与冷蓝色窗光交织,家庭动画式的轻快节奏,6 秒,无文字。

现在每一句都有任务:主体完成动作,摄影机只有一个运动,光线有明确来源,事件也有结尾。

主体只安排一个读得懂的动作

“跳舞、奔跑、转身、大笑、挥手”并不会让镜头更丰富,它只会让五个动作争夺几秒钟。应该选择那个真正改变画面的动作。

好的动作有清楚的开始和结束:

  • 打开雨伞,然后抬头看天;
  • 跨进列车,车门在身后关闭;
  • 把玻璃球举到阳光中;
  • 从窗边转身,与镜头对视;
  • 从一张纸展开成飞翔的龙。

镜头失败时,先减少动作,再考虑更换风格。

把摄影机当成真实设备

能够被真实摄影师执行的摄影机语言,通常更容易得到稳定结果。一次选择一个主要运动:

  • 固定机位: 摄影机不动,让主体提供运动。
  • 推进或拉远: 改变观众与主体的情绪距离。
  • 横向跟拍: 跟随主体穿过空间。
  • 环绕: 展示静止主体的形体、尺度或环境。
  • 手持跟随: 增加能量和自然的小幅晃动。
  • 升降或航拍上升: 在镜头结尾揭示更大的世界。

不要把“无人机高速俯冲、环绕、手持摇晃、缓慢变焦”放在同一个镜头里,这些指令来自不同设备,也意味着不同速度。

不只写运动类型,还要写运动质感

模型还需要知道动作应该怎样发生。可以使用 克制、沉重、轻盈、犹豫、被风推动、机械式、几乎不可察觉 等描述。

比较下面两句:

花朵在风中摇动。

高大的罂粟花随着轻微沙漠风,从前景到背景呈不规则的缓慢波浪弯曲,偶尔有花瓣掠过镜头。

第二句同时给出了方向、节奏和空间深度。

参考素材应该减少描述,而不是增加描述

上传首帧之后,模型已经看得到角色、服装、配色和构图。不要再用半段提示词重复描述这些内容,直接告诉它这张图之后要发生什么。

首帧生成可以这样写:

保持角色设计和面包房布局不变。蛋糕再升高一英尺并喷出面粉,小怪物接住木勺,看向蛋糕,然后微笑。摄影机缓慢推进,不增加新角色。

使用参考图片、音频或视频时,要说明每一份素材的职责,例如“图片用于保持角色身份”“音频用于节拍”“视频用于摄影机节奏”。没有职责的参考素材,容易把生成结果同时拉向多个方向。

声音要和产生它的事件写在一起

模型支持生成音频时,声音应该紧跟产生它的动作:

有轨电车以轻微的金属摩擦声刹停,车门打开,低沉的站台环境声持续铺在下方。

对白要短到能够放进视频时长里。把需要准确说出的句子放在引号中,不要让角色在 8 秒镜头里讲一整段台词。

重写之前,先判断问题出在哪里

  • 主体开始漂移: 加入首帧,或者减少同时发生的动作。
  • 摄影机乱跑: 只保留一个摄影机运动,删除相互竞争的镜头词。
  • 画面什么也没发生: 减少氛围形容词,增加一个可见动词和结尾。
  • 动作太快: 明确写出克制节奏,并减少事件节点。
  • 场景不断变形: 说明哪些部分必须保持不变,并缩短转变过程。
  • 声音太拥挤: 只保留一个前景声音和一个环境底层。

每次生成只改一个变量。否则即使结果变好,也无法判断是哪条指令起了作用。

可以重复使用的提示词结构

[景别]中的[主体]位于[地点]。[一个有结尾的可见动作]。摄影机进行[一个真实可执行的运动]。[动作质感与环境响应]。[光线和氛围]。[必要时写声音]。[时长与关键限制]。

这不是万能咒语,而是一张保证镜头易于理解的检查表。现在可以在生成器里试一次,并把真正按预期运动的结果和提示词一起保存下来。