发现AIAI视频工坊AI视频工坊文生视频提示词到底怎么写?

文生视频提示词到底怎么写?

同一个模型,有人出的是电影,有人出的是 PPT 翻页——差距九成在提示词。视频提示词和图片提示词是两种语言,核心区别一句话:图片描述「状态」,视频描述「变化」。

三要素:主体动作、镜头运动、时间顺序

一条能打的视频提示词,这三样至少占两样:

要素反面写法正确写法
主体动作一个女孩在海边一个女孩沿着退潮的海岸线慢跑,发丝被海风吹起
镜头运动(不写)镜头从背后缓慢跟拍,逐渐拉远露出整片海岸
时间顺序(不写)跑动中天色从黄昏过渡到暮蓝,路灯次第亮起

运镜词不用自己发明,电影语言工坊的镜头参数速查表里,推拉摇移跟升降的中英文写法都列好了,直接抄。

各平台的口味差异

  • PixPix / 即梦:中文长句友好,按「主体+动作+镜头+光线+风格」的顺序写,信息越具体越稳。
  • 可灵:吃动作词,把动作写细(「转身时裙摆扬起」优于「转身」),物理真实感是强项。
  • Sora:自然语言叙事,可以像写小说一样写一段场景,它对「氛围」的理解最深,但要英文。
  • Runway:短句+关键词堆叠更有效,适合风格化实验片。

负向词模板(直接抄)

画面抖动、闪烁、变形、多余肢体、面部扭曲、文字水印、低分辨率、卡顿

英文版:flickering, morphing, extra limbs, distorted face, watermark, low quality, jittery motion

一个万能句式

【景别】+【主体与动作】+【镜头运动】+【光线与色调】+【风格】
例:中近景,一位老匠人在作坊里打磨木料,木屑在逆光中飞舞,镜头缓慢环绕,暖黄色调,纪录片质感。

写好后先在 PixPix 出一张静帧验证构图,再生成视频——省额度,也省心态。

常见问题

提示词是不是越长越好?
不是。有效信息密度才是关键:5 秒的片段,一段 80~150 字的中文提示词是甜区;超过 300 字,模型反而会丢东西。长故事拆多段生成。
为什么同一条提示词,两次生成差别很大?
视频模型本身随机性大。固定风格词与色调词、只换动作,能显著缩小抖动;重要镜头生成 2~3 次择优是常态操作,别指望一发入魂。