文本提示词在视频模型时代已经退居二线了。这不是说文字没用
先理清一件事:视频模型和图像模型的提示词工作流完全两个逻辑。图像模型吃的是描述性语言,画面细节越具体越好;视频模型吃的是「时间轴上的约束条件」,它需要在每一帧之间保持语义连续。所以输入结构应当是——把镜头运动、起止帧差异、物理表现分开交代,再叠加风格锚点。
下一篇
知识变便宜了,但知识之间的接缝没有——一个把问题描述到位的提示词 →
我实测下来比较稳的结构是这样:
[镜头语言]:推镜+低机位,从地面苔藓扫到叶片上的水珠
[运动主体]:黑色甲虫从左侧进入画面,触角微颤,步速均匀
[环境物理]:雨后林间,雾气轻度流动,风把叶尖水珠晃落
[风格锚点]:微距摄影,景深压到F2.8,背景光斑化
[渲染约束]:真实材质,拒绝卡通化,拒绝夸张畸变这个结构跑通的核心逻辑是按「时间-空间-风格」分维输入。很多人写不好视频提示词,是因为全挤在一句话里,模型不知道哪部分该动、哪部分该静止——帧间一致性和运动自然度自然崩。
输出质量的变化是显著的。以前用整段描述文字生成,总出现「运动抽搐」或「主体变形」,尤其是快速移动物体几乎不能用。改成这种视觉提示分层后,肢体漂移的情况明显减少,模型对「该动什么、动多快」的把握更精确了。
如果你是做静态图提示词的老手,转到视频方向最容易踩的坑是——把描述场景的文本直接拿来做视频生成。视频模型里,文字服务于镜头语言,而不是画面填充。让模型先理解「这是一个运动中的什么」,再理解「画面里还有什么」,顺序错了效果直接掉档。
这个方向的上手步骤与避坑记录见用Claude整理的AI副业教程,有不少直接可参考的案例。