【小白AI入门课程】第二单元:视频提示词入门
只记8个字,让一张图片按你的想法动起来
内容预览
教程内容
导语:只记8个字,让一张图片按你的想法动起来
上一课,我们学习了图片提示词的四个要素:时间、主体、场景、风格。现在,我们已经能比较清楚地描述一张静态图片。
目前的AI视频模型已经能够让图片自然地动起来。即使只输入“让它动起来”,模型通常也能生成一段流畅的视频。不过,角色具体做什么、动作有多快、镜头是否移动,仍然会由模型自行决定。生成结果可能没有明显错误,却只是普通地眨眼或轻微晃动,没有准确表现创作者想要的性格、情绪和故事。
视频提示词要回答一个新问题:这几秒钟里,什么发生了变化?
这节课,我们使用一个简单、容易理解的案例:一位动画导演准备制作一段轻喜剧CG短片。主角不是人类,而是一只胖乎乎的拟人橘猫。它像人一样坐在客厅沙发上,性格懒散、表情有点不耐烦。整体采用写实材质与夸张表情结合的电影动画CG风格。我们会从最简单的一句提示词开始,逐步加入主体动作、镜头、环境和节奏。
本节课只需要记住另外8个字:
主体、动作、效果、节奏。
学完以后,你应该能:
给已有图片写一段清楚的图生视频提示词;
分清主体运动、镜头运动和环境变化;
用普通话描述推、拉、摇、移等常见运镜;
控制画面的稳定性、焦点、速度与声音;
用切镜和景别安排一段短视频的节奏;
把图片提示词与视频提示词组合成文生视频提示词;
借助参考图提高CG角色外观的一致性。
这是一节写提示词的课。如果你还不熟悉 FlowPix 中的视频生成入口、首帧、尾帧等基本操作,可以先回看第一单元的《AI视频生成教程》。
开始前:准备一张图片
请先在 FlowPix 中准备本节课使用的起始图。画面设定是:清晨,一只胖乎乎的拟人橘猫靠坐在深绿色沙发上,面前的茶几放着电视遥控器,客厅简洁明亮。
这张图片就是本节课的起始画面。在图生视频中,AI 不需要重新猜橘猫和客厅长什么样,它主要负责让已有画面发生变化。
直接使用下面的提示词,生成一张16:9横版图片(建议使用seedream5.0pro去生成图片):
清晨,一只胖乎乎的原创拟人橘猫像人一样靠坐在深绿色布艺沙发上。它有浅橙色短毛、奶油色嘴部和肚皮、额头三道深橙色条纹、琥珀色半眯眼睛、圆润脸颊和深橙色尾尖,表情懒散又有一点不耐烦。右爪搭在沙发扶手上,左爪放在肚子上,双腿自然伸向前方。面前是一张简单的圆形木茶几,桌上只有黑色电视遥控器。背景是米白色墙面、落地窗和浅色窗帘,柔和晨光从左侧照进来。电影动画级写实3D CG,真实细腻毛发,柔软布料和木材质感,夸张但自然的拟人表情,暖橙色、深绿色与米白色的克制配色,中景,橘猫清晰,背景轻微虚化,16:9横版。角色为原创设计,不照搬任何现成动画角色,不出现人类、文字、标志和水印。
生成多张图片后,选择橘猫的脸、两只前爪、双腿和尾巴都清楚,角色特征与客厅布局最符合提示词的一张。起始图会决定视频中的角色和构图,因此应先把静态画面确定好,再进入视频生成。
为了看清每次修改带来的变化,前几轮尽量保持同一张起始图、同一个模型和相同的时长设置。
词典:先认识几个词
图生视频:给 AI 一张或多张图片,让它以图片为依据生成视频。
文生视频:不给起始图片,直接用文字描述画面与变化,让 AI 生成视频。
主体:视频中最希望观众关注的人或物。
动作:主体在这几秒内做了什么。没有动作,也可以明确写“保持不动”。
镜头:观众看到画面的视角。镜头运动,是观看位置或方向在变化,不等于主体在移动。
景别:主体在画面中占多大。远景能看见更多环境;特写更靠近脸、手或某个物件。
切镜:从一个画面直接换到另一个画面。例如从橘猫坐在沙发上的全景,切到它半眯眼睛的近景。
节奏:画面变化的先后、快慢和停顿。视频不是动作越多越好,而是变化发生在合适的时候。
一、先做最简单的视频:主体+动作+效果
视频提示词的前6个字是:主体、动作、效果。
我们先用一句最简单的话,让图片中的橘猫动起来:
拟人橘猫缓慢转头看向镜头,抬起一边眉毛,懒洋洋地挥一下右爪。固定镜头。
把这段话输入视频生成节点,生成约5秒视频。
这句话包含三个部分:
主体:拟人橘猫。说明谁要动。
动作:转头、挑眉、挥爪。说明它做什么。
效果:固定镜头。说明观看位置不移动。
生成后播放两遍。第一遍看整体是否自然,第二遍观察:橘猫有没有按顺序转头、挑眉和挥爪,坐姿是否保持不变,镜头是否真的固定。
如果橘猫直接站起来或走开,而不是坐在原地挥爪,就把位置要求写清楚:
拟人橘猫始终靠坐在沙发上,身体不离开坐垫。它只缓慢转头看向镜头,抬起一边眉毛,再用右爪懒洋洋地挥一下。固定镜头。
这不是“越写越复杂”,而是在修正一个明确的问题。每次修改都应对应你实际看到的错误。
二、把动作写清楚:不要只写“它很不耐烦”
不耐烦”“得意”“疲惫”是情绪,但 AI 不一定知道一只拟人橘猫应该怎样表现。最好把情绪翻译成看得见的眼神、眉毛、耳朵、嘴角、尾巴和身体姿态。
更好用的办法是把情绪翻译成看得见的表情和肢体动作。
例如,不要只写