【提示词创作第七十二节】用结构控制AI画面的构图、动作与运镜
怎么完美控制画面动作?
内容预览
教程内容
导语:怎么完美控制画面动作?
使用参考图生成新画面时,最常见的问题不是“模型没看懂”,而是“模型看得太多”。你原本只想借用参考图的机位和人物位置,模型却把颜色、服装、材质、光线甚至画风一并带进了结果。文字提示写得越多,各种要求之间还可能互相争夺控制权。
解决这类问题的关键,是把参考素材拆成不同职责:角色图负责人物身份和服装,风格图负责色彩与质感,深度图负责远近、轮廓与空间关系、动作。到了视频生成中,深度视频还能继续提供人物移动、遮挡变化和镜头运动的线索。每份素材只控制一个主要变量,模型更容易知道“什么要保留,什么要重新设计”。
不过,深度图经常被口语化地叫作“灰模”。这个叫法方便,却容易让人误以为只要把图片变成黑白,或者生成一张灰色的三维效果图,就能得到同样的控制。本节先把概念讲清,再给出可以直接使用的图片与视频提示词。
一、深度图到底是什么
深度图是一张记录画面远近关系的二维图。它的每个像素不再主要描述颜色,而是用不同数值表示该位置相对镜头的距离。为了便于观看,这些数值常被显示成黑、白、灰:一种常见约定是近处较白、远处较黑,也有工具使用相反规则。因此,使用前一定要确认当前工具的黑白方向,不能只凭肉眼猜测。
例图
从单张普通照片推测深度,叫作“单目深度估计”。“单目”就是只看一个镜头。由于输入没有真实距离数据,模型通常依靠透视、遮挡、物体大小和已有视觉经验来推测前后关系。得到的结果多半是“相对深度”:它能判断谁更近、谁更远,却不一定知道人物距离镜头究竟是1.5米还是2米。
这也是深度图适合创作控制、却不能冒充精密测量的原因。它能够把画面压缩成一种更干净的结构提示,帮助生成模型关注:
- 主体在画面中的位置