将您模糊的“咖啡视频”想法变成结构化的视频提示。返回 JSON: {"prompt":"一个主题和一个明确的动作","anchor":"固定构图和颜色的锚起始帧的描述","motion":"帧中存在什么样的运动(光,一)","duration":"持续时间(以秒为单位,简短)"}
生成器不会绘制整个“视频” - 它要么根据文本从噪声中展开帧,要么对起始图片进行动画处理,预测相邻帧之间像素的移动。因此,与静态的主要区别是:时间和运动是一个额外的维度,“漂移”很容易累积(面部漂浮,物体变形)。控制杆:短片(3-6秒),一个主题,一个清晰的动作。锚框 - 起始图像(来自图片模式) - 提前固定构图、颜色和脸部,减少不可预测性。 Insider:首先拍摄一个强烈的静态镜头,然后将其“动画化”——这样,即使在移动之前,您也可以控制约 80% 的结果。第二个技巧:让动作变得轻盈而单一(蒸汽上升或手倾倒——不是同时发生)。一个典型的新手错误:将三个动作和一个“史诗般的相机”塞进一个视频中 - 模型会将所有内容都弄成糊状并产生闪烁的缺陷。