把场景拆开看一下。返回 JSON {"subject":"...","action":"...","setting":"...","shot":"...","style":"..."}: subject - 谁/什么,action - 一个操作,setting - 地点和时间, shot - 平面和角度(近/中/一般,相机水平),style—视觉风格。
视频提示有一个骨架,就像电影剧照一样。将其分解为几个部分:主题(谁/什么)、动作(他在做什么)、环境(地点和时间)、镜头(特写、中景、一般)、透视(眼睛水平、上方、下方)、光线和情绪(温暖的日落、寒冷的早晨)、风格(现实主义、水彩、3D)。神经网络就像导演的要求一样读取描述:每个部分的命名越准确,它为你思考的就越少。关键技术是每个场景一个动作。 “孩子发射纸飞机”会保留下来,但“跑、跳、接住、笑”会分解成文物。第二种技术:首先描述一个密集的静态框架,例如照片,然后才添加运动 - 模型首先构建稳定的构图,然后将其动画化。一个典型的错误是写情感而不是行为:模型很难理解“氛围”、“史诗”。用可见的东西代替它:“相机慢慢放大,一束光中的灰尘斑点。”规则很简单:如果某个动作无法显示在屏幕上,模型将忽略它。
解锁提交解决方案以供即时 AI 审核的权限。