Разбери сцену по частям. Верни JSON {"subject":"...","action":"...","setting":"...","shot":"...","style":"..."}: subject — кто/что, action — ОДНО действие, setting — где и когда, shot — план и ракурс (крупный/средний/общий, уровень камеры), style — визуальный стиль.
У видео-промпта есть скелет, как у киношного кадра. Разложи его на части: субъект (кто/что), действие (что делает), окружение (где и когда), план (крупный, средний, общий), ракурс (уровень глаз, сверху, снизу), свет и настроение (тёплый закат, холодное утро), стиль (реализм, акварель, 3D). Нейросеть читает описание как режиссёрскую заявку: чем точнее названа каждая часть, тем меньше она додумывает за тебя. Ключевой приём — ОДНО действие на сцену. «Ребёнок запускает бумажный самолётик» удержится, а «бежит, прыгает, ловит, смеётся» развалится на артефакты. Второй приём: сначала опиши плотный статичный кадр, как фотографию, и только потом добавь движение — модель сперва строит устойчивую композицию, а затем оживляет её. Типичная ошибка — писать эмоции вместо действий: «атмосферно», «эпично» модель понимает плохо. Замени на видимое: «камера медленно наезжает, пылинки в луче света». Правило простое: если действие нельзя показать на экране, модель его проигнорирует.
Открой доступ, чтобы отправлять решения на мгновенную AI-проверку.