Convierta su vaga idea de “video de café” en un mensaje de video estructurado. Retornar JSON: {"prompt":"un tema y una acción clara","anchor":"descripción del fotograma inicial ancla que fija la composición y el color","motion":"qué tipo de movimiento hay en el fotograma (luz, uno)","duration":"duración en segundos, brevemente"}
El generador no dibuja el "video" completo: despliega fotogramas a partir del ruido basándose en el texto o anima la imagen inicial, prediciendo el movimiento de píxeles entre fotogramas adyacentes. De ahí la principal diferencia con la estática: el tiempo y el movimiento son una dimensión extra donde la “deriva” se acumula fácilmente (la cara flota, el objeto se deforma). Palancas de control: clip corto (3-6 segundos), un sujeto, una acción clara. El marco de anclaje, la imagen inicial (desde el modo de imagen), corrige la composición, el color y la cara de antemano, reduciendo la imprevisibilidad. Información privilegiada: primero haz un disparo estático fuerte y luego “anímalo”; de esta manera controlas ~80% del resultado incluso antes del movimiento. Segunda técnica: haga el movimiento ligero y único (el vapor sube O la mano vierte, no todo a la vez). Un error típico de un novato: meter tres acciones y una “cámara épica” en un solo vídeo; el modelo embarrará todo y producirá un defecto de parpadeo.