Desmonta la escena. Devuelve JSON {"subject":"...","action":"...","setting":"...","shot":"...","style":"..."}: subject - quién/qué, action - UNA acción, setting - dónde y cuándo, shot - plan y ángulo (cercano/medio/general, nivel de cámara), style—estilo visual.
Un mensaje de vídeo tiene un esqueleto, como una imagen fija de película. Divídalo en partes: sujeto (quién/qué), acción (qué está haciendo), entorno (dónde y cuándo), toma (primer plano, medio, general), perspectiva (al nivel de los ojos, arriba, abajo), luz y estado de ánimo (atardecer cálido, mañana fría), estilo (realismo, acuarela, 3D). La red neuronal lee la descripción como la petición de un director: cuanto más exactamente se nombra cada parte, menos piensa en ti. La técnica clave es UNA acción por escena. “Un niño lanza un avión de papel” se mantendrá, pero “corre, salta, atrapa, ríe” se desmoronará y se convertirá en artefactos. La segunda técnica: primero describe un marco estático denso, como una fotografía, y solo luego agrega movimiento: el modelo primero construye una composición estable y luego la anima. Un error típico es escribir emociones en lugar de acciones: el modelo no comprende bien "atmosférico", "épico". Reemplácelo con algo visible: "la cámara hace un acercamiento lento, motas de polvo en un haz de luz". La regla es simple: si una acción no se puede mostrar en pantalla, el modelo la ignorará.
Desbloquee el acceso para enviar soluciones para una revisión instantánea de la IA.