خذ المشهد بعيدا. إرجاع JSON {"subject":..."،"،action":..."،"،setting":..."،"،shot":..."،"،style":: "..."}: subject - من/ماذا، action - إجراء واحد، setting - أين ومتى، shot - الخطة والزاوية (إغلاق/متوسط/عام، مستوى الكاميرا)، style — النمط البصري.
تحتوي مطالبة الفيديو على هيكل عظمي، مثل فيلم ثابت. قم بتقسيمها إلى أجزاء: الموضوع (من/ماذا)، الفعل (ماذا يفعل)، البيئة (أين ومتى)، اللقطة (لقطة قريبة، متوسطة، عامة)، المنظور (مستوى العين، أعلى، أسفل)، الضوء والمزاج (غروب الشمس الدافئ، الصباح البارد)، الأسلوب (الواقعية، الألوان المائية، ثلاثي الأبعاد). تقرأ الشبكة العصبية الوصف مثل طلب المدير: كلما تمت تسمية كل جزء بدقة أكبر، قلّت اهتمامك به. التقنية الأساسية هي إجراء واحد لكل مشهد. "الطفل يطلق طائرة ورقية" سوف يستمر، ولكن "يركض، يقفز، يمسك، يضحك" سوف ينهار إلى قطع أثرية. التقنية الثانية: قم أولاً بوصف إطار ثابت كثيف، مثل الصورة الفوتوغرافية، وبعد ذلك فقط قم بإضافة الحركة - يبني النموذج أولاً تركيبة مستقرة، ثم يقوم بتحريكها. الخطأ النموذجي هو كتابة المشاعر بدلاً من الأفعال: "الغلاف الجوي" و "الملحمي" لا يفهمه النموذج جيدًا. استبدلها بشيء مرئي: "تقوم الكاميرا بالتكبير ببطء، وذرات من الغبار في شعاع الضوء". القاعدة بسيطة: إذا تعذر عرض الإجراء على الشاشة، فسيتجاهله النموذج.
فتح إمكانية الوصول لإرسال الحلول لمراجعة الذكاء الاصطناعي الفورية.