قم بوصف مقطع فيديو قصير واحد. إرجاع JSON {"idea":..."،"،prompt":..."،"،duration":":"..."}: idea - فكرة في عبارة واحدة، prompt - وصف المشهد باستخدام الصيغة "موضوع + إجراء واحد + بيئة + مزاج"، duration - المدة بالثواني (رقم + "ثانية").
يعمل فيديو الذكاء الاصطناعي مثل الرسوم المتحركة السريعة جدًا: فقد شاهدت الشبكة العصبية ملايين مقاطع الفيديو وتعلمت التنبؤ بكيفية تغير وحدات البكسل من إطار إلى آخر. أنت تعطي النص - فهي تكمل الحركة. من المهم أن نفهم: هذا لا يعني لصق المقاطع الجاهزة معًا، ولكن إنشاء كل إطار من جديد، وبالتالي كلما كان الوصف أكثر وضوحًا، كانت الصورة أكثر استقرارًا. صيغة عمل الموجه الأول: موضوع + إجراء واحد + بيئة + مزاج. ليست "مدينة جميلة"، بل "صياد مسن يصلح شبكة على رصيف خشبي، ضباب الصباح". من الداخل: دائمًا ما يكون مقطع الفيديو القصير الذي تتراوح مدته من 3 إلى 5 ثوانٍ أكثر نظافة من الفيديو الطويل - حيث يتمكن النموذج من الحفاظ على منطق الحركة، ولا "تطفو" الأيدي والوجوه. خدعة أخرى: إجراء واحد لكل فيديو. فريقان متتاليان ("يمشي، ثم يجلس") يربكان النموذج، ويمزجهما في الهريسة. الخطأ النموذجي للمبتدئين هو التخلص من عشرة تفاصيل مرة واحدة: الطقس، ومجموعة من العناصر، وثلاثة أحرف. النموذج لن يحمل كل شيء. ابدأ بمشهد واحد واضح وشخصية واحدة، ثم قم بتعقيده.