قم بتحويل فكرة "فيديو القهوة" الغامضة إلى مطالبة فيديو منظمة. إرجاع JSON: {"prompt": "موضوع واحد وإجراء واحد واضح"، "anchor": "وصف إطار البداية المرساة الذي يثبت التركيب واللون"، "motion": "ما نوع الحركة في الإطار (خفيف، واحد)"، "duration": "المدة بالثواني، باختصار"}
لا يرسم المولد "الفيديو" بأكمله - فهو إما ينشر الإطارات من الضوضاء بناءً على النص، أو يقوم بتحريك الصورة الأولية، ويتنبأ بحركة البكسل بين الإطارات المجاورة. ومن هنا الفرق الرئيسي عن الإحصائيات: الوقت والحركة هما بُعد إضافي حيث يتراكم "الانجراف" بسهولة (يطفو الوجه، ويتشوه الكائن). أدوات التحكم: مقطع قصير (3-6 ثوانٍ)، موضوع واحد، حركة واحدة واضحة. إطار التثبيت - الصورة الأولية (من وضع الصورة) - يعمل على إصلاح التركيب واللون والوجه مسبقًا، مما يقلل من عدم القدرة على التنبؤ. من الداخل: التقط أولاً لقطة ثابتة قوية، ثم "حركها" - وبهذه الطريقة يمكنك التحكم في 80% تقريبًا من النتيجة حتى قبل الحركة. التقنية الثانية: جعل الحركة خفيفة ومنفردة (يرتفع البخار أو تصب اليد - وليس دفعة واحدة). خطأ نموذجي للمبتدئين: حشر ثلاثة إجراءات و"كاميرا ملحمية" في مقطع فيديو واحد - سيشوه النموذج كل شيء إلى هريسة وينتج عنه عيبًا وامضًا.