LearnAI
Новинки AI · Видео и анимация · درس 7/10
← إلى الكتالوج
مهمة

الحديث الرمزية ومزامنة الشفاه

قم بإعداد الصورة الرمزية الناطقة. إرجاع JSON {"avatar":..."،"،script":..."،"،emotion":..."،"،voice":"..."}: avatar - وصف المظهر والخطة، script - نسخة طبق الأصل من 10 إلى 18 كلمة "كما يقولون"، emotion - عاطفة واحدة لكل نسخة، voice - شخصية صوتية (جرس، وتيرة).

فتح إمكانية الوصول لإرسال الحلول لمراجعة الذكاء الاصطناعي الفورية.
مذيع بدون تصوير
💡قطعة نظرية

الصورة الرمزية الناطقة عبارة عن محركين: أحدهما يخلق الوجه وتعبيرات الوجه، والثاني يزامن الشفاه مع الصوت (مزامنة الشفاه). تقوم الشبكة العصبية بتقسيم الكلام إلى مقاطع صوتية - أصوات صغيرة - وتختار شكل الفم الذي يناسبها. ومن هنا القاعدة الأساسية: اكتب السيناريو كما يقولون، وليس كما يكتبون. عبارات قصيرة، كلمات بسيطة، بدون عبارات تشاركية طويلة - وإلا فإن الشفاه سوف "تمضغ" وسيكون عدم التزامن واضحًا. آليات تعابير الوجه: يقرأ النموذج المشاعر من الوصف وعلامات الترقيم، فيشير بوضوح إلى الحالة المزاجية ("ودود، بابتسامة خفيفة") وتوقفات متقطعة. المطلع: احتفظ بعاطفة واحدة في كل سطر. تغيير حاد في "فرح - غضب - حزن" في ثلاث ثواني يحوّل الوجه إلى قناع غير طبيعي. الأسلوب الثاني هو حوالي كلمتين في الثانية: إذا قمت بحشر الكثير من النص في مقطع قصير، فسيتم إفساد مزامنة الشفاه. احسب طول التعليق الصوتي مقدمًا. الخطأ النموذجي هو كتابة نص آلي يحتوي على اختصارات وأرقام ("زاد عائد الاستثمار بنسبة 27.4٪"): سينطقه النموذج بشكل ملتوي. فك تشفيرها بالكلمات واختبرها عن طريق الأذن.

كيف يتم تقييمه · النجاح 70

  • 1JSON صالح بدون نص حوله25%
  • 2هناك حقول avatar، script، emotion، voice25%
  • 3السيناريو "كما يقولون" وطوله35%
  • 4عاطفة واحدة في كل سطر15%
موجه الخاص بكClaude ⌄
🔒

فتح إمكانية الوصول لإرسال الحلول لمراجعة الذكاء الاصطناعي الفورية.