LearnAI
الوحدة 3 · صوت الذكاء الاصطناعي والموسيقى والصوت · درس 1/10
← إلى الكتالوج
مهمة

تركيب الكلام واختيار الصوت

اختر مجموعة متنوعة من الأصوات لهذا الفيديو. إرجاع JSON {"voice":..."،"،emotion":..."،"،tempo":..."،"،accent"::..."}: voice - جرس الصوت والجنس والعمر؛ emotion — عاطفة العرض؛ tempo — معدل الكلام؛ accent - اللغة وطبيعة النطق. قم بتبرير كل حقل للمهمة، وليس بشكل مجرد.

فتح إمكانية الوصول لإرسال الحلول لمراجعة الذكاء الاصطناعي الفورية.ابدأ مجانًا
إرسال صوت الذكاء الاصطناعي لمهمة ما
💡قطعة نظرية

الميكانيكا: تركيب الكلام يحدث على مرحلتين. أولاً، يتنبأ النموذج بالعروض - درجة الصوت، ومدة الأصوات، والتوقف المؤقت، والتنغيم - ثم يقوم مشفر الصوت بتحويل ذلك إلى موجة صوتية. يبدو النص نفسه مختلفًا لأن النموذج يخمن العاطفة والإيقاع من علامات الترقيم وحالة الأحرف والمعلمات المحددة. روافعك: الجرس (ذكر/أنثى/محايد)، والعمر، والعاطفة، والإيقاع، واللغة، واللهجة. من الداخل: من الأكثر موثوقية تحديد المشاعر ليس من خلال كلمة "مبهجة"، ولكن من خلال ملاحظة السياق وعلامات الترقيم الصحيحة - تهدأ النقطة، وتسحب علامة الحذف، وتثير علامة التعجب الطاقة. البصيرة الثانية: بالنسبة للإعلان، استخدم صوتًا أسرع بنسبة 10-15% من الصوت المريح - أثناء التحرير، يبدو الكلام البطيء بطيئًا. خطأ المبتدئ: البحث عن "صوت عالمي لطيف" لكل شيء. الصوت هو عبارة عن صب: راوي الكتاب الصوتي سيقتل الفيديو الديناميكي، والبائع المبتهج لن يقرأ التأمل.

كيف يتم تقييمه · النجاح 70

  • 1JSON صالح بدون نص حوله30%
  • 2هناك حقول voice، emotion، tempo، accent30%
  • 3يتم تعديل المواصفات إلى الأسطوانة40%
موجه الخاص بكClaude ⌄