LearnAI
Новинки AI · Видео и анимация · पाठ 7/10
← कैटलॉग के लिए
काम

बात करने वाला अवतार और लिप सिंक

एक बात करने वाला अवतार तैयार करें. रिटर्न JSON {"avatar":"...","script":"...","emotion":"...","voice":"..."}: avatar - उपस्थिति और योजना का विवरण, script - प्रतिकृति 10-18 शब्द "जैसा कि वे कहते हैं", emotion - प्रति प्रति एक भावना, voice - आवाज चरित्र (समय, गति)।

त्वरित एआई समीक्षा के लिए समाधान सबमिट करने के लिए एक्सेस अनलॉक करें।
बिना फिल्मांकन के उद्घोषक
💡सिद्धांत का एक टुकड़ा

एक बात करने वाले अवतार में दो इंजन लगे होते हैं: एक चेहरे और चेहरे के भाव बनाता है, दूसरा होठों को ध्वनि के साथ सिंक्रनाइज़ करता है (लिप सिंक)। तंत्रिका नेटवर्क भाषण को स्वरों - छोटी ध्वनियों - में तोड़ता है और उनसे मेल खाने के लिए मुंह के आकार का चयन करता है। इसलिए मुख्य नियम: स्क्रिप्ट को वैसे लिखें जैसे वे कहते हैं, न कि जैसा वे लिखते हैं। छोटे वाक्यांश, सरल शब्द, लंबे सहभागी वाक्यांशों के बिना - अन्यथा होंठ "चबाने" लगेंगे और आउट-ऑफ-सिंक स्पष्ट हो जाएगा। चेहरे के भावों की यांत्रिकी: मॉडल विवरण और विराम चिह्नों से भावनाओं को पढ़ता है, इसलिए मूड को स्पष्ट रूप से इंगित करता है ("दोस्ताना, हल्की मुस्कान के साथ") और विराम चिह्न लगाता है। अंदरूनी सूत्र: प्रति पंक्ति एक भावना रखें। तीन सेकंड में "खुशी - गुस्सा - उदासी" का एक तेज बदलाव चेहरे को एक अप्राकृतिक मुखौटे में तोड़ देता है। दूसरी तकनीक लगभग 2 शब्द प्रति सेकंड है: यदि आप एक छोटी क्लिप में बहुत सारे टेक्स्ट को रटते हैं, तो लिप सिंक गड़बड़ हो जाएगा। वॉयसओवर की लंबाई की पहले से गणना करें। एक सामान्य गलती संक्षिप्ताक्षरों और संख्याओं ("आरओआई में 27.4% की वृद्धि") के साथ रोबोटिक पाठ लिखना है: मॉडल इसे टेढ़ा उच्चारण करेगा। इसे शब्दों में समझें और कान से परखें।

इसका मूल्यांकन कैसे किया जाता है · उत्तीर्ण होना 70

  • 1इसके चारों ओर पाठ के बिना मान्य JSON25%
  • 2फ़ील्ड avatar, script, emotion, voice हैं25%
  • 3स्क्रिप्ट "जैसा वे कहते हैं" और लंबाई में35%
  • 4प्रति पंक्ति एक भावना15%
आपका संकेतClaude ⌄
🔒

त्वरित एआई समीक्षा के लिए समाधान सबमिट करने के लिए एक्सेस अनलॉक करें।