एक बात करने वाला अवतार तैयार करें. रिटर्न JSON {"avatar":"...","script":"...","emotion":"...","voice":"..."}: avatar - उपस्थिति और योजना का विवरण, script - प्रतिकृति 10-18 शब्द "जैसा कि वे कहते हैं", emotion - प्रति प्रति एक भावना, voice - आवाज चरित्र (समय, गति)।
एक बात करने वाले अवतार में दो इंजन लगे होते हैं: एक चेहरे और चेहरे के भाव बनाता है, दूसरा होठों को ध्वनि के साथ सिंक्रनाइज़ करता है (लिप सिंक)। तंत्रिका नेटवर्क भाषण को स्वरों - छोटी ध्वनियों - में तोड़ता है और उनसे मेल खाने के लिए मुंह के आकार का चयन करता है। इसलिए मुख्य नियम: स्क्रिप्ट को वैसे लिखें जैसे वे कहते हैं, न कि जैसा वे लिखते हैं। छोटे वाक्यांश, सरल शब्द, लंबे सहभागी वाक्यांशों के बिना - अन्यथा होंठ "चबाने" लगेंगे और आउट-ऑफ-सिंक स्पष्ट हो जाएगा। चेहरे के भावों की यांत्रिकी: मॉडल विवरण और विराम चिह्नों से भावनाओं को पढ़ता है, इसलिए मूड को स्पष्ट रूप से इंगित करता है ("दोस्ताना, हल्की मुस्कान के साथ") और विराम चिह्न लगाता है। अंदरूनी सूत्र: प्रति पंक्ति एक भावना रखें। तीन सेकंड में "खुशी - गुस्सा - उदासी" का एक तेज बदलाव चेहरे को एक अप्राकृतिक मुखौटे में तोड़ देता है। दूसरी तकनीक लगभग 2 शब्द प्रति सेकंड है: यदि आप एक छोटी क्लिप में बहुत सारे टेक्स्ट को रटते हैं, तो लिप सिंक गड़बड़ हो जाएगा। वॉयसओवर की लंबाई की पहले से गणना करें। एक सामान्य गलती संक्षिप्ताक्षरों और संख्याओं ("आरओआई में 27.4% की वृद्धि") के साथ रोबोटिक पाठ लिखना है: मॉडल इसे टेढ़ा उच्चारण करेगा। इसे शब्दों में समझें और कान से परखें।
त्वरित एआई समीक्षा के लिए समाधान सबमिट करने के लिए एक्सेस अनलॉक करें।