Przygotuj mówiącego awatara. Zwróć JSON {"avatar":"...","script":"...","emotion":"...","voice":"..."}: avatar - opis wyglądu i planu, script - replika 10-18 słów „jak to się mówi”, emotion - JEDNA emocja na replikę, voice — znak głosowy (barwa, tempo).
Mówiący awatar to dwa silniki w uprzęży: jeden tworzy twarz i mimikę, drugi synchronizuje usta z dźwiękiem (lip sync). Sieć neuronowa dzieli mowę na fonemy – małe dźwięki – i dobiera do nich kształt ust. Stąd główna zasada: pisz scenariusz JAK MÓWIĄ, a nie jak piszą. Krótkie frazy, proste słowa, bez długich fraz partycypacyjnych - w przeciwnym razie usta będą „żuć”, a brak synchronizacji będzie oczywisty. Mechanika mimiki: modelka odczytuje emocje z opisu i znaków interpunkcyjnych, dzięki czemu wyraźnie wskazuje nastrój („przyjazny, z lekkim uśmiechem”) i przerywane pauzy. Insider: zachowaj jedną emocję w każdym wierszu. Nagła zmiana „radości – złości – smutku” w ciągu trzech sekund zamienia twarz w nienaturalną maskę. Druga technika to około 2 słowa na sekundę: jeśli upchniesz dużo tekstu w krótkim klipie, synchronizacja ruchu warg zostanie zakłócona. Oblicz wcześniej długość lektora. Typowym błędem jest pisanie tekstu robotycznego ze skrótami i liczbami („ROI wzrósł o 27,4%”): model wymówi go krzywo. Rozszyfruj to słowami i przetestuj ze słuchu.
Odblokuj dostęp, aby przesyłać rozwiązania do natychmiastowej oceny AI.