Підбери жар голосу під цей ролик. Поверни JSON {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — тембр, стать і вік голосу; emotion - емоція подачі; tempo - темп мовлення; accent - мова та характер вимови. Кожне поле обґрунтуй під завдання, а не абстрактно.
Механіка: синтез мови йде у два етапи. Спочатку модель передбачає просодію - висоту, тривалість звуків, паузи, інтонацію, - потім вокодер перетворює це на звукову хвилю. Один і той же текст звучить по-різному, тому що модель вгадує емоцію та ритм із пунктуації, регістру літер та заданих параметрів. Твої важелі: тембр (чоловічий/жіночий/нейтральний), вік, емоція, темп, мова та акцент. Інсайд: емоцію надійніше ставити не словом «веселий», а контекстом-ремаркою та правильною пунктуацією — крапка заспокоює, точить багато, вигук піднімає енергію. Другий інсайд: під рекламу бери голос на 10-15% швидше за комфортне — на монтажі повільна мова звучить мляво. Помилка новачка: шукати один «універсальний приємний голос» під усе. Голос – це кастинг: диктор для аудіокниги вб'є динамічний ролик, а бадьорий продажник не прочитає медитації.