Подбери спеку голоса под этот ролик. Верни JSON {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — тембр, пол и возраст голоса; emotion — эмоция подачи; tempo — темп речи; accent — язык и характер произношения. Каждое поле обоснуй под задачу, а не абстрактно.
Кастинг AI-голоса под задачуМеханика: синтез речи идёт в два этапа. Сначала модель предсказывает просодию — высоту, длительность звуков, паузы, интонацию, — потом вокодер превращает это в звуковую волну. Один и тот же текст звучит по-разному, потому что модель угадывает эмоцию и ритм из пунктуации, регистра букв и заданных параметров. Твои рычаги: тембр (мужской/женский/нейтральный), возраст, эмоция, темп, язык и акцент. Инсайд: эмоцию надёжнее задавать не словом «весёлый», а контекстом-ремаркой и правильной пунктуацией — точка успокаивает, многоточие тянет, восклицание поднимает энергию. Второй инсайд: под рекламу бери голос на 10-15% быстрее комфортного — на монтаже медленная речь звучит вяло. Ошибка новичка: искать один «универсальный приятный голос» под всё. Голос — это кастинг: диктор для аудиокниги убьёт динамичный ролик, а бодрый продажник не прочитает медитацию.