LearnAI
Модуль 3 · AI-голос, музыка и аудио · Урок 1/10
Задача

Синтез речи и выбор голоса

Подбери спеку голоса под этот ролик. Верни JSON {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — тембр, пол и возраст голоса; emotion — эмоция подачи; tempo — темп речи; accent — язык и характер произношения. Каждое поле обоснуй под задачу, а не абстрактно.

Кастинг AI-голоса под задачу
💡 Кусочек теории

Механика: синтез речи идёт в два этапа. Сначала модель предсказывает просодию — высоту, длительность звуков, паузы, интонацию, — потом вокодер превращает это в звуковую волну. Один и тот же текст звучит по-разному, потому что модель угадывает эмоцию и ритм из пунктуации, регистра букв и заданных параметров. Твои рычаги: тембр (мужской/женский/нейтральный), возраст, эмоция, темп, язык и акцент. Инсайд: эмоцию надёжнее задавать не словом «весёлый», а контекстом-ремаркой и правильной пунктуацией — точка успокаивает, многоточие тянет, восклицание поднимает энергию. Второй инсайд: под рекламу бери голос на 10-15% быстрее комфортного — на монтаже медленная речь звучит вяло. Ошибка новичка: искать один «универсальный приятный голос» под всё. Голос — это кастинг: диктор для аудиокниги убьёт динамичный ролик, а бодрый продажник не прочитает медитацию.

Как оценивается · проходной 70

  • 1Валидный JSON без текста вокруг30%
  • 2Есть поля voice, emotion, tempo, accent30%
  • 3Спека подогнана под ролик40%
Твой промптClaude ⌄
🔒

Открой доступ, чтобы отправлять решения на мгновенную AI-проверку.

Начать бесплатно