LearnAI
Модуль 14 · Голос и мультимодальные приложения (Pro) · Урок 1/5
Задача

Речь в текст (STT)

Как встроить распознавание речи? Верни JSON {"steps": [список из 2+ шагов], "why": "кратко"}.

Голосовой ввод в продукте
💡 Кусочек теории

Речь в текст (STT, speech-to-text) превращает аудио в текст, который дальше обрабатывает модель. Как встроить: выбрать режим — потоковый (транскрипция по мере речи, для живого диалога) или пакетный (загрузил файл — получил текст, для записей); учесть факторы точности — шум, акцент, термины, язык (часто язык нужно указать явно); обработать ошибки распознавания (STT ошибается, особенно на именах и числах — дай пользователю проверить и поправить); передать текст дальше в LLM за смыслом. STT — это вход, а не финал: сырой транскрипт почти всегда надо почистить или осмыслить. Правило: STT даёт текст, но не понимание — за смыслом идёт модель, а за качеством следи по шуму, языку и проверке ошибок.

Как оценивается · проходной 70

  • 1Валидный JSON без текста вокруг30%
  • 2Есть массив steps и why35%
  • 32+ шага: режим потоковый/пакетный, факторы точности, обработка ошибок, передать в LLM35%
Твой промптClaude ⌄
🔒

Открой доступ, чтобы отправлять решения на мгновенную AI-проверку.

Открыть полный доступ · $49