Как встроить распознавание речи? Верни JSON {"steps": [список из 2+ шагов], "why": "кратко"}.
Голосовой ввод в продуктеРечь в текст (STT, speech-to-text) превращает аудио в текст, который дальше обрабатывает модель. Как встроить: выбрать режим — потоковый (транскрипция по мере речи, для живого диалога) или пакетный (загрузил файл — получил текст, для записей); учесть факторы точности — шум, акцент, термины, язык (часто язык нужно указать явно); обработать ошибки распознавания (STT ошибается, особенно на именах и числах — дай пользователю проверить и поправить); передать текст дальше в LLM за смыслом. STT — это вход, а не финал: сырой транскрипт почти всегда надо почистить или осмыслить. Правило: STT даёт текст, но не понимание — за смыслом идёт модель, а за качеством следи по шуму, языку и проверке ошибок.