Як вбудувати розпізнавання мови? Поверни JSON {"steps": [список з 2+ кроків], "why": "коротко"}.
Мова на текст (STT, speech-to-text) перетворює аудіо на текст, який далі обробляє модель. Як вбудувати: вибрати режим - потоковий (транскрипція у міру мовлення, для живого діалогу) або пакетний (завантажив файл - отримав текст для записів); врахувати фактори точності - шум, акцент, терміни, мову (часто мову потрібно вказати явно); обробити помилки розпізнавання (STT помиляється, особливо на іменах і числах - дай користувачеві перевірити та поправити); передати текст далі в LLM за змістом. STT це вхід, а не фінал: сирий транскрипт майже завжди треба почистити або осмислити. Правило: STT дає текст, але не розуміння - за змістом йде модель, а за якістю слідкуй за шумом, мовою та перевіркою помилок.