LearnAI
Модуль 14 · Голос та мультимодальні програми (Pro) · Урок 1/5
← До каталогу
Завдання

Мова в текст (STT)

Як вбудувати розпізнавання мови? Поверни JSON {"steps": [список з 2+ кроків], "why": "коротко"}.

Відкрий доступ, щоб надсилати рішення на миттєву AI-перевірку.Почати безкоштовно
Голосове введення у продукті
💡 Шматок теорії

Мова на текст (STT, speech-to-text) перетворює аудіо на текст, який далі обробляє модель. Як вбудувати: вибрати режим - потоковий (транскрипція у міру мовлення, для живого діалогу) або пакетний (завантажив файл - отримав текст для записів); врахувати фактори точності - шум, акцент, терміни, мову (часто мову потрібно вказати явно); обробити помилки розпізнавання (STT помиляється, особливо на іменах і числах - дай користувачеві перевірити та поправити); передати текст далі в LLM за змістом. STT це вхід, а не фінал: сирий транскрипт майже завжди треба почистити або осмислити. Правило: STT дає текст, але не розуміння - за змістом йде модель, а за якістю слідкуй за шумом, мовою та перевіркою помилок.

Як оцінюється · прохідний 70

  • 1Валідний JSON без тексту навколо30%
  • 2Є масив steps та why35%
  • 32+ кроки: режим потоковий/пакетний, фактори точності, обробка помилок, передати до LLM35%
Твій промптClaude ⌄