LearnAI
Moduł 14 · Aplikacje głosowe i multimodalne (Pro) · Lekcja 1/5
← Do katalogu
Zadanie

Mowa na tekst (STT)

Jak osadzić rozpoznawanie mowy? Zwróć JSON {"steps": [lista ponad 2 kroków], "why": "krótki"}.

Odblokuj dostęp, aby przesyłać rozwiązania do natychmiastowej oceny AI.Zacznij za darmo
Wprowadzanie głosowe w produkcie
💡 Kawałek teorii

Mowa na tekst (STT, zamiana mowy na tekst) zamienia dźwięk na tekst, który jest dalej przetwarzany przez model. Jak osadzić: wybierz tryb - przesyłanie strumieniowe (transkrypcja w miarę pojawiania się mowy, w przypadku dialogów na żywo) lub wsadowe (przesłanie pliku - otrzymany tekst, w przypadku nagrań); wziąć pod uwagę czynniki dokładności - hałas, akcent, terminy, język (często język musi być wyraźnie określony); obsługiwać błędy rozpoznawania (STT popełnia błędy, szczególnie w nazwiskach i numerach - pozwól użytkownikowi sprawdzić i poprawić); przekaż tekst do LLM, aby nadać mu znaczenie. STT to wkład, a nie koniec: surowy transkrypcja prawie zawsze wymaga oczyszczenia i nadania mu sensu. Zasada: STT podaje tekst, ale nie zrozumienie - model podąża za znaczeniem i monitoruje jakość poprzez sprawdzanie szumu, języka i błędów.

Jak jest oceniane · zaliczenie 70

  • 1Prawidłowy JSON bez tekstu wokół niego30%
  • 2Istnieje tablica steps i why35%
  • 3Ponad 2 kroki: tryb strumieniowy/wsadowy, współczynniki dokładności, obsługa błędów, przejście do LLM35%
Twoja zachętaClaude ⌄