Jak osadzić rozpoznawanie mowy? Zwróć JSON {"steps": [lista ponad 2 kroków], "why": "krótki"}.
Mowa na tekst (STT, zamiana mowy na tekst) zamienia dźwięk na tekst, który jest dalej przetwarzany przez model. Jak osadzić: wybierz tryb - przesyłanie strumieniowe (transkrypcja w miarę pojawiania się mowy, w przypadku dialogów na żywo) lub wsadowe (przesłanie pliku - otrzymany tekst, w przypadku nagrań); wziąć pod uwagę czynniki dokładności - hałas, akcent, terminy, język (często język musi być wyraźnie określony); obsługiwać błędy rozpoznawania (STT popełnia błędy, szczególnie w nazwiskach i numerach - pozwól użytkownikowi sprawdzić i poprawić); przekaż tekst do LLM, aby nadać mu znaczenie. STT to wkład, a nie koniec: surowy transkrypcja prawie zawsze wymaga oczyszczenia i nadania mu sensu. Zasada: STT podaje tekst, ale nie zrozumienie - model podąża za znaczeniem i monitoruje jakość poprzez sprawdzanie szumu, języka i błędów.