Come incorporare il riconoscimento vocale? Restituisce JSON {"steps": [elenco di 2+ passaggi], "why": "breve"}.
Il discorso al testo (STT, discorso al testo) trasforma l'audio in testo, che viene ulteriormente elaborato dal modello. Come incorporare: seleziona una modalità - streaming (trascrizione mentre avviene il discorso, per dialoghi dal vivo) o batch (caricamento di un file - testo ricevuto, per registrazioni); tenere conto dei fattori di precisione: rumore, accento, termini, lingua (spesso la lingua deve essere specificata esplicitamente); gestire gli errori di riconoscimento (STT commette errori, soprattutto su nomi e numeri - lascia che sia l'utente a controllare e correggere); passare il testo a LLM per il significato. STT è l'input, non la fine: la trascrizione grezza ha quasi sempre bisogno di essere ripulita o data un senso. Regola: STT fornisce il testo, ma non la comprensione: il modello segue il significato e monitora la qualità tramite il rumore, il linguaggio e il controllo degli errori.