LearnAI
Modulo 14 · Applicazioni vocali e multimodali (Pro) · Lezione 1/5
← Al catalogo
Compito

Discorso al testo (STT)

Come incorporare il riconoscimento vocale? Restituisce JSON {"steps": [elenco di 2+ passaggi], "why": "breve"}.

Sblocca l'accesso per inviare soluzioni per la revisione istantanea dell'intelligenza artificiale.Inizia gratuitamente
Inserimento vocale nel prodotto
💡 Un pezzo di teoria

Il discorso al testo (STT, discorso al testo) trasforma l'audio in testo, che viene ulteriormente elaborato dal modello. Come incorporare: seleziona una modalità - streaming (trascrizione mentre avviene il discorso, per dialoghi dal vivo) o batch (caricamento di un file - testo ricevuto, per registrazioni); tenere conto dei fattori di precisione: rumore, accento, termini, lingua (spesso la lingua deve essere specificata esplicitamente); gestire gli errori di riconoscimento (STT commette errori, soprattutto su nomi e numeri - lascia che sia l'utente a controllare e correggere); passare il testo a LLM per il significato. STT è l'input, non la fine: la trascrizione grezza ha quasi sempre bisogno di essere ripulita o data un senso. Regola: STT fornisce il testo, ma non la comprensione: il modello segue il significato e monitora la qualità tramite il rumore, il linguaggio e il controllo degli errori.

Come viene valutato · superamento 70

  • 1JSON valido senza testo attorno30%
  • 2C'è un array steps e why35%
  • 32+ passaggi: modalità stream/batch, fattori di precisione, gestione degli errori, passaggio a LLM35%
Il tuo suggerimentoClaude ⌄