Hoe spraakherkenning insluiten? Retourneer JSON {"steps": [lijst met meer dan 2 stappen], "why": "short"}.
Spraak naar tekst (STT, spraak-naar-tekst) zet audio om in tekst, die verder door het model wordt verwerkt. Hoe in te sluiten: selecteer een modus - streaming (transcriptie terwijl spraak plaatsvindt, voor live dialoog) of batch (een bestand geüpload - ontvangen tekst, voor opnames); houd rekening met nauwkeurigheidsfactoren - ruis, accent, termen, taal (vaak moet de taal expliciet worden gespecificeerd); herkenningsfouten afhandelen (STT maakt fouten, vooral bij namen en nummers - laat de gebruiker dit controleren en corrigeren); geef de tekst door aan LLM voor betekenis. STT is de input, niet het einde: het ruwe transcript moet bijna altijd worden opgeschoond of begrijpelijk gemaakt. Regel: STT geeft de tekst, maar niet het begrip - het model volgt de betekenis en bewaakt de kwaliteit door ruis, taal en foutcontrole.