Wie binde ich die Spracherkennung ein? Geben Sie JSON zurück {"steps": [Liste von 2+ Schritten], "why": "short"}.
Speech to Text (STT, Speech-to-Text) wandelt Audio in Text um, der vom Modell weiterverarbeitet wird. So binden Sie ein: Wählen Sie einen Modus aus – Streaming (Transkription während der Rede, für Live-Dialoge) oder Batch (Hochladen einer Datei – empfangener Text, für Aufzeichnungen); Berücksichtigen Sie Genauigkeitsfaktoren – Lärm, Akzent, Begriffe, Sprache (oft muss die Sprache explizit angegeben werden); Umgang mit Erkennungsfehlern (STT macht Fehler, insbesondere bei Namen und Nummern – lassen Sie den Benutzer dies überprüfen und korrigieren); Geben Sie den Text zur Bedeutungsanalyse an LLM weiter. STT ist die Eingabe, nicht das Ende: Das Rohtranskript muss fast immer bereinigt oder verstanden werden. Regel: STT liefert den Text, aber nicht das Verständnis – das Modell folgt der Bedeutung und überwacht die Qualität durch Rauschen, Sprache und Fehlerprüfung.