LearnAI
Modul 14 · Sprach- und multimodale Anwendungen (Pro) · Lektion 1/5
← Zum Katalog
Aufgabe

Speech to Text (STT)

Wie binde ich die Spracherkennung ein? Geben Sie JSON zurück {"steps": [Liste von 2+ Schritten], "why": "short"}.

Schalten Sie den Zugriff frei, um Lösungen zur sofortigen KI-Überprüfung einzureichen.Starten Sie kostenlos
Spracheingabe im Produkt
💡 Ein Stück Theorie

Speech to Text (STT, Speech-to-Text) wandelt Audio in Text um, der vom Modell weiterverarbeitet wird. So binden Sie ein: Wählen Sie einen Modus aus – Streaming (Transkription während der Rede, für Live-Dialoge) oder Batch (Hochladen einer Datei – empfangener Text, für Aufzeichnungen); Berücksichtigen Sie Genauigkeitsfaktoren – Lärm, Akzent, Begriffe, Sprache (oft muss die Sprache explizit angegeben werden); Umgang mit Erkennungsfehlern (STT macht Fehler, insbesondere bei Namen und Nummern – lassen Sie den Benutzer dies überprüfen und korrigieren); Geben Sie den Text zur Bedeutungsanalyse an LLM weiter. STT ist die Eingabe, nicht das Ende: Das Rohtranskript muss fast immer bereinigt oder verstanden werden. Regel: STT liefert den Text, aber nicht das Verständnis – das Modell folgt der Bedeutung und überwacht die Qualität durch Rauschen, Sprache und Fehlerprüfung.

Wie wird es bewertet · bestanden 70

  • 1Gültiges JSON ohne umgebenden Text30%
  • 2Es gibt ein Array steps und why35%
  • 32+ Schritte: Stream-/Batch-Modus, Genauigkeitsfaktoren, Fehlerbehandlung, Übergabe an LLM35%
Ihre AufforderungClaude ⌄