LearnAI
Module 14 · Applications vocales et multimodales (Pro) · Leçon 1/5
← Vers le catalogue
Tâche

Parole en texte (STT)

Comment embarquer la reconnaissance vocale ? Renvoyez JSON {"steps": [liste de plus de 2 étapes], "why": "short"}.

Débloquez l’accès pour soumettre des solutions pour un examen instantané par l’IA.Commencez gratuitement
Saisie vocale dans le produit
💡 Un morceau de théorie

La parole en texte (STT, parole en texte) transforme l'audio en texte, qui est ensuite traité par le modèle. Comment intégrer : sélectionnez un mode - streaming (transcription au fur et à mesure de la parole, pour un dialogue en direct) ou par lots (téléchargement d'un fichier - texte reçu, pour les enregistrements) ; prendre en compte les facteurs de précision - bruit, accent, termes, langue (souvent la langue doit être spécifiée explicitement) ; gérer les erreurs de reconnaissance (STT fait des erreurs, notamment sur les noms et les numéros - laissez l'utilisateur vérifier et corriger) ; transmettre le texte à LLM pour obtenir du sens. STT est l'entrée, pas la fin : la transcription brute doit presque toujours être nettoyée ou donner un sens. Règle : STT donne le texte, mais pas la compréhension - le modèle suit le sens et surveille la qualité par le bruit, la langue et la vérification des erreurs.

Comment est-il évalué · réussite 70

  • 1JSON valide sans texte autour30%
  • 2Il existe un tableau steps et why35%
  • 32+ étapes : mode flux/batch, facteurs de précision, gestion des erreurs, passage au LLM35%
Votre inviteClaude ⌄