Comment embarquer la reconnaissance vocale ? Renvoyez JSON {"steps": [liste de plus de 2 étapes], "why": "short"}.
La parole en texte (STT, parole en texte) transforme l'audio en texte, qui est ensuite traité par le modèle. Comment intégrer : sélectionnez un mode - streaming (transcription au fur et à mesure de la parole, pour un dialogue en direct) ou par lots (téléchargement d'un fichier - texte reçu, pour les enregistrements) ; prendre en compte les facteurs de précision - bruit, accent, termes, langue (souvent la langue doit être spécifiée explicitement) ; gérer les erreurs de reconnaissance (STT fait des erreurs, notamment sur les noms et les numéros - laissez l'utilisateur vérifier et corriger) ; transmettre le texte à LLM pour obtenir du sens. STT est l'entrée, pas la fin : la transcription brute doit presque toujours être nettoyée ou donner un sens. Règle : STT donne le texte, mais pas la compréhension - le modèle suit le sens et surveille la qualité par le bruit, la langue et la vérification des erreurs.