¿Cómo integrar el reconocimiento de voz? Devuelve JSON {"steps": [lista de más de 2 pasos], "why": "corto"}.
La voz a texto (STT, voz a texto) convierte el audio en texto, que el modelo procesa posteriormente. Cómo incrustar: seleccione un modo: transmisión (transcripción a medida que se produce el habla, para diálogos en vivo) o por lotes (cargó un archivo - texto recibido, para grabaciones); tener en cuenta los factores de precisión: ruido, acento, términos, idioma (a menudo el idioma debe especificarse explícitamente); manejar errores de reconocimiento (STT comete errores, especialmente en nombres y números; deje que el usuario los revise y corrija); pase el texto a LLM para entender su significado. STT es el insumo, no el final: la transcripción sin procesar casi siempre necesita ser limpiada o darle sentido. Regla: STT proporciona el texto, pero no la comprensión: el modelo sigue el significado y controla la calidad mediante la comprobación del ruido, el lenguaje y los errores.