LearnAI
Módulo 14 · Aplicaciones de voz y multimodales (Pro) · Lección 1/5
← Al catálogo
Tarea

Voz a texto (STT)

¿Cómo integrar el reconocimiento de voz? Devuelve JSON {"steps": [lista de más de 2 pasos], "why": "corto"}.

Desbloquee el acceso para enviar soluciones para una revisión instantánea de la IA.Empieza gratis
Entrada de voz en el producto.
💡 Un pedazo de teoría

La voz a texto (STT, voz a texto) convierte el audio en texto, que el modelo procesa posteriormente. Cómo incrustar: seleccione un modo: transmisión (transcripción a medida que se produce el habla, para diálogos en vivo) o por lotes (cargó un archivo - texto recibido, para grabaciones); tener en cuenta los factores de precisión: ruido, acento, términos, idioma (a menudo el idioma debe especificarse explícitamente); manejar errores de reconocimiento (STT comete errores, especialmente en nombres y números; deje que el usuario los revise y corrija); pase el texto a LLM para entender su significado. STT es el insumo, no el final: la transcripción sin procesar casi siempre necesita ser limpiada o darle sentido. Regla: STT proporciona el texto, pero no la comprensión: el modelo sigue el significado y controla la calidad mediante la comprobación del ruido, el lenguaje y los errores.

¿Cómo se evalúa · aprobado? 70

  • 1JSON válido sin texto alrededor30%
  • 2Hay una matriz steps y why35%
  • 3Más de 2 pasos: modo flujo/por lotes, factores de precisión, manejo de errores, pasar a LLM35%
Tu mensajeClaude ⌄