Prepare una solicitud de transcripción de esta grabación. Devuelve JSON {"glossary":["..."],"speakers":"...","output_needs":"..."}: un glosario de nombres/términos para indicarle al modelo cómo marcar los hablantes y qué se necesita en la salida (códigos de tiempo, marcar lugares inciertos, etc.).
Transcripción: descifrar una grabación larga en texto. Debajo del capó, el modelo no sólo reconoce palabras, sino que también intenta separar a los hablantes (diarización) y organizar tiempos verbales. La precisión recae en tres cosas: nombres y términos desconocidos, discurso superpuesto (interrumpiéndose entre sí) y acentos o ruidos fuertes. De ahí el apalancamiento. La primera y más subestimada es darle al modelo un glosario de antemano: una lista de nombres de participantes, títulos y abreviaturas. Las palabras "presentadas" de antemano se reconocen con mucha más precisión que las palabras adivinadas desde cero. En segundo lugar, solicite marcas por oradores y por hora, para poder encontrar rápidamente el momento adecuado. Truco profesional: si la entrada es importante, solicite marcar los lugares inciertos con corchetes o un letrero; de esta manera podrá ver inmediatamente qué debe verificar, en lugar de confiar en el texto fluido, pero posiblemente erróneo. Insider: el 80% de la calidad de la transcripción está determinada por la calidad del sonido de entrada: un buen micrófono en el centro de la mesa es mejor que cualquier posprocesamiento. Un error típico de principiante es publicar una grabación de dos horas sin un solo nombre o contexto y luego limpiar docenas de errores manualmente.
Desbloquee el acceso para enviar soluciones para una revisión instantánea de la IA.