LearnAI
Módulo 3 · Voz, música y audio con IA · Lección 1/10
← Al catálogo
Tarea

Síntesis de voz y selección de voz.

Elija una variedad de voces para este video. Devuelve JSON {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — timbre de voz, género y edad; emotion — emoción de presentación; tempo — ritmo del habla; accent - idioma y carácter de pronunciación. Justifique cada campo para la tarea, no de manera abstracta.

Desbloquee el acceso para enviar soluciones para una revisión instantánea de la IA.Empieza gratis
Emitir una voz de IA para una tarea
💡 Un pedazo de teoría

Mecánica: la síntesis del habla se produce en dos etapas. Primero, el modelo predice la prosodia (tono, duración de los sonidos, pausas, entonación) y luego el vocoder la convierte en una onda sonora. El mismo texto suena diferente porque el modelo adivina la emoción y el ritmo a partir de la puntuación, las mayúsculas y minúsculas y los parámetros especificados. Tus palancas: timbre (masculino/femenino/neutral), edad, emoción, tempo, lenguaje y acento. Información privilegiada: es más confiable definir una emoción no con la palabra "alegre", sino con un comentario de contexto y la puntuación correcta: un punto calma, una elipsis tira, una exclamación aumenta la energía. Segunda idea: para publicidad, utilice una voz entre un 10 y un 15% más rápida de lo que le resulta cómodo; durante la edición, el habla lenta suena lenta. Error de principiante: buscar una “voz agradable universal” para todo. Una voz es un casting: un narrador de un audiolibro acabará con un vídeo dinámico y un vendedor alegre no leerá una meditación.

¿Cómo se evalúa · aprobado? 70

  • 1JSON válido sin texto alrededor30%
  • 2Hay campos voice, emotion, tempo, accent30%
  • 3La especificación se ajusta al rodillo.40%
Tu mensajeClaude ⌄