Escolha uma variedade de vozes para este vídeo. Return JSON {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — timbre de voz, gênero e idade; emotion — emoção de apresentação; tempo — velocidade de fala; accent - idioma e caráter de pronúncia. Justifique cada campo para a tarefa, não de forma abstrata.
Mecânica: a síntese da fala ocorre em duas etapas. Primeiro, o modelo prevê a prosódia – tom, duração dos sons, pausas, entonação – depois o vocoder transforma isso em uma onda sonora. O mesmo texto soa diferente porque o modelo adivinha a emoção e o ritmo a partir da pontuação, letras maiúsculas e parâmetros especificados. Suas alavancas: timbre (masculino/feminino/neutro), idade, emoção, ritmo, linguagem e sotaque. Insider: é mais confiável definir uma emoção não com a palavra “alegre”, mas com uma observação de contexto e pontuação correta - um ponto final acalma, uma reticência puxa, uma exclamação aumenta a energia. Segunda dica: para publicidade, use uma voz 10-15% mais rápida do que confortável - durante a edição, a fala lenta parece lenta. Erro de novato: procurar uma “voz universal agradável” para tudo. Uma voz é um casting: o narrador de um audiolivro matará um vídeo dinâmico e um vendedor alegre não lerá uma meditação.