Prepare um avatar falante. Return JSON {"avatar":"...","script":"...","emotion":"...","voice":"..."}: avatar - descrição da aparência e plano, script - réplica de 10 a 18 palavras "como eles dizem", emotion - UMA emoção por réplica, voice - personagem de voz (timbre, andamento).
Um avatar falante é composto por dois motores: um cria o rosto e as expressões faciais, o segundo sincroniza os lábios com o som (sincronização labial). A rede neural divide a fala em fonemas – pequenos sons – e seleciona o formato da boca que combina com eles. Daí a regra principal: escreva o roteiro como ELES DIZEM, não como eles escrevem. Frases curtas, palavras simples, sem frases participativas longas - caso contrário, os lábios “mastigarão” e a dessincronização será óbvia. Mecânica das expressões faciais: o modelo lê a emoção a partir da descrição e dos sinais de pontuação, indicando claramente o humor (“amigável, com leve sorriso”) e pontuando as pausas. Insider: mantenha uma emoção por linha. Uma mudança brusca de “alegria - raiva - tristeza” em três segundos transforma o rosto em uma máscara não natural. A segunda técnica envolve cerca de 2 palavras por segundo: se você colocar muito texto em um clipe curto, a sincronização labial ficará confusa. Calcule a duração da narração com antecedência. Um erro típico é escrever um texto robótico com abreviaturas e números (“ROI aumentou 27,4%”): o modelo irá pronunciá-lo torto. Decifre-o em palavras e teste-o de ouvido.
Desbloqueie o acesso para enviar soluções para análise instantânea de IA.