Choisissez une variété de voix pour cette vidéo. Renvoie JSON {"voice": "...", "emotion": "...", "tempo": "...", "accent": "..."} : voice — timbre de la voix, sexe et âge ; emotion — émotion de présentation ; tempo — débit de parole ; accent - langue et caractère de la prononciation. Justifiez chaque champ de la tâche, pas de manière abstraite.
Mécanique : la synthèse vocale se déroule en deux étapes. Tout d’abord, le modèle prédit la prosodie – hauteur, durée des sons, pauses, intonation – puis le vocodeur la transforme en onde sonore. Le même texte sonne différemment car le modèle devine l'émotion et le rythme à partir de la ponctuation, de la casse des lettres et des paramètres spécifiés. Vos leviers : timbre (masculin/féminin/neutre), âge, émotion, tempo, langue et accent. Insider : il est plus fiable de définir une émotion non pas avec le mot « joyeux », mais avec une remarque contextuelle et une ponctuation correcte - un point calme, des points de suspension tire, une exclamation augmente l'énergie. Deuxième idée : pour la publicité, utilisez une voix 10 à 15 % plus rapide que confortable - pendant le montage, une parole lente semble lente. Erreur du débutant : rechercher une « voix universelle agréable » pour tout. Une voix est un casting : un narrateur pour un livre audio tuera une vidéo dynamique, et un vendeur joyeux ne lira pas une méditation.