Kies een verscheidenheid aan stemmen voor deze video. Retourneer JSON {"voice":...", "emotion":...", "tempo":...", "accent": voice — stemtimbre, geslacht en leeftijd; emotion — emotie van presentatie; tempo — spreeksnelheid; accent - taal en uitspraakkarakter. Motiveer elk veld voor de taak, niet abstract.
Mechanica: spraaksynthese vindt plaats in twee fasen. Eerst voorspelt het model prosodie (toonhoogte, duur van geluiden, pauzes, intonatie) en vervolgens verandert de vocoder dit in een geluidsgolf. Dezelfde tekst klinkt anders omdat het model de emotie en het ritme raadt op basis van interpunctie, hoofdletters en opgegeven parameters. Jouw hefbomen: timbre (man/vrouw/neutraal), leeftijd, emotie, tempo, taal en accent. Insider: het is betrouwbaarder om een emotie niet te definiëren met het woord 'vrolijk', maar met een contextopmerking en correcte interpunctie - een punt kalmeert, een weglatingsteken trekt, een uitroep verhoogt de energie. Tweede inzicht: gebruik voor reclame een stem die 10-15% sneller is dan comfortabel - tijdens het bewerken klinkt langzame spraak traag. Beginnersfout: zoeken naar één “universele aangename stem” voor alles. Een stem is een casting: een verteller voor een audioboek zal een dynamische video vermoorden, en een opgewekte verkoper zal geen meditatie voorlezen.