LearnAI
module3 · AI-stem, muziek en audio · Les 1/10
← Naar de catalogus
Taak

Spraaksynthese en stemselectie

Kies een verscheidenheid aan stemmen voor deze video. Retourneer JSON {"voice":...", "emotion":...", "tempo":...", "accent": voice — stemtimbre, geslacht en leeftijd; emotion — emotie van presentatie; tempo — spreeksnelheid; accent - taal en uitspraakkarakter. Motiveer elk veld voor de taak, niet abstract.

Ontgrendel toegang om oplossingen in te dienen voor onmiddellijke AI-beoordeling.Begin gratis
Een AI-stem casten voor een taak
💡Een stukje theorie

Mechanica: spraaksynthese vindt plaats in twee fasen. Eerst voorspelt het model prosodie (toonhoogte, duur van geluiden, pauzes, intonatie) en vervolgens verandert de vocoder dit in een geluidsgolf. Dezelfde tekst klinkt anders omdat het model de emotie en het ritme raadt op basis van interpunctie, hoofdletters en opgegeven parameters. Jouw hefbomen: timbre (man/vrouw/neutraal), leeftijd, emotie, tempo, taal en accent. Insider: het is betrouwbaarder om een ​​emotie niet te definiëren met het woord 'vrolijk', maar met een contextopmerking en correcte interpunctie - een punt kalmeert, een weglatingsteken trekt, een uitroep verhoogt de energie. Tweede inzicht: gebruik voor reclame een stem die 10-15% sneller is dan comfortabel - tijdens het bewerken klinkt langzame spraak traag. Beginnersfout: zoeken naar één “universele aangename stem” voor alles. Een stem is een casting: een verteller voor een audioboek zal een dynamische video vermoorden, en een opgewekte verkoper zal geen meditatie voorlezen.

Hoe wordt het beoordeeld · geslaagd 70

  • 1Geldige JSON zonder tekst eromheen30%
  • 2Er zijn velden voice, emotion, tempo, accent30%
  • 3De specificatie is aangepast aan de wals40%
Uw promptClaude ⌄