Bu video için çeşitli sesler seçin. JSON'u döndür {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — ses tınısı, cinsiyet ve yaş; emotion — sunum duygusu; tempo — konuşma hızı; accent - telaffuzun dili ve karakteri. Soyut olarak değil, her alanı görev için gerekçelendirin.
Mekanik: Konuşma sentezi iki aşamada gerçekleşir. İlk olarak model, prozodiyi (seslerin perdesini, süresini, duraklamaları, tonlamayı) tahmin eder, ardından ses kodlayıcı bunu bir ses dalgasına dönüştürür. Aynı metin farklı geliyor çünkü model duyguyu ve ritmi noktalama işaretlerinden, büyük/küçük harften ve belirtilen parametrelerden tahmin ediyor. Kaldıraçlarınız: tını (erkek/kadın/nötr), yaş, duygu, tempo, dil ve aksan. İçeriden bilgi: Bir duyguyu "neşeli" kelimesiyle değil, bağlamsal bir açıklama ve doğru noktalama işaretiyle tanımlamak daha güvenilirdir - nokta sakinleşir, üç nokta çeker, ünlem enerjiyi yükseltir. İkinci bilgi: Reklamcılık için rahat sesten %10-15 daha hızlı bir ses kullanın; düzenleme sırasında yavaş konuşma yavaş gelir. Yeni başlayanların hatası: Her şey için tek bir "evrensel hoş ses" aramak. Ses bir oyuncu seçimidir: Sesli kitabın anlatıcısı dinamik bir videoyu sonlandıracaktır ve neşeli bir satıcı meditasyon okumayacaktır.