LearnAI
Modül 3 · AI ses, müzik ve ses · Ders 1/10
← Kataloğa git
Görev

Konuşma sentezi ve ses seçimi

Bu video için çeşitli sesler seçin. JSON'u döndür {"voice":"...","emotion":"...","tempo":"...","accent":"..."}: voice — ses tınısı, cinsiyet ve yaş; emotion — sunum duygusu; tempo — konuşma hızı; accent - telaffuzun dili ve karakteri. Soyut olarak değil, her alanı görev için gerekçelendirin.

Anında yapay zeka incelemesi için çözüm gönderme erişiminin kilidini açın.Ücretsiz başlayın
Bir görev için yapay zeka sesi yayınlama
💡 Bir parça teori

Mekanik: Konuşma sentezi iki aşamada gerçekleşir. İlk olarak model, prozodiyi (seslerin perdesini, süresini, duraklamaları, tonlamayı) tahmin eder, ardından ses kodlayıcı bunu bir ses dalgasına dönüştürür. Aynı metin farklı geliyor çünkü model duyguyu ve ritmi noktalama işaretlerinden, büyük/küçük harften ve belirtilen parametrelerden tahmin ediyor. Kaldıraçlarınız: tını (erkek/kadın/nötr), yaş, duygu, tempo, dil ve aksan. İçeriden bilgi: Bir duyguyu "neşeli" kelimesiyle değil, bağlamsal bir açıklama ve doğru noktalama işaretiyle tanımlamak daha güvenilirdir - nokta sakinleşir, üç nokta çeker, ünlem enerjiyi yükseltir. İkinci bilgi: Reklamcılık için rahat sesten %10-15 daha hızlı bir ses kullanın; düzenleme sırasında yavaş konuşma yavaş gelir. Yeni başlayanların hatası: Her şey için tek bir "evrensel hoş ses" aramak. Ses bir oyuncu seçimidir: Sesli kitabın anlatıcısı dinamik bir videoyu sonlandıracaktır ve neşeli bir satıcı meditasyon okumayacaktır.

Nasıl değerlendiriliyor · başarılı 70

  • 1Etrafında metin olmayan geçerli JSON30%
  • 2voice, emotion, tempo, accent alanları var30%
  • 3Spesifikasyon silindire göre ayarlanır40%
İsteminizClaude ⌄