LearnAI
Mô-đun 3 · Giọng nói, âm nhạc và âm thanh AI · Bài học 1/10
← Vào danh mục
Nhiệm vụ

Tổng hợp giọng nói và lựa chọn giọng nói

Chọn nhiều giọng nói khác nhau cho video này. Trả về JSON {"voice""...","emotion"...","tempo"...","accent""..."}: voice — âm sắc giọng nói, giới tính và độ tuổi; emotion — cảm xúc khi trình bày; tempo - tốc độ nói; accent - ngôn ngữ và đặc điểm phát âm. Căn chỉnh từng trường cho nhiệm vụ, không trừu tượng.

Mở khóa quyền truy cập để gửi giải pháp nhằm đánh giá AI ngay lập tức.Bắt đầu miễn phí
Truyền giọng nói AI cho một nhiệm vụ
💡 Một phần lý thuyết

Cơ học: tổng hợp tiếng nói xảy ra trong hai giai đoạn. Đầu tiên, mô hình dự đoán giai điệu - cao độ, thời lượng của âm thanh, khoảng dừng, ngữ điệu - sau đó bộ phát âm sẽ biến điều này thành sóng âm thanh. Cùng một văn bản có âm thanh khác nhau vì mô hình đoán cảm xúc và nhịp điệu từ dấu câu, kiểu chữ và các tham số được chỉ định. Đòn bẩy của bạn: âm sắc (nam/nữ/trung tính), tuổi tác, cảm xúc, nhịp độ, ngôn ngữ và giọng nói. Người trong cuộc: sẽ đáng tin cậy hơn khi xác định một cảm xúc không phải bằng từ “vui vẻ”, mà bằng một nhận xét theo ngữ cảnh và dấu câu chính xác - một dấu chấm êm dịu, một dấu chấm lửng kéo dài, một câu cảm thán tăng thêm năng lượng. Cái nhìn sâu sắc thứ hai: đối với quảng cáo, hãy sử dụng giọng nói nhanh hơn mức thoải mái 10-15% - trong quá trình chỉnh sửa, giọng nói chậm có vẻ chậm chạp. Sai lầm của người mới: tìm kiếm một “giọng nói dễ chịu phổ quát” cho mọi thứ. Giọng nói là sự đúc kết: người kể chuyện cho một cuốn sách nói sẽ giết chết một video sống động và một người bán hàng vui vẻ sẽ không đọc một bài thiền.

Nó được đánh giá như thế nào · đạt 70

  • 1JSON hợp lệ không có văn bản xung quanh nó30%
  • 2Có các trường voice, emotion, tempo, accent30%
  • 3Thông số kỹ thuật được điều chỉnh theo con lăn40%
Lời nhắc của bạnClaude ⌄