Chọn nhiều giọng nói khác nhau cho video này. Trả về JSON {"voice""...","emotion"...","tempo"...","accent""..."}: voice — âm sắc giọng nói, giới tính và độ tuổi; emotion — cảm xúc khi trình bày; tempo - tốc độ nói; accent - ngôn ngữ và đặc điểm phát âm. Căn chỉnh từng trường cho nhiệm vụ, không trừu tượng.
Cơ học: tổng hợp tiếng nói xảy ra trong hai giai đoạn. Đầu tiên, mô hình dự đoán giai điệu - cao độ, thời lượng của âm thanh, khoảng dừng, ngữ điệu - sau đó bộ phát âm sẽ biến điều này thành sóng âm thanh. Cùng một văn bản có âm thanh khác nhau vì mô hình đoán cảm xúc và nhịp điệu từ dấu câu, kiểu chữ và các tham số được chỉ định. Đòn bẩy của bạn: âm sắc (nam/nữ/trung tính), tuổi tác, cảm xúc, nhịp độ, ngôn ngữ và giọng nói. Người trong cuộc: sẽ đáng tin cậy hơn khi xác định một cảm xúc không phải bằng từ “vui vẻ”, mà bằng một nhận xét theo ngữ cảnh và dấu câu chính xác - một dấu chấm êm dịu, một dấu chấm lửng kéo dài, một câu cảm thán tăng thêm năng lượng. Cái nhìn sâu sắc thứ hai: đối với quảng cáo, hãy sử dụng giọng nói nhanh hơn mức thoải mái 10-15% - trong quá trình chỉnh sửa, giọng nói chậm có vẻ chậm chạp. Sai lầm của người mới: tìm kiếm một “giọng nói dễ chịu phổ quát” cho mọi thứ. Giọng nói là sự đúc kết: người kể chuyện cho một cuốn sách nói sẽ giết chết một video sống động và một người bán hàng vui vẻ sẽ không đọc một bài thiền.