LearnAI
Новинки AI · Видео и анимация · Bài học 7/10
← Vào danh mục
Nhiệm vụ

Hình đại diện nói chuyện và hát nhép

Chuẩn bị một avatar nói chuyện. Trả về JSON {"avatar""...","script"...","emotion"...","voice"..."}: avatar - mô tả về hình thức và sơ đồ, script - bản sao 10-18 từ "như họ nói", emotion - MỘT cảm xúc trên mỗi bản sao, voice — ký tự giọng nói (âm sắc, nhịp độ).

Mở khóa quyền truy cập để gửi giải pháp nhằm đánh giá AI ngay lập tức.
Phát thanh viên không quay phim
💡 Một phần lý thuyết

Hình đại diện biết nói là hai động cơ được khai thác: một động cơ tạo ra khuôn mặt và nét mặt, động cơ thứ hai đồng bộ hóa môi với âm thanh (đồng bộ môi). Mạng lưới thần kinh chia lời nói thành các âm vị - những âm thanh nhỏ - và chọn hình dạng của miệng để phù hợp với chúng. Do đó, nguyên tắc chính: viết kịch bản như HỌ NÓI, không phải như họ viết. Những cụm từ ngắn, những từ đơn giản, không có những cụm từ phân từ dài - nếu không môi sẽ “nhai” và sẽ thấy rõ sự không đồng bộ. Cơ chế biểu hiện trên khuôn mặt: người mẫu đọc được cảm xúc từ phần mô tả và dấu chấm câu, do đó chỉ ra rõ tâm trạng (“thân thiện, với một nụ cười nhẹ”) và ngắt quãng. Người trong cuộc: giữ một cảm xúc trên mỗi dòng. Sự thay đổi mạnh mẽ “vui - giận - buồn” trong ba giây khiến khuôn mặt trở thành một chiếc mặt nạ thiếu tự nhiên. Kỹ thuật thứ hai là khoảng 2 từ mỗi giây: nếu bạn nhồi nhét nhiều văn bản vào một đoạn clip ngắn, việc hát nhép sẽ bị rối. Tính toán trước độ dài của phần lồng tiếng. Một lỗi điển hình là viết văn bản tự động với các chữ viết tắt và số (“ROI tăng 27,4%”): mô hình sẽ phát âm nó một cách quanh co. Giải mã nó bằng lời và kiểm tra nó bằng tai.

Nó được đánh giá như thế nào · đạt 70

  • 1JSON hợp lệ không có văn bản xung quanh nó25%
  • 2Có các trường avatar, script, emotion, voice25%
  • 3Kịch bản “như họ nói” và có độ dài35%
  • 4Một cảm xúc trên mỗi dòng15%
Lời nhắc của bạnClaude ⌄
🔒

Mở khóa quyền truy cập để gửi giải pháp nhằm đánh giá AI ngay lập tức.