LearnAI
Mô-đun 14 · Ứng dụng thoại và đa phương thức (Pro) · Bài học 1/5
← Vào danh mục
Nhiệm vụ

Lời nói thành văn bản (STT)

Làm thế nào để nhúng nhận dạng giọng nói? Trả về JSON {"steps": [danh sách hơn 2 bước], "why": "ngắn"}.

Mở khóa quyền truy cập để gửi giải pháp nhằm đánh giá AI ngay lập tức.Bắt đầu miễn phí
Nhập liệu bằng giọng nói trong sản phẩm
💡 Một phần lý thuyết

Lời nói thành văn bản (STT, lời nói thành văn bản) chuyển âm thanh thành văn bản, được mô hình xử lý thêm. Cách nhúng: chọn chế độ - phát trực tuyến (phiên âm khi lời nói xảy ra, đối với hội thoại trực tiếp) hoặc hàng loạt (tệp đã tải lên - văn bản đã nhận, để ghi âm); tính đến các yếu tố về độ chính xác - tiếng ồn, giọng điệu, thuật ngữ, ngôn ngữ (thường ngôn ngữ phải được chỉ định rõ ràng); xử lý các lỗi nhận dạng (STT mắc lỗi, nhất là về tên và số - để người dùng kiểm tra và sửa); chuyển văn bản sang LLM để tìm ý nghĩa. STT là đầu vào, không phải là kết thúc: bản ghi thô hầu như luôn cần được làm sạch hoặc hiểu rõ. Quy tắc: STT cung cấp văn bản nhưng không cung cấp sự hiểu biết - mô hình tuân theo ý nghĩa và giám sát chất lượng bằng cách kiểm tra tiếng ồn, ngôn ngữ và lỗi.

Nó được đánh giá như thế nào · đạt 70

  • 1JSON hợp lệ không có văn bản xung quanh nó30%
  • 2Có một mảng steps và why35%
  • 3Hơn 2 bước: chế độ truyền phát/hàng loạt, hệ số chính xác, xử lý lỗi, chuyển sang LLM35%
Lời nhắc của bạnClaude ⌄