Làm thế nào để nhúng nhận dạng giọng nói? Trả về JSON {"steps": [danh sách hơn 2 bước], "why": "ngắn"}.
Lời nói thành văn bản (STT, lời nói thành văn bản) chuyển âm thanh thành văn bản, được mô hình xử lý thêm. Cách nhúng: chọn chế độ - phát trực tuyến (phiên âm khi lời nói xảy ra, đối với hội thoại trực tiếp) hoặc hàng loạt (tệp đã tải lên - văn bản đã nhận, để ghi âm); tính đến các yếu tố về độ chính xác - tiếng ồn, giọng điệu, thuật ngữ, ngôn ngữ (thường ngôn ngữ phải được chỉ định rõ ràng); xử lý các lỗi nhận dạng (STT mắc lỗi, nhất là về tên và số - để người dùng kiểm tra và sửa); chuyển văn bản sang LLM để tìm ý nghĩa. STT là đầu vào, không phải là kết thúc: bản ghi thô hầu như luôn cần được làm sạch hoặc hiểu rõ. Quy tắc: STT cung cấp văn bản nhưng không cung cấp sự hiểu biết - mô hình tuân theo ý nghĩa và giám sát chất lượng bằng cách kiểm tra tiếng ồn, ngôn ngữ và lỗi.