Đảm nhận MỘT trong những nhiệm vụ thực sự của bạn (công việc hoặc gia đình) mà giọng nói của bạn có thể trợ giúp. Mô tả nó và chọn kỹ năng AI bằng giọng nói phù hợp. Trả về JSON {"task":","capability"...","why"..."}, trong đó capability là một trong: conversation (cuộc trò chuyện trực tiếp), dictation (chính tả), transcription (phiên âm), synthesis (tổng hợp giọng nói).
AI giọng nói có thể làm bốn việc khác nhau và nhầm lẫn chúng là sai lầm đầu tiên của người mới. Đầu tiên là một cuộc trò chuyện trực tiếp: bạn nói, trợ lý nghe và trả lời bằng giọng gần như không ngừng nghỉ, bạn có thể ngắt lời và làm rõ, giống như với một người đang nói chuyện điện thoại. Thứ hai là đọc chính tả: bài phát biểu của bạn chuyển thành văn bản, bạn nói thay vì gõ. Thứ ba, phiên âm: một đoạn ghi âm dài (cuộc họp, bài giảng) được phân tách thành văn bản, chia theo người nói. Thứ tư - tổng hợp giọng nói: văn bản được lồng tiếng bằng giọng tự nhiên với ngữ điệu mong muốn. Cơ chế rất đơn giản: mọi nơi ở giữa đều có một mô hình dịch âm thanh thành ý nghĩa và ngược lại. Thủ thuật chuyên nghiệp: đừng tự hỏi bản thân “cách sử dụng AI bằng giọng nói”, mà trước tiên hãy đặt tên cho nhiệm vụ rồi chọn kỹ năng cho nó. Đọc chính tả một lá thư - chính tả; hiểu cuộc gọi kéo dài hai giờ - phiên âm cộng với tóm tắt. Cái nhìn sâu sắc: giọng nói chiến thắng ở chỗ tay bận hoặc suy nghĩ dài hơn mức thuận tiện để gõ. Một sai lầm phổ biến là cố gắng đọc chính tả ngay lần đầu tiên; giọng nói mạnh mẽ như bản nháp, sau đó được AI làm sạch.