LearnAI
Modul 14 · Aplikasi Suara dan Multimoda (Pro) · Pelajaran 1/5
← Ke katalog
Tugas

Pidato ke Teks (STT)

Bagaimana cara menyematkan pengenalan suara? Kembalikan JSON {"steps": [daftar 2+ langkah], "why": "short"}.

Buka kunci akses untuk mengirimkan solusi untuk peninjauan AI instan.Mulai secara gratis
Masukan suara ke dalam produk
💡 Sepotong teori

Ucapan ke teks (STT, ucapan ke teks) mengubah audio menjadi teks, yang selanjutnya diproses oleh model. Cara menyematkan: pilih mode - streaming (transkripsi saat ucapan terjadi, untuk dialog langsung) atau batch (mengunggah file - teks yang diterima, untuk rekaman); memperhitungkan faktor akurasi - kebisingan, aksen, istilah, bahasa (seringkali bahasa harus ditentukan secara eksplisit); menangani kesalahan pengenalan (STT membuat kesalahan, terutama pada nama dan nomor - biarkan pengguna memeriksa dan memperbaikinya); meneruskan teks ke LLM untuk mendapatkan maknanya. STT adalah masukan, bukan akhir: transkrip mentah hampir selalu perlu dibersihkan atau dipahami. Aturan: STT memberikan teks, tetapi bukan pemahaman - model mengikuti maknanya, dan memantau kualitas dengan pemeriksaan kebisingan, bahasa, dan kesalahan.

Bagaimana penilaiannya · kelulusan 70

  • 1JSON valid tanpa teks di sekitarnya30%
  • 2Ada larik steps dan why35%
  • 32+ langkah: mode streaming/batch, faktor akurasi, penanganan kesalahan, meneruskan ke LLM35%
Perintah AndaClaude ⌄