LearnAI
Modül 14 · Ses ve Multimodal Uygulamalar (Pro) · Ders 1/5
← Kataloğa git
Görev

Metne Konuşma (STT)

Konuşma tanıma nasıl gömülür? JSON'u döndürün {"steps": [2+ adım listesi], "why": "kısa"}.

Anında yapay zeka incelemesi için çözüm gönderme erişiminin kilidini açın.Ücretsiz başlayın
Üründe ses girişi
💡 Bir parça teori

Konuşmayı metne (STT, konuşmayı metne dönüştürme), sesi metne dönüştürür ve bu, model tarafından daha da işlenir. Nasıl gömülür: bir mod seçin - akış (canlı diyalog için konuşma sırasında transkripsiyon) veya toplu (kayıtlar için bir dosya yüklendi - alınan metin); doğruluk faktörlerini dikkate alın - gürültü, aksan, terimler, dil (genellikle dil açıkça belirtilmelidir); tanıma hatalarını ele alın (STT, özellikle adlar ve numaralarda hata yapar - kullanıcının kontrol etmesine ve düzeltmesine izin verin); Metni anlam için LLM'ye iletin. STT girdidir, son değil: ham transkriptin neredeyse her zaman temizlenmesi veya anlamlandırılması gerekir. Kural: STT metni verir ancak anlayışı vermez; model anlamı takip eder ve kaliteyi gürültü, dil ve hata kontrolü ile izler.

Nasıl değerlendiriliyor · başarılı 70

  • 1Etrafında metin olmayan geçerli JSON30%
  • 2steps ve why dizisi var35%
  • 32+ adım: akış/toplu mod, doğruluk faktörleri, hata işleme, Yüksek Lisans'a geçiş35%
İsteminizClaude ⌄