LearnAI
الوحدة 14 · التطبيقات الصوتية ومتعددة الوسائط (Pro) · درس 1/5
← إلى الكتالوج
مهمة

تحويل الكلام إلى نص (STT)

كيفية تضمين التعرف على الكلام؟ إرجاع JSON {"steps": [قائمة تضم أكثر من خطوتين]، "why": "قصير"}.

فتح إمكانية الوصول لإرسال الحلول لمراجعة الذكاء الاصطناعي الفورية.ابدأ مجانًا
الإدخال الصوتي في المنتج
💡قطعة نظرية

تحويل الكلام إلى نص (STT، تحويل الكلام إلى نص) يحول الصوت إلى نص، والذي تتم معالجته بشكل أكبر بواسطة النموذج. كيفية التضمين: حدد الوضع - البث (النسخ أثناء حدوث الكلام، للحوار المباشر) أو الدفعي (تحميل ملف - النص المستلم، للتسجيلات)؛ تأخذ في الاعتبار عوامل الدقة - الضوضاء، اللهجة، المصطلحات، اللغة (في كثير من الأحيان يجب تحديد اللغة بشكل صريح)؛ التعامل مع أخطاء التعرف (ترتكب STT أخطاء، خاصة فيما يتعلق بالأسماء والأرقام - دع المستخدم يتحقق ويصحح)؛ قم بتمرير النص إلى LLM للحصول على المعنى. STT هي المدخلات، وليست النهاية: يحتاج النص الخام دائمًا إلى التنظيف أو الفهم. القاعدة: STT يعطي النص، ولكن ليس الفهم - النموذج يتبع المعنى، ويراقب الجودة عن طريق التحقق من الضوضاء واللغة والأخطاء.

كيف يتم تقييمه · النجاح 70

  • 1JSON صالح بدون نص حوله30%
  • 2هناك مصفوفة steps و why35%
  • 3أكثر من خطوتين: وضع الدفق/الدفعة، وعوامل الدقة، ومعالجة الأخطاء، والتمرير إلى LLM35%
موجه الخاص بكClaude ⌄