كيفية تضمين التعرف على الكلام؟ إرجاع JSON {"steps": [قائمة تضم أكثر من خطوتين]، "why": "قصير"}.
تحويل الكلام إلى نص (STT، تحويل الكلام إلى نص) يحول الصوت إلى نص، والذي تتم معالجته بشكل أكبر بواسطة النموذج. كيفية التضمين: حدد الوضع - البث (النسخ أثناء حدوث الكلام، للحوار المباشر) أو الدفعي (تحميل ملف - النص المستلم، للتسجيلات)؛ تأخذ في الاعتبار عوامل الدقة - الضوضاء، اللهجة، المصطلحات، اللغة (في كثير من الأحيان يجب تحديد اللغة بشكل صريح)؛ التعامل مع أخطاء التعرف (ترتكب STT أخطاء، خاصة فيما يتعلق بالأسماء والأرقام - دع المستخدم يتحقق ويصحح)؛ قم بتمرير النص إلى LLM للحصول على المعنى. STT هي المدخلات، وليست النهاية: يحتاج النص الخام دائمًا إلى التنظيف أو الفهم. القاعدة: STT يعطي النص، ولكن ليس الفهم - النموذج يتبع المعنى، ويراقب الجودة عن طريق التحقق من الضوضاء واللغة والأخطاء.