قم بإملاء رسالة قصيرة (3-5 جمل)، ونطق علامات الترقيم وبنية صوتك، ثم أعط الأمر للتنظيف. إرجاع JSON {"raw_dictation":..."،"،cleanup_instruction":..."،"،result"::"..."}: إملاء أولي مع أوامر صوتية وتعليمات لتمشيط الشعر والنص النهائي النظيف.
الإملاء هو ترجمة الصوت إلى نص في الوقت الحقيقي. يسمع النموذج الصوت، ويتنبأ بالكلمات بناءً على صوت ومعنى الكلمات المجاورة، لذلك يتم التعرف على الكلام المتماسك بشكل أكثر دقة من الأجزاء المتعرجة. إنها لا تضع دائمًا علامات الترقيم بنفسها - يمكن نطقها بصوت عالٍ: "فاصلة"، "نقطة"، "سطر جديد"، "فقرة". هذه هي الرافعة الأولى: قم بإملاء البنية بصوت عالٍ، وسيكون الناتج نصًا نهائيًا، وليس نصًا مستمرًا. الرافعة الثانية هي الأكثر أهمية - لا تحاول الإملاء بشكل خالص. فمن الأسرع أن تقول الفكرة كما هي، مع التحفظات والتكرار، ثم اسأل الذكاء الاصطناعي بأمر واحد: "أزل التكرار، ومشط شعرك، واترك المعنى". الصوت يعطي الحجم والسرعة، والنموذج يعطي النقاء. المطلع: الإملاء في أجزاء طويلة بدلاً من كلمة واحدة في كل مرة - يساعد السياق في التعرف وزيادة الدقة. الخطأ النموذجي هو الإملاء في مكان صاخب بصوت القفز ثم تتفاجأ بالأخطاء؛ حتى مستوى الصوت والميكروفون القريب يفعلان أكثر من أي إعداد. وتحقق دائمًا من الأرقام والأسماء - فالنموذج يربكهم في أغلب الأحيان.
فتح إمكانية الوصول لإرسال الحلول لمراجعة الذكاء الاصطناعي الفورية.