هل الذكاء الاصطناعي متعدد الوسائط مناسب وماذا سيفعل؟ إرجاع JSON {"suitable": "yes or no"، "how": "كيفية التقديم"}.
لا تقتصر النماذج الحديثة على النص - فهي متعددة الوسائط: فهي تفهم الصور، وبعضها يفهم أيضًا الصوت والفيديو. يمكنك أن تُظهر للنموذج صورة إيصال، ولقطة شاشة لخطأ، ورسم بياني، ورسم تخطيطي - وسوف تصفها، وتستخرج البيانات، وتشرحها. وتحت الغطاء، تتحول الصورة أيضًا إلى رموز (مرئية) وتندرج في نفس سياق النص. يؤدي هذا إلى فتح المهام التي لا يمكن الوصول إليها بواسطة الذكاء الاصطناعي النصي: تحليل ملاحظة مكتوبة بخط اليد، وسحب جدول من لقطة الشاشة، وفهم الخطأ في الصورة. تعدد الوسائط هو الذكاء الاصطناعي الذي يرى العالم، وليس فقط يقرأ عنه.