क्या मल्टीमॉडल एआई उपयुक्त है और यह क्या करेगा? JSON लौटाएं {"suitable": "हां या नहीं", "how": "आवेदन कैसे करें"}।
आधुनिक मॉडल केवल पाठ तक ही सीमित नहीं हैं - वे मल्टीमॉडल हैं: वे छवियों को समझते हैं, और कुछ ऑडियो और वीडियो को भी समझते हैं। आप मॉडल को रसीद की तस्वीर, त्रुटि का स्क्रीनशॉट, ग्राफ़, आरेख दिखा सकते हैं - और वह इसका वर्णन करेगी, डेटा निकालेगी और समझाएगी। हुड के नीचे, चित्र भी टोकन (दृश्य) में बदल जाता है और पाठ के समान संदर्भ में आ जाता है। यह उन कार्यों को खोलता है जो टेक्स्ट एआई के लिए दुर्गम हैं: हस्तलिखित नोट को पार्स करना, स्क्रीनशॉट से एक तालिका निकालना, यह समझना कि फोटो में क्या गलत है। मल्टीमॉडैलिटी एआई है जो दुनिया को देखती है, न कि सिर्फ उसके बारे में पढ़ती है।