इस फोटो का उपयोग करके "दृष्टिकोण" एआई के लिए पहला सक्षम अनुरोध करें। रिटर्न JSON {"prompt":"...","goal":"...","context":"..."}: prompt - आप AI से वास्तव में क्या पूछ रहे हैं (उदाहरण के लिए, प्रश्न स्वयं, "इस आइकन का क्या मतलब है?"), goal - आप आउटपुट के रूप में क्या परिणाम प्राप्त करना चाहते हैं (यह एक प्रश्न से अलग है: उदाहरण के लिए, एक स्पष्ट स्पष्टीकरण और निष्कर्ष, क्या सुरक्षित रूप से ड्राइव करना संभव है), context - एआई को जानना महत्वपूर्ण है, फोटो में क्या दिखाई नहीं दे रहा है (कार का निर्माण/मॉडल, जब उसमें आग लगी, आदि)।
"एआई देखता है" जादू नहीं है। मॉडल छवि को हजारों छोटे खंडों में विभाजित करता है और उनकी तुलना लाखों छवियों से "याद" के साथ करता है: आकार, पाठ, वस्तुएं, रंग। इसका परिणाम यह होता है कि यह अपने अंदर शब्दों के साथ चित्र का वर्णन करता है, और फिर सामान्य पाठ की तरह काम करता है। इससे दो निष्कर्ष निकलते हैं. पहला: तस्वीर जितनी साफ होगी (तीक्ष्णता, रोशनी, फ्रेम में पूरी वस्तु), उत्तर उतना ही सटीक होगा - जैसे खराब रोशनी में कोई व्यक्ति। दूसरा: एआई छोटे विवरणों में आत्मविश्वास से गलती कर सकता है, इसलिए तस्वीर को सिर्फ "फेंक" नहीं दिया जाना चाहिए, बल्कि एक प्रश्न और एक लक्ष्य के साथ होना चाहिए। प्रो ट्रिक: अस्पष्ट रूप से न पूछें "यह क्या है?" एक भूमिका और एक लक्ष्य दें - "आप एक कार मैकेनिक हैं, एक नौसिखिया को समझाएं कि क्या गाड़ी चलाना खतरनाक है।" छिपी हुई चाल: पहले एआई से यह बताने के लिए कहें कि वह फोटो में क्या देखता है, और उसके बाद ही निष्कर्ष निकालें - इस तरह आप सलाह पर विश्वास करने से पहले पहचान त्रुटि को पकड़ लेते हैं। एक सामान्य नौसिखिया गलती: बिना किसी पाठ के एक फोटो संलग्न करें और मन के पढ़ने की प्रतीक्षा करें। एआई पिक्सल देखता है, लेकिन यह नहीं जानता कि आपने चित्र क्यों दिखाया।