Đưa ra yêu cầu có thẩm quyền đầu tiên đối với AI “có tầm nhìn” bằng cách sử dụng ảnh này. Trả về JSON {"prompt"","goal"...","context"..."}: prompt — chính xác thì bạn đang HỎI AI (ví dụ: chính câu hỏi “biểu tượng này có nghĩa là gì?”), goal — KẾT QUẢ bạn muốn nhận được làm kết quả đầu ra (điều này khác với một câu hỏi: ví dụ: một lời giải thích và kết luận rõ ràng, liệu nó có thể lái xe an toàn không), context - điều quan trọng cần biết về AI, điều gì không nhìn thấy được trong ảnh (kiểu dáng/kiểu dáng của ô tô, thời điểm nó bốc cháy, v.v.).
“AI nhìn thấy” không phải là phép thuật. Mô hình chia hình ảnh thành hàng nghìn phần nhỏ và so sánh chúng với những gì nó “ghi nhớ” từ hàng triệu hình ảnh: hình dạng, văn bản, đồ vật, màu sắc. Kết quả là nó mô tả hình ảnh bằng các từ bên trong và sau đó hoạt động như với văn bản thông thường. Có hai kết luận từ điều này. Thứ nhất: hình ảnh càng rõ ràng (độ sắc nét, ánh sáng, toàn bộ vật thể trong khung hình), câu trả lời càng chính xác - giống như một người trong điều kiện ánh sáng yếu. Thứ hai: AI có thể tự tin mắc lỗi ở một chi tiết nhỏ nên bức ảnh không nên chỉ “ném đi” mà phải kèm theo câu hỏi và mục tiêu. Thủ thuật chuyên nghiệp: đừng hỏi mơ hồ “đây là cái gì?” Đưa ra vai trò và mục tiêu - “bạn là thợ sửa ô tô, hãy giải thích cho người mới biết lái xe có nguy hiểm hay không”. Thủ thuật ẩn: trước tiên hãy yêu cầu AI mô tả NHỮNG GÌ nó nhìn thấy trong bức ảnh, sau đó mới đưa ra kết luận - bằng cách này, bạn sẽ nắm bắt được lỗi nhận dạng trước khi tin vào lời khuyên. Một sai lầm điển hình của tân binh: đính kèm một bức ảnh mà không có bất kỳ dòng chữ nào và đợi người ta đọc được suy nghĩ. AI nhìn thấy các pixel nhưng không biết TẠI SAO bạn hiển thị bức ảnh đó.