이 사진을 사용하여 "시력이 있는" AI에게 첫 번째 유능한 요청을 하십시오. Return JSON {"prompt":"...","goal":"...","context":"..."}: prompt — AI에게 정확히 무엇을 묻고 있습니까(질문 자체, 예를 들어 "이 아이콘은 무엇을 의미합니까?"), goal — 출력으로 얻고자 하는 결과(이것은 질문과 다릅니다. 예를 들어 명확한 설명과 결론, 안전운전 가능할까), context - AI를 알아야 중요한 것, 사진에 보이지 않는 것(자동차 제조사/모델, 불이 붙었을 때 등).
“AI가 본다”는 것은 마술이 아닙니다. 모델은 이미지를 수천 개의 작은 섹션으로 분할하고 이를 모양, 텍스트, 개체, 색상 등 수백만 개의 이미지에서 "기억한" 것과 비교합니다. 그 결과, 그림 자체에 단어가 포함되어 그림을 설명하고 일반 텍스트와 마찬가지로 작동합니다. 이것으로부터 두 가지 결론이 나옵니다. 첫째, 그림이 더 선명할수록(선명도, 빛, 프레임의 전체 개체) 조명이 약한 사람처럼 대답이 더 정확해집니다. 둘째: AI는 작은 세부사항에서도 자신있게 실수를 할 수 있으므로 그림을 단순히 '던지는' 것이 아니라 질문과 목표를 동반해야 합니다. 전문가의 비결: 막연하게 "이게 뭐죠?"라고 묻지 마세요. 역할과 목표를 정하세요 - "당신은 자동차 정비사입니다. 운전이 위험한지 초보자에게 설명하세요." 숨겨진 트릭: 먼저 AI에게 사진에서 보는 내용을 설명하도록 요청한 다음 결론을 도출합니다. 이렇게 하면 조언을 믿기 전에 인식 오류를 잡을 수 있습니다. 전형적인 초보 실수: 문자 하나 없이 사진만 첨부하고 마음이 읽힐 때까지 기다리세요. AI는 픽셀을 보지만 사용자가 사진을 보여준 이유는 알 수 없습니다.