Как обрабатывать изображения моделью? Верни JSON {"steps": [список из 2+ шагов], "why": "кратко"}.
AI видит изображениеМультимодальные модели принимают на вход изображение и работают с ним: извлекают данные из фото и документов, описывают содержимое, отвечают на вопросы по картинке. Как использовать: подать изображение и чёткий запрос («извлеки сумму и дату из чека, верни JSON»); просить структурированный вывод для машинной обработки; учитывать качество фото (размытость, наклон, свет бьют по точности) и просить модель помечать, если данные не читаются; проверять критичные значения (числа, суммы — модель может ошибиться). Это открывает автоматизацию там, где раньше нужен был ручной ввод с фото. Правило: vision извлекает данные из изображений, но качество фото и проверка важных чисел решают всё — не доверяй сумму из чека вслепую.