LearnAI
Модуль 14 · Голос и мультимодальные приложения (Pro) · Урок 3/5
Задача

Картинка на вход (vision)

Как обрабатывать изображения моделью? Верни JSON {"steps": [список из 2+ шагов], "why": "кратко"}.

AI видит изображение
💡 Кусочек теории

Мультимодальные модели принимают на вход изображение и работают с ним: извлекают данные из фото и документов, описывают содержимое, отвечают на вопросы по картинке. Как использовать: подать изображение и чёткий запрос («извлеки сумму и дату из чека, верни JSON»); просить структурированный вывод для машинной обработки; учитывать качество фото (размытость, наклон, свет бьют по точности) и просить модель помечать, если данные не читаются; проверять критичные значения (числа, суммы — модель может ошибиться). Это открывает автоматизацию там, где раньше нужен был ручной ввод с фото. Правило: vision извлекает данные из изображений, но качество фото и проверка важных чисел решают всё — не доверяй сумму из чека вслепую.

Как оценивается · проходной 70

  • 1Валидный JSON без текста вокруг30%
  • 2Есть массив steps и why35%
  • 32+ шага: подать фото+чёткий запрос, структурированный вывод, учесть качество, проверить числа35%
Твой промптClaude ⌄
🔒

Открой доступ, чтобы отправлять решения на мгновенную AI-проверку.

Открыть полный доступ · $49