LearnAI
Модуль 7 · Оценка качества AI (Pro) · Урок 3/5
Задача

LLM как судья

Как оценивать моделью и где риск? Верни JSON {"how": "как устроить", "risk": "главный риск и как снизить"}.

Оценка в масштабе
💡 Кусочек теории

Когда ответы открытые и их много, оценку можно поручить самой модели: даёшь ей ответ, эталон или рубрику и просишь выставить балл с обоснованием. Это масштабирует оценку до тысяч примеров. Но у судьи есть слабости: он бывает предвзят (любит длинные и уверенные ответы), непоследователен, может ошибаться систематически. Риск снижают: чёткая рубрика с примерами хорошего и плохого; просьба дать обоснование ПЕРЕД оценкой; фиксированный формат вывода; периодическая сверка судьи с людьми на выборке. Правило: LLM-судья — ускоритель, а не истина в последней инстанции; калибруй его по людям.

Как оценивается · проходной 70

  • 1Валидный JSON без текста вокруг30%
  • 2Есть поля how и risk35%
  • 3how = ответ+рубрика→балл; risk = предвзятость судьи, снижается рубрикой и сверкой с людьми35%
Твой промптClaude ⌄
🔒

Открой доступ, чтобы отправлять решения на мгновенную AI-проверку.

Открыть полный доступ · $49