Как оценивать моделью и где риск? Верни JSON {"how": "как устроить", "risk": "главный риск и как снизить"}.
Оценка в масштабеКогда ответы открытые и их много, оценку можно поручить самой модели: даёшь ей ответ, эталон или рубрику и просишь выставить балл с обоснованием. Это масштабирует оценку до тысяч примеров. Но у судьи есть слабости: он бывает предвзят (любит длинные и уверенные ответы), непоследователен, может ошибаться систематически. Риск снижают: чёткая рубрика с примерами хорошего и плохого; просьба дать обоснование ПЕРЕД оценкой; фиксированный формат вывода; периодическая сверка судьи с людьми на выборке. Правило: LLM-судья — ускоритель, а не истина в последней инстанции; калибруй его по людям.