LearnAI
模块 7 · AI 质量得分(专业版) · 1/5
← 前往目录
任务

测试集(评估集)

如何组装评估套件以及为什么?返回 JSON {"steps": [2 个以上步骤的列表], "why": "short"}。

解锁提交解决方案以供即时 AI 审核的权限。免费开始
AI质量基础
💡 一个理论

评估集是一组具有预期结果的代表性示例,您在每次更改之前都在其上运行系统。没有它,改进提示就是算命:修复了一个案例,悄然打破了五个。如何收集:获取涵盖典型和边缘情况的真实(或接近真实)输入;为他们记录正确或可接受的答案;每次编辑之前和之后运行整个集合并比较完成率。即使 20-50 个好的例子也会从根本上改变发展——回归是可见的。规则:如果没有评估集,你就无法改进系统,而只能将错误从一个地方转移到另一个地方。

如何评估·通过 70

  • 1周围没有文本的有效 JSON30%
  • 2有一个数组steps和why35%
  • 32+ 步骤:收集示例、记录答案、之前/之后运行35%
您的提示Claude ⌄