LearnAI
モジュール 7 · AI 品質スコア (プロ) · レッスン 1/5
← カタログへ
タスク

テストセット (評価セット)

評価キットの組み立て方法とその理由? JSON {"steps": [2 つ以上のステップのリスト], "why": "short"} を返します。

アクセスのロックを解除して、AI による即時レビューのためにソリューションを送信します。無料で始める
AI品質基盤
💡 理論の一部

評価セットは、期待される結果を含む代表的な例のセットであり、各変更の前にシステムを実行します。それがなければ、プロンプトの改善は占いのようなものです。1 件は修正され、5 件は静かに壊れました。収集方法: 典型的なケースと特殊なケースをカバーする実際の (または実際に近い) 入力を取得します。彼らの正しい答えまたは受け入れられる答えを記録します。各編集の前後にセット全体を実行し、完了率を比較します。たとえ 20 ~ 50 個の良い例であっても、開発は根本的に変わります - 後退が目に見えます。ルール: 評価用のセットがなければ、システムは改善されず、エラーを場所から場所へ移動するだけになります。

どのように評価されますか? 合格 70

  • 1周囲にテキストのない有効な JSON30%
  • 2配列 steps と why があります35%
  • 32 つ以上のステップ: 例を収集し、回答を記録し、前後に実行します。35%
あなたのプロンプトClaude ⌄