評価キットの組み立て方法とその理由? JSON {"steps": [2 つ以上のステップのリスト], "why": "short"} を返します。
評価セットは、期待される結果を含む代表的な例のセットであり、各変更の前にシステムを実行します。それがなければ、プロンプトの改善は占いのようなものです。1 件は修正され、5 件は静かに壊れました。収集方法: 典型的なケースと特殊なケースをカバーする実際の (または実際に近い) 入力を取得します。彼らの正しい答えまたは受け入れられる答えを記録します。各編集の前後にセット全体を実行し、完了率を比較します。たとえ 20 ~ 50 個の良い例であっても、開発は根本的に変わります - 後退が目に見えます。ルール: 評価用のセットがなければ、システムは改善されず、エラーを場所から場所へ移動するだけになります。