このチャンク化の何が問題なのでしょうか?どうすれば修正できますか? JSON {"problem": "問題", "fix": "修正方法"} を返します。
RAG は、ドキュメントを断片 (チャンク) に分割することから始まります。データベース全体をコンテキストに組み込むことは不可能です (コストが高く、適合しません)。切り方次第で、それは見つかるでしょう。チャンクが大きすぎると意味が曖昧になり、トークンが燃えてしまいます。小さすぎるとコンテキストが失われます(サポートのない文の一部)。良い実践例: 文字に従ってやみくもにではなく、意味上の境界 (段落、セクション) に沿って切り取り、2 つのチャンクの接合部のアイデアが失われないようにオーバーラップ (重複) を追加します。メタデータ (ソース、セクション) は、フィルタリングと参照のために各チャンクに添付されます。 「RAG が明白なものを見つけられない」主な理由は、不正なチャンク化です。