Wat is er mis met deze chunking en hoe kan ik dit oplossen? Retourneer JSON {"problem": "probleem", "fix": "hoe op te lossen"}.
RAG begint met het opdelen van documenten in stukken (chunks) - het is onmogelijk om de hele database in context te plaatsen (het is duur en past niet). De manier waarop je het snijdt, zal gevonden worden. Te grote stukken vervagen de betekenis en verbranden tokens; te kleine woorden verliezen context (een stukje zin zonder ondersteuning). Goede praktijk: knip langs semantische grenzen (paragrafen, secties), en niet blindelings op basis van karakters, en voeg een overlap (overlap) toe zodat het idee op de kruising van twee delen niet verloren gaat. Metagegevens (bron, sectie) worden aan elk deel toegevoegd voor filtering en referenties. Slechte chunking is de belangrijkste reden waarom "RAG het voor de hand liggende niet vindt."