Apa yang salah dengan chunking ini dan bagaimana cara memperbaikinya? Kembalikan JSON {"problem": "masalah", "fix": "cara memperbaikinya"}.
RAG dimulai dengan memotong dokumen menjadi beberapa bagian (potongan) - tidak mungkin menempatkan seluruh database ke dalam konteksnya (mahal dan tidak muat). Cara Anda memotongnya, itu akan ditemukan. Potongan yang terlalu besar mengaburkan maknanya dan membakar token; yang terlalu kecil kehilangan konteksnya (sepotong kalimat tanpa dukungan). Praktik yang baik: potong sepanjang batas semantik (paragraf, bagian), dan tidak membabi buta menurut karakter, dan tambahkan tumpang tindih (overlap) agar gagasan di persimpangan dua bagian tidak hilang. Metadata (sumber, bagian) dilampirkan ke setiap potongan untuk pemfilteran dan referensi. Pengelompokan yang buruk adalah alasan utama mengapa "RAG tidak menemukan hal yang jelas".