Що не так із таким чанкінгом і як виправити? Поверни JSON {"problem": "проблема", "fix": "як виправити"}.
RAG починається з нарізки документів на шматки (чанки) - подати всю базу в контекст не можна (дорого і не влізе). Як ріжеш – так і знайдеться. Занадто великі чанки розмивають сенс і палять токени; дуже дрібні втрачають контекст (шматок пропозиції без опори). Хороша практика: різати по смислових кордонах (абзаци, розділи), а не наосліп за символами, і додавати перекриття (overlap) — щоб думка на стику двох чанків не губилася. До кожного чанка прикріплюють метадані (джерело, розділ) - для фільтрації та посилань. Поганий чанкінг - головна причина, чому "RAG не знаходить очевидне".