이 청킹에 어떤 문제가 있으며 어떻게 해결할 수 있나요? JSON {"problem": "문제", "fix": "수정 방법"}을 반환합니다.
RAG는 문서를 조각(덩어리)으로 나누는 것부터 시작합니다. 전체 데이터베이스를 컨텍스트에 넣는 것은 불가능합니다(비용이 많이 들고 적합하지 않습니다). 자르는 대로 발견될 것이다. 너무 큰 덩어리는 의미를 흐리게 하고 토큰을 태워버립니다. 너무 작으면 맥락을 잃습니다(지원이 없는 문장의 일부). 모범 사례: 문자에 따라 맹목적으로가 아니라 의미론적 경계(문단, 섹션)를 따라 잘라내고 두 청크의 교차점에서 아이디어가 손실되지 않도록 오버랩(겹침)을 추가합니다. 필터링 및 참조를 위해 메타데이터(소스, 섹션)가 각 청크에 첨부됩니다. 잘못된 청킹은 "RAG가 명백한 것을 찾지 못하는" 주된 이유입니다.