LearnAI
Модуль 5 · RAG глибоко (Pro) · Урок 1/6
← До каталогу
Завдання

Чанкінг: як різати документи

Що не так із таким чанкінгом і як виправити? Поверни JSON {"problem": "проблема", "fix": "як виправити"}.

Відкрий доступ, щоб надсилати рішення на миттєву AI-перевірку.Почати безкоштовно
Основа якісного RAG
💡 Шматок теорії

RAG починається з нарізки документів на шматки (чанки) - подати всю базу в контекст не можна (дорого і не влізе). Як ріжеш – так і знайдеться. Занадто великі чанки розмивають сенс і палять токени; дуже дрібні втрачають контекст (шматок пропозиції без опори). Хороша практика: різати по смислових кордонах (абзаци, розділи), а не наосліп за символами, і додавати перекриття (overlap) — щоб думка на стику двох чанків не губилася. До кожного чанка прикріплюють метадані (джерело, розділ) - для фільтрації та посилань. Поганий чанкінг - головна причина, чому "RAG не знаходить очевидне".

Як оцінюється · прохідний 70

  • 1Валідний JSON без тексту навколо30%
  • 2Є поля problem та fix35%
  • 3100 символів втрачають контекст; різати за змістом + overlap35%
Твій промптClaude ⌄