Как снизить стоимость, сохранив ответы по инструкции? Верни JSON {"approach": "пихать всё в контекст или RAG-выборку", "why": "кратко"}.
Экономика токеновЗа работу с моделью платят по токенам — и входным, и выходным. Чем больше подаёшь в контекст, тем дороже каждый запрос и тем медленнее ответ. Пихать в каждый запрос огромный документ — расточительно и упирается в лимит окна. Экономный подход: не подавать всё, а доставать только релевантные куски (через семантический поиск/RAG) и класть в контекст лишь их. Так ты платишь за небольшой релевантный контекст, а не за 300 страниц каждый раз. Правило: большие знания — не в промпт целиком, а через выборку по запросу.