Jak obniżyć koszty, nie zabijając jakości? Zwróć JSON {"tactics": [lista 2+ technik], "why": "krótko"}.
Wywołania AI kosztują każdy token – w strumieniu jest to główna pozycja wydatków produktu. Naiwny schemat „przejeżdżamy wszystko przez najpotężniejszy model” legnie w gruzach. Dźwignie oszczędzania: kieruj proste zadania do taniego/szybkiego modelu i zapisz okręt flagowy dla skomplikowanych (trasowanie); buforuj zduplikowane odpowiedzi i podpowiedzi; ogranicz max_tokens, aby model się nie rozprzestrzeniał; wytnij dodatkowy kontekst w monicie (każdy dodatkowy token to pieniądze za każde żądanie); żądania grupowe (wsadowe), jeśli to możliwe. Zasada: 80% żądań jest zazwyczaj prostych – wysyłanie ich przez flagowiec jest marnotrawstwem. Oblicz koszt na 1000 żądań przed uruchomieniem.