Hoe kunnen we de kosten verlagen zonder dat dit ten koste gaat van de kwaliteit? Retourneer JSON {"tactics": [lijst met meer dan 2 technieken], "why": "kort"}.
AI-oproepen kosten geld voor elk token. In een stream is dit de belangrijkste kostenpost van het product. Het naïeve plan ‘we sturen alles via het krachtigste model’ ruïneert. Besparingshendels: stuur eenvoudige taken naar een goedkoop/snel model en bewaar het vlaggenschip voor complexe taken (routing); dubbele antwoorden en aanwijzingen in het cachegeheugen opslaan; beperk max_tokens zodat het model zich niet verspreidt; verwijder extra context in de prompt (elk extra token is geld voor elk verzoek); groepsverzoeken (batch) waar mogelijk. Regel: 80% van de verzoeken is meestal eenvoudig - het verzenden ervan via het vlaggenschip is verspilling. Bereken de kosten per 1000 aanvragen vóór de lancering.