Come ridurre i costi senza uccidere la qualità? Restituisce JSON {"tactics": [elenco di 2+ tecniche], "why": "brevemente"}.
Le chiamate AI costano denaro per ciascun token: in uno streaming, questa è la voce di spesa principale del prodotto. L’ingenuo schema “guidamo tutto attraverso il modello più potente” crolla. Leve di risparmio: indirizzare compiti semplici a un modello economico/veloce e riservare l'ammiraglia per quelli complessi (routing); memorizzare nella cache risposte e prompt duplicati; limitare max_tokens in modo che il modello non si diffonda; tagliare il contesto extra nel prompt (ogni token extra è denaro per ogni richiesta); richieste di gruppo (batch) ove possibile. Regola: l'80% delle richieste sono generalmente semplici: inviarle tramite l'ammiraglia è uno spreco. Calcola il costo per 1000 richieste prima del lancio.