Comment réduire les coûts sans tuer la qualité ? Renvoyez JSON {"tactics": [liste de 2+ techniques], "why": "brièvement"}.
Les appels d’IA coûtent de l’argent pour chaque jeton : sur un flux, il s’agit du principal poste de dépense du produit. Le schéma naïf selon lequel « nous conduisons tout via le modèle le plus puissant » est ruineux. Leviers d'économie : diriger les tâches simples vers un modèle bon marché/rapide, et conserver le produit phare pour les plus complexes (routage) ; mettre en cache les réponses et les invites en double ; limiter max_tokens pour que le modèle ne se propage pas ; supprimez le contexte supplémentaire dans l'invite (chaque jeton supplémentaire représente de l'argent pour chaque demande) ; demandes groupées (batch) lorsque cela est possible. Règle : 80 % des demandes sont généralement simples : les envoyer via le produit phare est un gaspillage. Calculez le coût pour 1 000 requêtes avant le lancement.