Como reduzir custos sem matar a qualidade? Retorne JSON {"tactics": [lista de mais de 2 técnicas], "why": "brevemente"}.
As chamadas de IA custam dinheiro para cada token – em um fluxo, este é o principal item de despesa do produto. O esquema ingênuo “conduzimos tudo através do modelo mais poderoso” está em ruínas. Alavancas de economia: direcionar tarefas simples para um modelo barato/rápido e guardar o carro-chefe para tarefas complexas (roteamento); armazenar em cache respostas e prompts duplicados; limite max_tokens para que o modelo não se espalhe; cortar contexto extra no prompt (cada token extra equivale a dinheiro para cada solicitação); solicitações de grupo (lote) sempre que possível. Regra: 80% das solicitações geralmente são simples – enviá-las pelo carro-chefe é um desperdício. Calcule o custo por 1.000 solicitações antes do lançamento.