Bagaimana cara mengurangi biaya tanpa mematikan kualitas? Kembalikan JSON {"tactics": [daftar 2+ teknik], "why": "singkat"}.
Panggilan AI membutuhkan biaya untuk setiap token—di aliran, ini adalah item pengeluaran utama produk. Skema naif “kami mendorong segalanya melalui model yang paling kuat” hancur. Pengungkit penghematan: mengarahkan tugas-tugas sederhana ke model yang murah/cepat, dan menyimpan tugas unggulan untuk model yang rumit (perutean); men-cache tanggapan dan perintah duplikat; batasi max_tokens agar model tidak menyebar; potong konteks tambahan di prompt (setiap token tambahan adalah uang untuk setiap permintaan); permintaan grup (batch) jika memungkinkan. Aturan: 80% permintaan biasanya sederhana - mengirimkannya melalui aplikasi unggulan adalah pemborosan. Hitung biaya per 1000 permintaan sebelum peluncuran.