1. Samakan model dengan tingkat kesulitan
Sumber pemborosan nomor satu: flagship untuk tugas ringan. Pisahkan traffic: model hemat untuk FAQ dan klasifikasi, flagship hanya untuk penalaran berat. Penghematan tipikal: 50–80% dari tagihan.
2. Set max_tokens seketat mungkin
Output token adalah komponen termahal. Chatbot CS jarang butuh lebih dari 200–300 token per jawaban. Default 1024 tanpa sadar bisa melipatgandakan tagihan untuk jawaban yang sebenarnya pendek.
3. Pendekkan prompt sistem
Prompt sistem dikirim (dan ditagih) di setiap request. Pangkas instruksi bertele-tele menjadi aturan inti. Setiap 500 token yang dihemat di prompt = hemat di ribuan request.
4. Cache jawaban berulang
Pertanyaan sama ("ongkir ke Surabaya?") tidak perlu dijawab AI dua kali. Simpan jawaban FAQ populer di cache/database dan layani langsung — gratis dan lebih cepat.
5. Rendahkan temperature untuk tugas faktual
Temperature rendah (0–0.3) membuat jawaban konsisten dan pendek untuk CS dan ekstraksi data — sekaligus mengurangi jawaban ngawur yang memicu request ulang.
6. Batch dan streaming sesuai kebutuhan
Gabungkan permintaan kecil yang sejenis. Untuk UX, streaming tidak menghemat token tapi mencegah user me-retry karena mengira request macet (retry ganda = bayar ganda).
7. Pantau per endpoint, bukan total saja
Catat usage.total_tokens per fitur di log Anda. Seringkali 1 fitur boros (mis. ringkasan dokumen tanpa batas) menyumbang 60% tagihan — tidak akan ketahuan kalau hanya melihat total.
8. Pilih paket bila volume stabil
Pay-as-you-go cocok untuk coba-coba; volume rutin lebih murah dengan paket (tarif per token lebih rendah + limit longgar). Bandingkan tagihan 2 bulan terakhir dengan harga paket di halaman paket — titik impasnya biasanya lebih cepat dari dugaan.