Kalkulator Biaya API AI (LLM) per Bulan
Perkirakan biaya bulanan pemakaian API model AI (LLM) dari jumlah request, token input dan output, harga per 1 juta token, dan kurs rupiah, lengkap dengan cara menghemat token.
Bagaimana API AI menghitung biaya?
Hampir semua penyedia model bahasa besar (LLM) menagih berdasarkan token, yaitu potongan teks yang diproses model. Satu token bisa berupa satu kata pendek, sebagian kata, atau tanda baca. Tagihannya dipisah menjadi dua:
- Token input: semua yang Anda kirim ke model, yaitu instruksi sistem, pertanyaan pengguna, dokumen yang dilampirkan, dan riwayat percakapan.
- Token output: jawaban yang dihasilkan model. Harga per token output umumnya beberapa kali lebih mahal daripada input.
Biaya per request = (token input × harga input + token output × harga output) ÷ 1.000.000
Biaya per bulan = biaya per request × request per hari × hari aktif
Contoh perhitungan
Sebuah chatbot internal untuk petugas pendaftaran menerima 500 pertanyaan per hari, 22 hari kerja per bulan. Setiap request rata-rata berisi 2.000 token input dan 500 token output. Harga yang dipakai sebagai contoh: USD 3 per 1 juta token input dan USD 15 per 1 juta token output.
- Biaya per request = (2.000 × 3 + 500 × 15) ÷ 1.000.000 = USD 0,0135
- Request per bulan = 500 × 22 = 11.000
- Biaya per bulan = 0,0135 × 11.000 = USD 148,50
- Dengan kurs Rp16.500: ≈ Rp2.450.250 per bulan
Harga di atas hanyalah contoh untuk ilustrasi. Harga model berbeda antarpenyedia, antarversi model, dan berubah dari waktu ke waktu. Selalu cek halaman harga resmi sebelum menyusun anggaran.
Memperkirakan jumlah token
Sebagai patokan kasar untuk teks bahasa Inggris, 1 token kira-kira 4 karakter, atau sekitar ¾ kata. Teks bahasa Indonesia umumnya membutuhkan lebih banyak token untuk jumlah kata yang sama, karena kata-katanya lebih panjang dan jarang muncul utuh dalam kosakata tokenizer. Cara paling akurat adalah mengukur langsung: kebanyakan API mengembalikan jumlah token input dan output di setiap respons. Catat angka itu selama uji coba, lalu pakai rata-ratanya di kalkulator ini.
Cara menghemat biaya
- Batasi riwayat percakapan. Mengirim ulang seluruh riwayat di setiap pesan membuat token input membengkak. Ringkas atau potong riwayat lama.
- Gunakan prompt caching jika penyedia mendukungnya. Instruksi sistem yang panjang dan selalu sama bisa ditagih jauh lebih murah saat dipakai ulang.
- Pilih model sesuai tugas. Klasifikasi atau ekstraksi sederhana sering cukup dengan model kecil yang jauh lebih murah.
- Batasi panjang output dengan parameter jumlah token maksimum dan instruksi agar jawaban ringkas.
- Gunakan batch untuk pekerjaan yang tidak perlu jawaban instan, jika penyedia menawarkan harga batch yang lebih murah.
Perhatikan juga data yang dikirim
Untuk aplikasi kesehatan, jangan mengirim data pasien yang dapat mengidentifikasi seseorang ke layanan AI pihak ketiga tanpa dasar hukum, persetujuan, dan perjanjian pemrosesan data yang jelas. Baca artikel keamanan data pasien dan UU PDP dan cara programmer memakai AI dengan aman.
Terakhir diperbarui 24 September 2026