8 min remaining
0%
AI

Saya Membakar 18 Miliar Token Sebulan. Biayanya $1.200.

Operasi AI saya membakar ~18 miliar token sebulan — $20K–$200K pada tarif ritel Claude. Tagihan sebenarnya adalah $1.200. Perbedaannya bukanlah diskon; itu adalah arsitektur: miliki data, miliki logika alur kerja, dan letakkan lapisan pengarah antara Anda dan setiap model. Kualitas model adalah benteng vendor. Pemilihan ada di tangan Anda.

8 min read
Progress tracked
8 menit baca·
AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

Saya Membakar 18 Miliar Token Sebulan. Biayanya $1.200.

TL;DR: Rata-rata pembakaran token saya selama beberapa bulan terakhir adalah ~18 miliar token per bulan. Dikenakan biaya pada tarif ritel Claude — dengan cache atau tanpa cache — itu adalah $20.000 hingga $200.000 untuk kognisi bulanan. Tagihan saya sebenarnya sekitar $1.200. Selisihnya bukanlah diskon; itu adalah arsitektur. Saya memiliki data saya, logika alur kerja saya, dan — melalui mesin pengarah saya, Mercury Flux — pilihan model pada setiap panggilan. Semua orang lain mengoptimalkan seberapa banyak AI yang mereka gunakan. Leverage sebenarnya adalah apa yang Anda bayar untuk output yang sama. Sewa modelnya. Miliki segala sesuatu yang lain.

Saya James, CEO dari Mercury Technology Solution, menulis dari Hong Kong.

Kemarin saya akhirnya melakukan akuntansi yang telah saya hindari: menarik bulan-bulan log dan mengukur metabolisme token saya. Angka tersebut kembali sekitar 18 miliar token sebulan. Berkelanjutan.

Dua reaksi, dalam urutan:

  1. Itu menjelaskan banyak hal. Bab-bab buku, postingan blog, paket audit, armada agen, jalur arsip 1.187-post — tidak ada yang magis. Itu adalah throughput. Kognisi pada volume industri.

  2. Tunggu — berapa biaya ini bagi orang biasa?

Apa Itu 18 Miliar Token Sebenarnya

18 miliar token sebulan adalah 600 juta sehari. Itu sekitar 7.000 token setiap detik, sepanjang waktu, tanpa tidur.

Seorang pekerja pengetahuan yang berat yang mengutak-atik langganan obrolan — katakanlah 200 percakapan terperinci sebulan — membakar beberapa juta token. Anggaplah 10 juta di bulan yang ekstrem. Metabolisme saya berjalan tiga urutan magnitudo di atas itu.

Ini adalah bagian yang sering diabaikan orang tentang produktivitas AI. Perbedaan antara "Saya menggunakan AI" dan "Saya beroperasi dengan AI" bukanlah keterampilan prompt. Ini adalah volume. Melalui token adalah proksi terdekat yang kita miliki untuk luas permukaan kognitif — seberapa banyak membaca, menyusun, meninjau, memeriksa silang, dan mengiterasi yang dapat dilakukan sistem orang-plus-mesin per hari. Kebanyakan orang dibatasi oleh tingkat langganan mereka dan tidak pernah menyadari batasan tersebut, karena mereka tidak pernah bergantung padanya.

Ilusi Ritel

Harga pembakaran yang sama di ritel. Menggunakan Claude sebagai tolok ukur — dan Claude adalah tolok ukur yang tepat, karena untuk pekerjaan agen serius, itulah yang sebenarnya diambil tim — tarif campuran berkisar antara $1 hingga $10 per juta token tergantung pada tingkat, konteks, dan seberapa banyak cache yang dapat menghemat Anda.

18 miliar token dengan tarif tersebut: $18.000 hingga $180.000 sebulan. Sebut saja metabolisme $20K–$200K.

Inilah kebenaran yang tidak nyaman: hampir tidak ada individu, dan hampir tidak ada departemen perusahaan, yang menyetujui angka itu. Jadi tidak ada yang beroperasi pada metabolisme itu. Mereka membatasi kognisi mereka pada apa yang diizinkan anggaran, lalu bertanya-tanya mengapa keluaran AI mereka terasa seperti milik orang lain — karena memang demikian.Tingkat langganan adalah batas kecepatan pada pemikiran Anda.

Alasan sebenarnya mengapa "AI belum membuat semua orang 10x produktif" lebih sederhana daripada yang diakui dalam diskursus: produktivitas 10x adalah fenomena volume-token, dan hampir tidak ada yang mampu membeli token di ritel.

Tagihan Sebenarnya

Pengeluaran saya yang sebenarnya: sekitar $1.200 sebulan.

Bagi itu. Itu kira-kira tujuh sen per juta token, dicampur di seluruhnya — penyusunan, pengkodean, penelitian, terjemahan, kerumunan. Melawan skenario ritel termurah, kognisi yang sama biayanya 15x lebih mahal. Melawan skenario agen yang realistis — konteks panjang, model perbatasan, kesalahan cache — biayanya 100x dan lebih.

Di bawah 6% dari skenario Claude termurah. Di bawah 1% dari yang terburuk.

Dan tidak, saya tidak menjalankan model yang lebih buruk di mana-mana. Output yang telah Anda baca — bab buku, laporan audit, pos ini — bukanlah kualitas tujuh sen. Triknya bukan "model murah." Triknya adalah membayar harga perbatasan hanya di mana kualitas perbatasan benar-benar mengubah hasil.

Sewa Model, Miliki Segala Sesuatu yang Lain

Penghematan bukanlah sebuah hack. Mereka adalah konsekuensi dari tiga keputusan kepemilikan yang dibuat lebih awal, berdasarkan prinsip:

1. Miliki data.Setiap file memori, catatan harian, kartu entitas, transkrip sesi, dan log keputusan ada dalam file di mesin yang saya kendalikan, dalam format yang bisa saya baca dengan cat. Tidak ada yang penting berada di dalam database vendor di mana biaya pengambilan bertambah selamanya. Vendor memegang bobot; saya memegang konteks. Konteks adalah aset yang menghargai.

2. Miliki logika alur kerja.Prompt, agen yang dimanfaatkan, gerbang kualitas, pipeline — kode lokal, terkontrol versi, dapat diperiksa, dapat diubah. Ketika sebuah alur kerja menghasilkan nilai, nilai tersebut masuk ke repositori saya, bukan ke perpustakaan template orang lain. Vendor dapat menyewakan kecerdasan kepada saya. Mereka tidak dapat menyewakan penilaian saya sendiri, yang terkode.

3. Miliki pilihan model.Inilah yang menyebabkan kerugian ekonomi. Di antara saya dan setiap model terdapat mesin pengarah saya — Mercury Flux. Setiap panggilan diklasifikasikan berdasarkan tugas dan diarahkan ke model yang menang dalam harga-kualitas untuk kelas tersebut, dengan rantai cadangan ketika penyedia mengalami masalah.

Prinsipnya adalah 操盤人, bukan konsumen: operator tidak membeli merek. Operator mengirimkan kemampuan.

Parit Pengarahan

Semua orang menganggap tagihan AI sebagai Biaya = Token × Harga, lalu mengoptimalkan Token — prompt yang lebih pendek, panggilan yang lebih sedikit, lebih sedikit AI. Baiklah. Tapi itu mengoptimalkan metabolisme Anda ke bawah. Membatasi kognisi untuk menghemat uang adalah strategi kemiskinan.

Istilah lainnya adalah Harga — dan harga bukanlah konstanta. Itu adalah fungsi dari pengarahan.

Biaya Kognisi = Token × Harga Campuran, di mana Harga Campuran = Σ (bagian token berdasarkan kelas tugas × harga terbaik untuk kelas tersebut).

Dalam tumpukan saya, mayoritas besar token — pengambilan, klasifikasi, ringkasan, terjemahan, pembuatan draf pertama — diarahkan ke model yang biayanya hanya sebagian kecil dari tarif perbatasan. Model perbatasan menangani jarak terakhir: potongan akhir dari sebuah bab, keputusan arsitektur, penilaian yang dihadapi klien. Kecerdasan yang mahal adalah pasukan khusus, dikerahkan di titik leverage maksimum — bukan tentara tetap yang menduduki setiap jalan. Tidak ada jenderal yang mengirim pasukan khusus untuk patroli di setiap blok. Tidak ada operator yang seharusnya mengirim model perbatasan untuk merangkum halaman web.

Parit Routing: siapa pun yang mengontrol pemilihan model mengontrol biaya output yang identik. Kualitas model adalah parit vendor. Pemilihan adalah milik Anda.

Perhatikan apa yang terjadi saat harga turun — dan itu akan terjadi. Celah antara perbatasan dan tingkat menengah tidak menutup; itu adalah penyebaran. Routing menangkap penyebaran dalam rezim harga apa pun. Perbatasan hari ini menjadi tingkat menengah besok, dan router melakukan reindeks secara otomatis. Parit tidak tergerus dengan deflasi. Itu melakukan reindeks.

Mengapa Swarm Mengubah Segalanya

Efek urutan kedua yang tidak dipertimbangkan oleh siapa pun: struktur biaya menentukan struktur organisasi.

Pada harga eceran, dewan 15 agen — satu perancang, empat kritikus, seorang pemeriksa fakta, seorang penegak gaya, yang meninjau secara paralel — adalah demo pembicaraan konferensi. Tidak ada yang mengisi dewan untuk setiap hasil dengan biaya $10 per juta token. Dengan tujuh sen tercampur, dewan adalah item baris. Swarm saya hidup di Mac Studio. Ia berdengung. Ia tidak mengirimkan faktur kepada saya.

Kognisi murah membuat pembagian kerja terjangkau. Anda berhenti membangun "sebuah chatbot" dan mulai membangun bagan organisasi agen — perancang, peninjau, auditor, pustakawan — dengan pengalihan sebagai departemen SDM. Itulah mekanisme sebenarnya di balik volume output. Bukan prompt jenius. Staf.

Versi Perusahaan

Jika Anda seorang CAIO atau CTO, lakukan audit yang sama pada organisasi Anda. Tim Anda membakar token di suatu tempat; satu-satunya pertanyaan adalah apakah itu mengalir melalui lapisan pengalihan Anda atau melalui tombol mana pun yang terdekat.

Dua catatan dari kehidupan konsultasi saya:

  • Alur kerja agen mati pada harga eceran. Alur kerja yang benar-benar menggerakkan angka — audit GEO berkelanjutan di ChatGPT, Perplexity, dan Gemini; pemantauan kutipan; pelacakan entitas; kualifikasi prospek yang selalu aktif di seluruh celah serah terima AI-ke-manusia — adalah tungku token berdasarkan desain. Pada harga eceran, mereka lahir mati, dan semua orang menyimpulkan "AI itu mahal." Jika dialihkan, mereka adalah pekerjaan cron.

  • Keterikatan vendor adalah menyewa kembali alur kerja Anda sendiri.Setiap tahun tanpa lapisan routing, jalur peningkatan adalah membayar lebih, bergerak kurang. SaaS mengajarkan pelajaran ini kepada perusahaan sekali. AI mengajarkannya lagi, dengan bunga yang mengumpul.

Hentikan membeli intelijen secara ritel. Mulailah menjadwalkannya seperti komputasi — harga yang ditemukan per tugas, dapat ditukar per panggilan, dimiliki di lapisan yang penting.

Apa yang Anda Lakukan pada Hari Senin

  1. Ukur metabolisme Anda.Tarik jumlah token nyata dari semua alat selama 30 hari. Anda tidak dapat mengelola angka yang belum pernah Anda lihat. Sebagian besar tim salah 10x ke satu arah atau arah lainnya.

  2. Pindahkan status Anda ke file yang Anda miliki.Memori, keputusan, logika alur kerja — keluar dari silo vendor, masuk ke repositori Anda. Sebuah akhir pekan kerja. Itu mengumpul selamanya.

  3. Letakkan router di antara Anda dan setiap model.Tidak harus Flux — bangun versi tipis. Klasifikasi tugas, pemetaan model, rantai cadangan, pencatatan biaya. Bahkan router kasar mengurangi biaya 5–10x di bulan pertama.

  4. Reinvestasikan selisihnya.Penghematan bukanlah tujuan. Tujuannya adalah apa yang dibeli metabolisme $20K dengan biaya $1.2K: dewan, kawanan, volume, kecepatan. Jurang antara Anda dan orang lain berhenti menjadi bakat dan menjadi throughput.

Strategi AI termahal di 2026 bukanlah memilih model yang salah. Ini adalah membayar harga perbatasan untuk setiap token karena Anda tidak pernah membangun lapisan yang memilih.

Sewa model-modelnya. Miliki pengaturan. Simpan selisihnya — lalu belanjakan selisihnya untuk lebih banyak kognisi.

Solusi Teknologi Mercury: Percepat Digitalitas.