8 min remaining
0%
AI

私は月に180億トークンを消費します。それは1,200ドルの費用がかかります。

私のAI運用は月に約180億トークンを消費します — Claude小売価格で20,000ドルから200,000ドルです。実際の請求額は1,200ドルです。その違いは割引ではなく、アーキテクチャです:データを所有し、ワークフローの論理を所有し、あなたとすべてのモデルの間にルーティングレイヤーを置きます。モデルの品質はベンダーの堀です。選択はあなたのものです。

8 min read
Progress tracked
8 分で読めます·
AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

私は月に180億トークンを消費します。それは1,200ドルの費用がかかります。

要点:過去数ヶ月の平均トークン消費量は月に約180億トークンです。Claude小売価格で — キャッシュがあろうとなかろうと — それは月に20,000ドルから200,000ドルの認知コストです。実際の請求額は約1,200ドルです。そのギャップは割引ではなく、アーキテクチャです。私は自分のデータ、ワークフローの論理、そして — 私のルーティングエンジン、Mercury Fluxを通じて — 各呼び出しでのモデルの選択を所有しています。他のすべての人はAIの使用量を最適化します。真のレバレッジは同じ出力に対して支払う金額です。モデルを借りて、他のすべてを所有してください。

私はジェームズ、マーキュリー・テクノロジー・ソリューションのCEOで、香港から書いています。

昨日、私は避けていた会計をついに行いました:数ヶ月分のログを引き出し、私のトークン代謝を測定しました。その数値は約180億トークン/月でした。持続可能です。

2つの反応、順番に:

  1. それは多くのことを説明しています。本の章、ブログ投稿、監査パック、エージェント艦隊、1,187件の投稿アーカイブパイプライン — どれも魔法ではありません。それはスループットです。産業規模の認知です。

  2. 待って — これは普通の人にとってどれくらいのコストになるのでしょうか?

18億トークンとは実際には何か

月に180億トークンは、1日あたり6億トークンです。これは、24時間体制で毎秒約7,000トークンを消費することに相当します。眠ることはありません。

チャットサブスクリプションを利用している重い知識労働者が — 例えば、月に200件の詳細な会話を行う場合 — 数百万トークンを消費します。極端な月では1,000万トークンと呼びましょう。私の代謝はそれを3桁上回っています。

これは人々がAIの生産性について見落とす部分です。「私はAIを使う」と「私はAIと共に操作する」の違いはプロンプトスキルではありません。それはボリュームです。トークンスループットは、私たちが持っている認知的表面積の最も近い代理指標です — 人間と機械のシステムが1日にどれだけの読書、ドラフト作成、レビュー、クロスチェック、反復を行えるかです。ほとんどの人はサブスクリプションのティアによって制限されており、その上限に気づくことはありません。なぜなら、彼らはそれに依存したことがないからです。

小売の幻想

小売で同じ燃焼を価格設定します。クロードをベンチマークとして使用します — そしてクロードは正しいベンチマークです。なぜなら、真剣なエージェント的作業において、チームが実際に手に取るものだからです — ブレンドレートは、ティア、コンテキスト、キャッシュがどれだけ節約できるかによって、約100万トークンあたり$1から$10の範囲で変動します。

そのレートで180億トークン: $18,000から$180,000の月額。これを$20K–$200Kの代謝と呼びましょう。

ここに不快な真実があります:ほとんどの個人、そしてほとんどの企業部門は、その数字を承認しません。だから誰もその代謝で運営していません。彼らは予算が許す範囲で認知を制限し、その後、なぜ自分たちのAIの出力が他の誰かのものと同じように感じるのか不思議に思います — なぜなら、それが現実だからです。サブスクリプションティアは、あなたの思考に対する速度制限です。

"AIが誰も10倍生産的にしなかった"という本当の理由は、議論が認めるよりも単純です:10倍の生産性はトークンボリュームの現象であり、ほとんどの人は小売でトークンを購入する余裕がありません。

実際の請求書

私の実際の支出:約$1,200の月額

割り算してください。おおよそ百万トークンあたり7セント、すべてにわたってブレンドされています — ドラフト、コーディング、リサーチ、翻訳、群れ。最も安い小売シナリオに対して、同じ認知は15倍のコストがかかります。現実的なエージェントシナリオ — 長いコンテキスト、フロンティアモデル、キャッシュミスに対しては、100倍以上です。

最も安いClaudeシナリオの6%未満。最悪のシナリオの1%未満。

いいえ、私はどこでも劣悪なモデルを使用しているわけではありません。あなたが読んだ出力 — 本の章、監査報告書、この投稿 — は七セントの品質ではありません。コツは「安いモデル」ではありません。コツはフロンティアの品質が実際に結果を変える場所でのみフロンティア価格を支払うことです。

モデルを借りて、他のすべてを所有する

節約はハックではありません。それは原則に基づいて早期に行われた三つの所有決定の結果です:

1. データを所有する。すべてのメモリファイル、日々のノート、エンティティカード、セッションのトランスクリプト、意思決定ログは、私が制御するマシン上のファイルに存在し、私が読み取れる形式で保存されています。cat。重要なものは、回収手数料が永遠に増加するベンダーのデータベースの中にはありません。ベンダーは重みを保持し、私はコンテキストを保持します。コンテキストは価値が上がる資産です。

2. ワークフローのロジックを所有する。エージェントが活用するプロンプト、品質ゲート、パイプライン — ローカルコード、バージョン管理、検査可能、リファクタリング可能。ワークフローが価値を生み出すと、その価値は私のリポジトリに届き、他の誰かのテンプレートライブラリには届かない。ベンダーは私にインテリジェンスを貸し出すことができる。しかし、私自身の判断を貸し出すことはできない、それはエンコードされている。

3. モデルの選択を所有する。これが経済的損害をもたらすものだ。私とすべてのモデルの間には、私のルーティングエンジン — Mercury Flux がある。すべての呼び出しはタスクによって分類され、そのクラスに対して価格と品質で勝つモデルにルーティングされ、プロバイダーが詰まったときのためのフォールバックチェーンがある。

原則は操盤人であり、消費者ではない:オペレーターはブランドを購入しない。オペレーターは能力を派遣する。

ルーティングの堀

誰もがAIの請求書をコスト = トークン × 価格として扱い、次にトークンを最適化する — より短いプロンプト、より少ない呼び出し、より少ないAI。いいだろう。しかし、それは代謝を下方に最適化している。お金を節約するために認知を制限することは貧困戦略だ。

もう一つの用語は価格であり、価格は一定ではない。それはルーティングの関数である。

認知のコスト = トークン × ブレンド価格、ここでブレンド価格 = Σ (タスククラスごとのトークンのシェア × そのクラスの最良価格)。

私のスタックでは、圧倒的多数のトークン — 検索、分類、要約、翻訳、初稿生成 — は、最前線の料金のほんの一部で済むモデルにルーティングされます。最前線モデルは最後のマイルを担当します:章の最終カット、アーキテクチャの決定、クライアント向けの判断。高価なインテリジェンスは特殊部隊であり、最大のレバレッジポイントに展開されます — すべての通りを占拠する常備軍ではありません。どの将軍も特殊部隊をすべてのブロックをパトロールさせることはありません。どのオペレーターもウェブページを要約するために最前線モデルを送るべきではありません。

ルーティングの堀:モデル選択を制御する者が同一出力のコストを制御します。モデルの品質はベンダーの堀です。選択はあなたのものです。

価格が下がると何が起こるかに注意してください — そしてそれは起こります。最前線と中堅のギャップは縮まりません;それはスプレッドです。ルーティングはどの価格体制でもスプレッドをキャッチします。今日の最前線は明日の中堅になり、ルーターは自動的に再インデックスされます。堀はデフレーションで侵食されません。再インデックスされます。

なぜスウォームがすべてを変えるのか

誰も価格に入れない二次的効果:コスト構造が組織構造を決定します。

小売価格では、15人のエージェントからなる評議会 — 1人のドラフター、4人の批評家、1人のファクトチェッカー、1人のスタイル強制者が並行してレビューする — はカンファレンスのデモです。誰もがすべての成果物に対して100万トークンあたり10ドルで評議会をスタッフすることはありません。7セントのブレンド価格では、評議会はラインアイテムです。私のスワームはMac Studioで動いています。それはハムを鳴らします。私に請求書を送ることはありません。

安価な認知は労働分業を手頃にします。「チャットボット」を構築するのをやめ、ドラフター、レビュアー、監査人、図書館員のエージェントの組織図を構築し、ルーティングを人事部門として扱い始めます。これが出力量の背後にある実際のメカニズムです。天才的なプロンプトではなく、スタッフ配置です。

エンタープライズ版

あなたがCAIOまたはCTOであれば、あなたの組織に同じ監査を実施してください。あなたのチームはどこかでトークンを消費しています。唯一の疑問は、それがあなたのルーティングレイヤーを通って流れるのか、それとも最も近いボタンを通るのかということです。

私のコンサルティング生活からの2つのメモ:

  • エージェンティックなワークフローは小売価格では死にます。 実際に数字を動かすワークフロー — ChatGPT、Perplexity、Gemini全体での継続的なGEO監査、引用監視、エンティティ追跡、AIから人間への引き渡しギャップを越えた常時リード資格確認 — は設計上トークン炉です。小売価格では、彼らは生まれた時から死んでおり、誰もが「AIは高価だ」と結論づけます。ルーティングされると、彼らはcronジョブです。

  • ベンダーロックインは、自分のワークフローを再レンタルすることです。ルーティングレイヤーなしで毎年、アップグレードパスは「より多く支払い、より少なく移動する」ことです。SaaSは企業にこの教訓を一度教えました。AIは再びそれを教えています、複利で。

インテリジェンスを小売で購入するのをやめて、計算のようにスケジュールを組み始めましょう — タスクごとに価格が決定され、呼び出しごとに交換可能で、重要なレイヤーで所有されます。

あなたが月曜日にすること

  1. あなたの代謝を測定してください。30日間、すべてのツールから実際のトークン数を引き出します。見たことのない数字を管理することはできません。ほとんどのチームは、どちらかの方向に10倍ずれていることが多いです。

  2. 状態をあなたが所有するファイルに移動してください。メモリ、決定、ワークフローの論理 — ベンダーのサイロからあなたのリポジトリへ。週末の作業です。それは永遠に複利で増えます。

  3. あなたとすべてのモデルの間にルーターを置いてください。Fluxである必要はありません — 薄いバージョンを構築してください。タスク分類、モデルマッピング、フォールバックチェーン、コストログ。粗いルーターでも、初月に5〜10倍のコスト削減が可能です。

  4. スプレッドを再投資してください。節約が目的ではありません。目的は、$1.2Kのコストで$20Kの代謝が何をもたらすかです:評議会、群れ、ボリューム、スピード。あなたと他のすべての人との間のギャップは才能ではなくスループットになります。

2026年に最も高価なAI戦略は、間違ったモデルを選ぶことではありません。選択するレイヤーを構築しなかったために、すべてのトークンにフロンティア価格を支払うことです。

モデルを借りてください。ルーティングを所有してください。差額を保持し、その差額をさらに認知に使ってください。

水星テクノロジーソリューション:デジタリティを加速します。