8 min remaining
0%
AI

나는 한 달에 180억 개의 토큰을 소모합니다. 비용은 $1,200입니다.

내 AI 운영은 한 달에 약 180억 개의 토큰을 소모합니다 — Claude 소매 요금으로 $20K–$200K입니다. 실제 청구서는 $1,200입니다. 차이는 할인 때문이 아니라 아키텍처 때문입니다: 데이터를 소유하고, 워크플로우 논리를 소유하며, 당신과 모든 모델 사이에 라우팅 레이어를 두십시오. 모델 품질은 공급업체의 방어선입니다. 선택은 당신의 것입니다.

8 min read
Progress tracked
8 분 읽기·
AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

나는 한 달에 180억 개의 토큰을 소모합니다. 비용은 $1,200입니다.

요약:지난 몇 달 동안의 평균 토큰 소모량은 한 달에 약 180억 개의 토큰입니다. Claude 소매 가격으로 — 캐시가 있든 없든 — 이는 월 $20,000에서 $200,000의 인지 비용입니다. 실제 청구서는 약 $1,200입니다. 그 차이는 할인 때문이 아니라 아키텍처 때문입니다. 나는 내 데이터, 내 워크플로우 논리, 그리고 — 내 라우팅 엔진인 Mercury Flux를 통해 — 모든 호출에서 모델 선택을 소유합니다. 다른 모든 사람들은 AI 사용량을 최적화합니다. 진정한 레버리지는 동일한 출력에 대해 지불하는 금액입니다. 모델을 임대하세요. 나머지는 모두 소유하세요.

저는 제임스입니다. 머큐리 테크놀로지 솔루션의 CEO로, 홍콩에서 글을 쓰고 있습니다.

어제 저는 마침내 피하고 있던 회계를 했습니다: 몇 달 간의 로그를 끌어내고 제 토큰 대사량을 측정했습니다. 그 숫자는 대략 한 달에 180억 토큰으로 나왔습니다. 지속적입니다.

두 가지 반응, 순서대로:

  1. 많은 것을 설명해줍니다. 책의 장들, 블로그 게시물, 감사 패키지, 에이전트 함대, 1,187개의 게시물 아카이브 파이프라인 — 이 모든 것은 마법이 아닙니다. 이것은 처리량입니다. 산업 규모의 인지입니다.

  2. 잠깐 — 이게 일반 사람에게는 얼마일까요?

18억 토큰이 실제로 무엇인지

한 달에 180억 토큰은 하루에 6억 토큰입니다. 이는 매초 약 7,000 토큰, 하루 24시간, 잠도 자지 않고 소모되는 양입니다.

채팅 구독을 하는 중량 지식 근로자가 — 예를 들어 한 달에 200개의 상세한 대화를 한다고 가정할 때 — 몇 백만 토큰을 소모합니다. 극단적인 달에는 1천만 토큰이라고 할 수 있습니다. 제 대사량은 그보다 세 배 높은 수준에서 작동합니다.

이것이 사람들이 AI 생산성에 대해 놓치는 부분입니다. "나는 AI를 사용한다"와 "나는 AI와 함께 작업한다"의 차이는 프롬프트 기술이 아닙니다. 그것은 볼륨입니다. 토큰 처리량은 우리가 인지 표면적을 측정할 수 있는 가장 가까운 대리 지표입니다 — 개인-기계 시스템이 하루에 얼마나 많은 읽기, 초안 작성, 검토, 교차 확인 및 반복 작업을 할 수 있는지를 나타냅니다. 대부분의 사람들은 구독 계층에 의해 속도 제한을 받으며, 그것이 한계라는 것을 인식하지 못합니다. 왜냐하면 그들은 그것에 의존해 본 적이 없기 때문입니다.

소매 환상

소매에서 동일한 소모를 가격 책정합니다. 클로드를 기준으로 사용할 때 — 클로드는 올바른 기준입니다. 왜냐하면 진지한 에이전트 작업을 위해 팀들이 실제로 선택하는 것이기 때문입니다 — 혼합 요금은 계층, 맥락 및 캐시가 얼마나 절약되는지에 따라 대략 백만 토큰당 $1에서 $10 사이입니다.

그 요금으로 180억 토큰: $18,000에서 $180,000까지 한 달. 이를 $20K–$200K 대사율이라고 부릅시다.

불편한 진실은 다음과 같습니다: 거의 모든 개인과 거의 모든 기업 부서가 그 숫자를 승인하지 않습니다. 그래서 아무도 그 대사율로 운영하지 않습니다. 그들은 예산이 허용하는 수준에서 인지를 제한하고, 그런 다음 그들의 AI 출력이 다른 모든 사람들과 비슷하게 느껴지는 이유를 궁금해합니다 — 왜냐하면 그것이 사실이기 때문입니다.구독 계층은 당신의 사고에 대한 속도 제한입니다.

"AI가 모든 사람을 10배 생산적으로 만들지 못한 진짜 이유"는 담론이 인정하는 것보다 더 간단합니다: 10배 생산성은 토큰-볼륨 현상이며, 거의 아무도 소매에서 토큰을 감당할 수 없습니다.

실제 청구서

내 실제 지출: 약 $1,200 매달.

나누어 보세요. 대략 백만 토큰당 7센트, 모든 것에 걸쳐 혼합되어 있습니다 — 초안 작성, 코딩, 연구, 번역, 군집. 가장 저렴한 소매 시나리오에 비해, 동일한 인지 비용은 15배 더 비쌉니다. 현실적인 에이전트 시나리오에 비해 — 긴 맥락, 최전선 모델, 캐시 미스 — 100배 이상입니다.

가장 저렴한 Claude 시나리오의 6% 미만. 최악의 경우 1% 미만.

아니요, 저는 모든 곳에서 더 나쁜 모델을 사용하지 않습니다. 당신이 읽은 출력물 — 책의 장, 감사 보고서, 이 게시물 — 은 7센트 품질이 아닙니다. 요령은 "저렴한 모델"이 아닙니다. 요령은 프론티어 품질이 실제로 결과를 변화시키는 곳에서만 프론티어 가격을 지불하는 것입니다.

모델을 임대하고 나머지는 소유하세요

절약은 해킹이 아닙니다. 그것은 원칙적으로 초기 단계에서 내린 세 가지 소유 결정의 결과입니다:

1. 데이터를 소유하세요.모든 메모리 파일, 일일 노트, 엔티티 카드, 세션 전사 및 결정 로그는 제가 제어하는 기계의 파일에 저장되어 있으며, 제가 읽을 수 있는 형식으로 되어 있습니다.cat. 중요한 것은 공급업체의 데이터베이스에 저장되어 retrieval fee가 영원히 누적되지 않습니다. 공급업체는 가중치를 보유하고; 저는 맥락을 보유합니다. 맥락은 가치가 상승하는 자산입니다.

2. 워크플로우 논리를 소유하라.프롬프트, 에이전트가 활용하는 것, 품질 게이트, 파이프라인 — 로컬 코드, 버전 관리, 검사 가능, 리팩토링 가능. 워크플로우가 가치를 창출할 때, 그 가치는 내 레포지토리에 저장되며, 다른 사람의 템플릿 라이브러리에 저장되지 않는다. 공급업체는 나에게 지능을 임대할 수 있다. 그러나 그들은 내 판단, 인코딩된 것을 임대할 수 없다.

3. 모델 선택을 소유하라.이것이 경제적 피해를 주는 것이다. 나와 모든 모델 사이에는 내 라우팅 엔진인 머큐리 플럭스가 있다. 모든 호출은 작업에 따라 분류되고, 해당 클래스에서 가격-품질에서 우승하는 모델로 라우팅되며, 공급자가 중단될 경우를 대비한 대체 체인이 있다.

원칙은 操盤人, 소비자가 아니다: 운영자는 브랜드를 구매하지 않는다. 운영자는 능력을 배치한다.

라우팅 해자

모든 사람은 AI 청구서를 비용 = 토큰 × 가격으로 간주하고, 토큰을 최적화한다 — 더 짧은 프롬프트, 더 적은 호출, 더 적은 AI. 좋다. 하지만 이는 당신의 신진대사를 아래로 최적화하는 것이다. 돈을 절약하기 위해 인지를 제한하는 것은 가난한 전략이다.

다른 용어는 가격이다 — 가격은 일정하지 않다. 그것은 라우팅의 함수이다.

인지 비용 = 토큰 × 혼합 가격, 여기서 혼합 가격 = Σ (작업 클래스별 토큰 비율 × 해당 클래스의 최적 가격).

내 스택에서 압도적인 대부분의 토큰 — 검색, 분류, 요약, 번역, 초안 생성 — 는 최전선 요금의 일부만 드는 모델로 라우팅됩니다. 최전선 모델은 마지막 마일을 처리합니다: 장의 최종 컷, 아키텍처 결정, 클라이언트 대면 판단. 비싼 지능은 최대 레버리지 지점에 배치된 특수 부대입니다 — 모든 거리를 점령하는 상비군이 아닙니다. 어떤 장군도 특수 부대를 모든 블록을 순찰하도록 보내지 않습니다. 어떤 운영자도 웹페이지를 요약하기 위해 최전선 모델을 보내서는 안 됩니다.

라우팅 해자: 모델 선택을 제어하는 사람이 동일한 출력의 비용을 제어합니다. 모델 품질은 공급자의 해자입니다. 선택은 당신의 것입니다.

가격이 하락할 때 발생하는 일을 주목하세요 — 그리고 그렇게 될 것입니다. 최전선과 중간 계층의 간격은 좁혀지지 않습니다; 그것은 확산입니다. 라우팅은 어떤 가격 체제에서도 확산을 포착합니다. 오늘의 최전선은 내일의 중간 계층이 되고, 라우터는 자동으로 재색인합니다. 해자는 디플레이션으로 침식되지 않습니다. 그것은 재색인됩니다.

왜 군집이 모든 것을 변화시키는가

아무도 가격에 반영하지 않는 2차 효과: 비용 구조가 조직 구조를 결정합니다.

소매 가격으로, 15명의 에이전트로 구성된 위원회 — 한 명의 초안 작성자, 네 명의 비평가, 한 명의 사실 확인자, 한 명의 스타일 집행자 —가 병행 검토를 하는 것은 컨퍼런스 발표 데모입니다. 아무도 백만 개 토큰당 10달러에 모든 산출물에 대해 위원회를 구성하지 않습니다. 혼합 가격이 7센트인 경우, 위원회는 항목으로 포함됩니다. 내 스웜은 Mac Studio에서 작동합니다. 부드럽게 돌아갑니다. 나에게 청구하지 않습니다.

저렴한 인지가 노동 분업을 저렴하게 만듭니다. "챗봇"을 만드는 것을 멈추고 초안 작성자, 검토자, 감사자, 사서 등 에이전트의 조직도를 구축하기 시작합니다 — 라우팅은 인사 부서로서 기능합니다. 이것이 실제 출력량의 메커니즘입니다. 천재적인 프롬프트가 아닙니다. 인력 배치입니다.

기업 버전

당신이 CAIO 또는 CTO라면, 당신의 조직에 대해 동일한 감사를 수행하십시오. 당신의 팀은 어딘가에서 토큰을 소모하고 있습니다. 유일한 질문은 그것이 당신의 라우팅 레이어를 통해 흐르는지 아니면 가장 가까운 버튼을 통해 흐르는지입니다.

내 컨설팅 생활에서의 두 가지 메모:

  • 에이전트 워크플로우는 소매 가격에서 사라집니다.실제로 숫자를 움직이는 워크플로우 — ChatGPT, Perplexity, Gemini 전반에 걸친 지속적인 GEO 감사; 인용 모니터링; 엔티티 추적; AI와 인간 간의 핸드오프 간의 항상 켜져 있는 리드 자격 부여 — 는 설계상 토큰 화로 만들어집니다. 소매에서, 그들은 태어날 때부터 죽어 있으며, 모두가 "AI는 비쌉니다"라고 결론을 내립니다. 라우팅되면, 그들은 크론 작업입니다.

  • 벤더 잠금은 당신의 워크플로우를 다시 임대하는 것입니다.매년 라우팅 레이어 없이 업그레이드 경로는 더 많은 비용을 지불하고 덜 이동하는 것입니다. SaaS는 기업에 이 교훈을 한 번 가르쳤습니다. AI는 복리로 다시 가르치고 있습니다.

정보를 소매로 구매하는 것을 중단하세요. 컴퓨팅처럼 일정을 잡기 시작하세요 — 작업별로 가격이 결정되고, 호출별로 교환 가능하며, 중요한 레이어에서 소유됩니다.

월요일에 하는 일

  1. 대사량을 측정하세요.30일 동안 모든 도구에서 실제 토큰 수를 가져오세요. 한 번도 본 적 없는 숫자는 관리할 수 없습니다. 대부분의 팀은 한 방향으로 10배 차이가 납니다.

  2. 상태를 소유한 파일로 이동하세요.메모리, 결정, 워크플로우 논리 — 공급업체 사일로에서 벗어나 귀하의 리포지토리로. 주말 동안의 작업. 영원히 복리로 증가합니다.

  3. 모든 모델 사이에 라우터를 두세요.Flux일 필요는 없습니다 — 얇은 버전을 만드세요. 작업 분류, 모델 매핑, 폴백 체인, 비용 로깅. 조잡한 라우터조차도 첫 달에 비용을 5–10배 줄입니다.

  4. 차익을 재투자하세요.절약이 핵심이 아닙니다. 핵심은 $1.2K 비용으로 $20K 대사에서 얻는 것입니다: 의회, 군집, 볼륨, 속도. 당신과 다른 모든 사람 사이의 격차는 재능이 아니라 처리량이 됩니다.

2026년 가장 비싼 AI 전략은 잘못된 모델을 선택하는 것이 아닙니다. 선택하는 레이어를 구축하지 않았기 때문에 모든 토큰에 대해 최전선 가격을 지불하는 것입니다.

모델을 임대하세요. 라우팅을 소유하세요. 차액을 유지하세요 — 그런 다음 그 차액을 더 많은 인지에 사용하세요.

머큐리 기술 솔루션: 디지털리티 가속화.