AI 코딩 청구서가 통제를 벗어났습니다: Cursor는 숫자를 숨겼고, Amazon은 $1.8M을 태웠으며, 로컬 레이어가 바꾸는 것¶
빠른 답변: AI 코딩 청구서가 기하급수적으로 늘어나는 이유는 세 가지입니다 — 지출이 보이지 않고(Cursor는 방금 사용량 페이지에서 비용 데이터를 제거했습니다), 가드레일이 없으며(Amazon 내부 보고서가 단순한 Claude 작업에 $1.8M, 예산의 860%를 썼음을 보여줬습니다), 토큰 기반 가격 책정이 모든 중복 재시도를 처벌합니다. 로컬 에이전트 레이어는 처음 두 문제를 직접 고칩니다: 디스패치 이벤트마다 토큰/usd를 기록하고, 실행이 비용 임계값을 넘으면 경고하며, 값싼 작업을 값싼 모델로 라우팅하고, 프로젝트 메모리를 디스크에 보관해서 같은 컨텍스트에 다시 돈을 내지 않게 합니다.
AI 코딩 비용이 주류가 된 주¶
지난 며칠간 세 가지 이야기가 AI 코딩 지출을 무시할 수 없게 만들었습니다:
- Cursor가 사용량 페이지와 CSV 내보내기에서 비용 정보를 제거했습니다. 변화는 즉시 발견되었습니다 — Hacker News에서 추천 300개 이상으로 정상을 찍었습니다. 공급업체가 미터를 읽을 수 없게 만들면, 보통 미터가 나쁜 소식입니다.
- Amazon이 Claude로 단순한 코딩 작업에 $1.8M을 썼습니다 — 예산의 860%. Tom's Hardware가 공개한 내부 사용량 지표 보고서는 단순하고 자동화 가능한 잡일의 API 지출이 모든 예측을 폭발적으로 넘어섰음을 보여줬습니다. 청구서가 도착하기 전까지 아무도 눈치채지 못했습니다.
- Codex의 5시간 사용량 한도가 돌아왔습니다. 사용량 상한이 돌아온 이유는 사용이 비싸기 때문입니다.
이 중 어느 것도 고립된 사건이 아닙니다. 세 가지 규모에서 같은 실패 모드입니다: AI 코딩 지출은 보이지 않고, 경계가 없으며, 모든 단일 토큰에서 돌아가는 미터에 붙어 있습니다.
청구서가 기하급수적으로 늘어나는 이유¶
1. 지출은 설계상 보이지 않는다¶
대부분의 AI 코딩 도구는 기능과 시트를 추적하는 것과 같은 인터페이스로 청구됩니다. 숫자가 불편해지면, 최소 저항 경로는 숫자를 표시하지 않는 것입니다. 하지만 보이지 않는 숫자는 최적화할 수 없습니다. "이번 주 에이전트가 작업별로 얼마를 썼는가?"에 답하지 못하는 팀은 이미 예산 통제를 놓친 것입니다.
2. 에이전트가 행동하고 인간이 승인한다 — 미터를 보는 사람은 아무도 없다¶
문제에 다섯 가지 접근을 시도하는 에이전트는 다섯 배를 씁니다. 같은 파일을 열 번 재생성하는 리팩토링은 열 번의 생성을 지불합니다. 원격 측정 없는 자율성은 $200k 항목이 $1.8M이 되는 방식입니다: 각 단계는 개별적으로 합리적이고, 어떤 단계도 가격을 알리지 않습니다.
3. 토큰 가격 책정은 중복 컨텍스트를 처벌한다¶
매 턴 관련 컨텍스트를 다시 보냅니다. "메모리"가 호출마다 재업로드되는 거대한 프롬프트라면, 같은 지식을 반복해서 지불하는 것입니다. 비용의 가장 큰 지렛대는 더 싼 모델이 아니라 이미 아는 것을 다시 보내지 않는 것입니다.
로컬 레이어가 바꾸는 것¶
AIOS는 Claude Code, Codex, Gemini CLI, OpenCode, Grok Build 위에 놓이는 로컬 퍼스트 워크플로 레이어입니다. 클라이언트를 대체하지 않고, 그 주변에 빠져 있던 관측 가능성과 메모리를 더합니다. 구체적으로 위의 세 원인에 대응합니다:
가시성: 모든 디스패치에 가격이 매겨진다¶
각 디스패치된 실행은 정규화된 토큰과 USD 비용(inputTokens, outputTokens, totalTokens, usd)을 이벤트 레코드에 기록합니다. 실행 후에 작업 항목이 얼마였는지 — 토큰과 달러 — 정확히 볼 수 있습니다. 모든 것을 한 덩어리로 합치는 월간 집계를 기다릴 필요가 없습니다.
가드레일: 청구서 전에 경고하는 비용 임계값¶
디스패치 인사이트 레이어는 각 실행의 토큰 사용량을 구성 가능한 임계값과 비교합니다. 실행이 넘어서면 cost.high 경고와 함께 실행 가능한 다음 단계("디스패치 비용을 검토하고 더 작은 작업 항목 배치를 고려하세요")를 받습니다 — 청구 주기가 끝날 때가 아니라 실행이 아직 생생할 때 말입니다.
라우팅: 값싼 작업은 값싼 모델로¶
모델 라우터는 능력, 비용, 측정된 성공률로 디스패치합니다. 한 줄 수정에 플래그십 모델은 필요 없습니다; 골치 아픈 아키텍처 질문에는 필요합니다. 비용 기준 라우팅은 항상 가장 비싼 도구를 쓰는 함대와 작동하는 가장 싼 도구를 쓰는 함대의 차이입니다.
메모리: 같은 컨텍스트에 돈 내기 중단¶
ContextDB는 프로젝트 메모리를 토큰 압축된 상태로 디스크에 보관하고, 호출마다 관련 슬라이스만 주입합니다. 커뮤니티 RTK/Caveman 압축 레이어와 결합하면 중복 컨텍스트 세금 — 대부분의 AI 코딩 예산에서 가장 큰 조용한 항목 — 을 깎습니다.
안전한 시작 순서¶
aios init --all
aios doctor --native --verbose
그런 다음 디스패치 실행에 대한 토큰 경고 임계값을 설정하고, 모델 라우터 가이드로 값싼 작업을 값싼 모델로 라우팅하고, 토큰 인텔리전스 가이드로 압축이 무엇을 보존하고 무엇을 버리는지 읽으세요.
FAQ¶
내 코딩 클라이언트가 이미 사용량을 보여주지 않나요?¶
대부분의 클라이언트는 어떤 집계 사용량을 보여주지만, Cursor가 방금 그 가시성이 얼마나 쉽게 제거될 수 있는지 증명했습니다. 자기 워크플로 레이어가 쓰는 이벤트 수준 기록은 당신이 통제하는 데이터입니다 — 공급업체 UI 변경이 숨길 수 없습니다.
요점은 덜 쓰는 것인가, 더 똑똑하게 쓰는 것인가?¶
둘 다입니다. 임계값 경고는 폭주하는 실행을 막고, 라우팅은 값싼 작업을 값싼 모델로 보내고, ContextDB는 중복 컨텍스트를 제거합니다. 그 조합은 전형적으로 총 토큰과 총 달러를 모두 줄입니다.
현재 코딩 도구 사용을 중단해야 하나요?¶
아니요. AIOS는 이미 쓰고 있는 클라이언트(Claude Code, Codex, Gemini CLI, OpenCode, Grok Build)와 함께 작동합니다. 그 주변에 관측 가능성과 메모리 레이어를 더할 뿐입니다.
세부 내용은 어디서 볼 수 있나요?¶
Changelog에 릴리스별 비용 관련 변경이 정리되어 있고, 아키텍처 가이드가 디스패치 이벤트, 증거, 비용이 시스템을 통해 흐르는 방식을 설명합니다.
미터는 비용이 괜찮아서 사라진 것이 아닙니다. 숫자가 바로 그 이야기였기 때문에 사라진 것입니다 — 다른 누군가가 당신 대신 읽기 전에 당신의 숫자가 읽히도록 만드세요.