コンテンツにスキップ
AIOS
AIOS

Token コスト削減

Claude Code と Codex のトークン請求額は、注入コンテキスト、繰り返される履歴、過大なツール出力から膨らみます。作業方法を変えずにトークン使用量を削減するローカル圧縮境界(RTK、Caveman、Headroom MCP、ContextDB)を解説。

On This Page

AI コーディングエージェントのトークンコスト削減:Claude Code と Codex の予算管理

まず答え: コーディングエージェントのトークン請求額は 3 つの静かな漏れから膨らみます:使われない注入コンテキスト、繰り返される会話履歴、モデルウィンドウを溢れさせるツール出力。コストを下げるには圧縮境界を使います:注入ではなくプルベースのコンテキスト、ローカル出力圧縮(RTK / Caveman)、全履歴ではなく明示的検索(Headroom MCP)、再読不要でセッションを生き残るプロジェクトメモリ。AIOS はこの 4 つすべてをローカルで配線します——データがマシンの外に出ることはありません。

トークンは実際どこへ消えるのか

典型的なコーディングセッションは、頼んでもいないものにトークンを費やします:

  1. 注入コンテキスト — 現在のタスクが必要かどうかにかかわらず、すべてのプロンプトがプロジェクト序文を運ぶ。
  2. 繰り返される履歴 — 前回の回答を覚えているものが何もないため、エージェントが同じファイルを読み直す。
  3. ツール出力git diff、ログファイル、ブラウザスナップショットがそのままウィンドウに入り、モデルが下すべき判断を押しのける。

この 3 つを削れば、作業品質を落とさずに請求額が下がります。

4 つのローカル圧縮境界

境界 ツール 何をするか
プルベースのコンテキスト ContextDB プロンプトごとにプロジェクト全体を受け取るのではなく、エージェントが関連メモリを検索・想起する。
出力圧縮 RTK / Caveman コマンド出力をプロセス内でローカルにフィルタ・圧縮——ツール結果が 60〜90% 小さくなる。
明示的検索 Headroom MCP 後のステップでコンテンツが必要なときに圧縮・検索ツールを使う——すべてのリクエストを透過的に傍受しない。
モデル階層化 Model Router 有界で反復的な作業(抽出、分類)は安価なモデルで、判断の重いノードは強力なモデルを維持する。

今日できること

# Install AIOS locally
curl -fsSL https://github.com/rexleimo/aios/releases/latest/download/aios-install.sh | bash
source ~/.zshrc
aios init --all

# Verify compression boundaries and token config
aios doctor --native --verbose

そして測定します:同じタスクを AIOS ありとなしで実行し、プロバイダーが報告するトークン使用量を比較してください。アーキテクチャは トークンインテリジェンスのドキュメント、現場の数値は コスト危機の記事 にあります。

FAQ

圧縮は回答品質を損ないますか? いいえ——ノイズを除くのであってシグナルではありません。プルベースのコンテキストと出力圧縮は、ウィンドウ内の判断を保ち、定型文を落とします。

RTK や Caveman はクラウドサービスですか? いいえ。どちらもマシン上のプロセス内で動作します。RTK はコマンド出力をローカルでフィルタし、Caveman はエージェント出力のスタイルを圧縮します。データがマシンの外に出ることはありません。

素の codex や claude CLI を使い続けられますか? はい。AIOS は既存のクライアントの下に座ります。同じコマンドをそのまま使い、圧縮境界がその周りで働きます。

次のステップ

完全なアーキテクチャは トークンインテリジェンスと圧縮 を読むか、クイックスタート から始めてください。