OWN NEWS GATHER
← 戻る
Anthropic Blog

Anthropic、コーディング支援AI「Claude Code」のトークン消費を効率化する運用ガイドを公開

要点

  • Anthropicは、エージェント型コーディングツール「Claude Code」におけるトークン消費効率の最大化とコスト抑制のためのセッション運用手法を公開した。

  • 出力トークンは逐次処理されるため入力トークンの約5倍のコストがかかり、思考量の調整が重要であることが示された。

  • プロンプトキャッシュの活用により入力コストを通常の10分の1に抑えられる一方、途中の設定変更によるキャッシュ無効化への注意を促している。

  • タスクごとの /clear 実行やファイルへの @ メンション、離席前の /compact 実行など、具体的なセッション管理手順が提示された。

  • 米AIスタートアップのAnthropicは2026年8月14日、同社のエージェント型コーディングツール「Claude Code」において、トークン消費の無駄を省きセッションあたりの費用対効果を最大化するための運用手法を公式ブログで公開した。記事では、タスクごとの探索挙動によるコスト変動の仕組みやトークン価格の決定要因が解説され、効率的に作業を進めるための具体的な操作手順が紹介されている。

エージェント型ツールにおけるコスト変動の構造

Anthropicによると、従来の定額制エディタとは異なり、自律的にコードの探索や編集を行うエージェント型ツールでは、タスクごとに個別の計算コストが発生するという。たとえばテストコードの修正において、必要な2ファイルを直接編集して数ターンで終える場合と、不要な検索を重ねて多数のファイルを読み込みながら作業する場合とでは、得られる結果が同一であっても消費トークン数が大きく異なる。同社は、トークンの効率化とは使用量を単に減らすことではなく、要求した作業に対してトークンを的確に割り振ることであると説明している。

トークン価格を決定する3つの要素

記事では、トークン課金の実態がGPU等による推論時間であるとした上で、価格を左右する要因として「モデル選定」「トークン種別」「キャッシュ」の3点を挙げている。

モデル選定については、大規模モデルほど処理能力が高い反面でトークン単価が高くなるため、複雑な課題には大型モデル、定型作業には小型モデルを選択することが基本とされる。

トークン種別については、システム指示や履歴を読み込む入力(Prefill)に対し、思考やツール呼び出し、テキスト生成を行う出力(Decode)は1トークンずつ順次処理される。そのため、出力トークンはGPUの占有時間が長く、入力トークンの約5倍の価格が設定されているという。また、出力の多くを占める思考トークンの量は /effort コマンドで調整可能であり、定型作業向けに思考を完全に無効化する MAX_THINKING_TOKENS=0(Fable 5を除く)の指定も紹介されている。

プロンプトキャッシング(過去の同一な入力状態を再利用して計算を省略する仕組み)については、キャッシュからの読み出しコストは通常の入力価格の0.1倍(10分の1)となる。書き込みには最大2倍のコストがかかるものの初回のみであり、以降のターンで0.1倍の読み出しが続くためコスト削減につながる。ただし、キャッシュの有効期限は1時間であり、会話の途中で設定を変更するとキャッシュが無効化(バスト)される点に注意が必要だとしている。

コストを最適化する具体的なセッション管理手順

Anthropicは、セッション内でトークンを無駄なく活用するための実践的な手順として以下を挙げている。

  • タスク間のコンテキスト初期化: タスクの合間に /clear を実行し、過去の不要な履歴がモデルに再送信されるのを防ぐ。
  • 開始前の設定確定: セッション途中でモデルや思考レベルを変更するとキャッシュが無効化されるため、作業前に /model/effort で確認・設定する。
  • @ メンションによるファイル指定: ファイル名を文章で書く代わりに @ で指定することで、ファイルが直接添付され、余分な検索や読み込み処理を省くことができる。
  • コマンド出力の抑制とサブエージェント活用: ターミナル出力は会話内に蓄積されるため、不要な出力を抑える静音フラグ(quiet flag)を付与するか、サブエージェントで分離実行する。
  • 読み込み設定の事前点検: セッション開始時に /context を実行し、ロードされている CLAUDE.md や MCP(Model Context Protocol)ツールの定義から不要なものを削減する。
  • 離席前の会話圧縮: 1時間のキャッシュ失効に備え、作業を離れる前に /compact を実行してキャッシュが有効なうちに会話を圧縮する。
元URL