Token Reduction Is Not Cost Reduction
本論文は、コーディングエージェントのコンテキストにおけるトークン数の削減は、プロンプトキャッシュによるトラフィックの支配性とタスク失敗のリスクがあるため、必ずしも請求コストの低減に直結しないことを示し、代わりに、単なるトークン削減量ではなく、成功率で調整された請求コストに基づいてコスト効率を評価すべきであると論じている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ハイテクな探偵事務所を経営していると想像してください。そこでは、超スマートなAI探偵(「コーディング・エージェント」と呼ばれます)が、ファイルを読み、コマンドを実行し、あなたとチャットをすることで謎を解いています。彼らがファイルを読んだりコマンドを実行したりするたびに、クラウドプロバイダーから請求書が届きます。
長い間、誰もがコストを抑える最善の方法は、探偵に読ませるテキストを「減らす」ことだと考えてきました。その論理は単純でした。「ファイルを圧縮すれば、単語数が減り、請求額も下がる!」というものです。それはまるで、スーツケースの隙間の空気を押し出して荷物を小さくするような、完璧な計画に聞こえました。
しかし、「Token Reduction Is Not Cost Reduction(トークン削減はコスト削減ではない)」と題されたこの論文は、そのスーツケースの比喩が罠であることを告げています。著者たちは、大規模な実験を行いました。7つの異なるコードベースと3つの異なるAIモデルを用い、2,908回以上の探偵の実行プロセスを検証し、実際に何が起きているのかを調べました。
ここで驚きの事実が判明しました。テキストを縮小しても、必ずしも請求額が下がるとは限らないのです。 実際、テキストを縮小したことで、請求額が「上がってしまう」ことさえあります。
「キャッシュされたメモリ」の衝撃
最大の衝撃は、お金がどこへ消えているかという点です。著者らは請求の内訳を分析し、再構成されたコストの87%(実際の請求額の約80%)が、「プロンプト・キャッシュ・トラフィック」と呼ばれるものから発生していることを発見しました。
AIのメモリを、超高速で魔法のようなホワイトボードだと考えてみてください。
- ホワイトボードに書き込む(キャッシュ作成): これにはお金がかかりますが、一度きりの料金です。
- ホワイトボードから読み取る(キャッシュ読み取り): これは非常に安価で、割引クーポンをもらうようなものです。
- 新しいテキスト(非キャッシュ入力): これが最も高価な部分ですが、実は全体のほんの一部(わずか1.3%!)に過ぎません。
しかし、ホワイトボードには明確に表示されない隠れたコストがあります。著者らは、標準的な内訳では説明できない**8.7%**の「未帰属の残差(unattributed residual)」が請求書の中に存在することを発見しました。この残った塊はランダムなものではなく、AIがどれだけ「思考」しているかに直接比例します。Haiku 4.5モデルにおいて、「思考の労力(thinking effort)」の設定を高くするほど、この謎の請求額は大きくなります。これは、テキストが小さく見えても、AIがトークン数には現れない高価な「精神的作業」を行っている可能性を示唆しています。
問題は、テキストを圧縮すると、単に「新しいテキスト」の部分を節約できるだけではないということです。圧縮によって、「ホワイトボードからの読み取り」の部分を台無しにしてしまう可能性があるのです。もしファイルを圧縮しすぎると、AIは混乱したり、やっていたことを忘れたりして、状況を把握するために会話の履歴全体を読み直さなければならなくなるかもしれません。
AIがその履歴を読み直すたびに、それをホワイトボードに書き直す必要があります。そして、「書き込み」は高いのです! つまり、たとえ数単語を節約したとしても、AIに何度も「書き込み手数料」を支払わせることになってしまうのです。
「38%の削減」が招いたコスト増
著者らは、RTK-MLと呼ばれる高度な圧縮システムをテストしました。これは、ツール出力の生のテキストを**38.4%**削減することに成功したものです。「これで莫大な節約ができるはずだ」と思うでしょう?
ところが、違いました。
ペアテストの結果、このシステムは実際にはコストを6.8%増加させました(95%信頼区間は [+2.8, +11.3])。
なぜでしょうか? 圧縮があまりに強力だったため、AIが問題を解決するために余計なステップを踏まざなければならなくなったからです。AIは追加の診断ターンを実行したり、ファイルを読み直したり、より多くの質問を投げかけたりする必要がありました。これらの追加ステップのたびに会話履歴全体を再送信することになり、テキスト圧縮による節約分をすべて吹き飛ばしてしまったのです。
この論文は、「トークンが少ない = コストが低い」という考えを明確に否定しています。彼らは、どれだけのテキストを削除したかと、どれだけの金額を節約できたかの関係性は、実質的に存在しないことを突き止めました。相関関係は0.15と極めて弱く、これはコイン投げの結果に近い、ほぼゼロに近い数値です。
「壊れたアンカー」の災難
圧縮が裏目に出るもう一つの方法は、AIが仕事を遂行するために必要な「手がかり」を壊してしまうことです。
著者らは、Go言語のプログラミング・タスクに対して特別なテストを行いました。その結果、テキストを圧縮すると、AIが「バーベタイム・エディット・アンカー(逐語的な編集の目印)」、つまりバグを修正するためにコピー&ペーストする必要がある正確な、バイト単位でのコード行を見失うことがあることが分かりました。
配管の漏れを直そうとしている場面を想像してください。しかし、読んでいる指示書が圧縮されすぎて、切断すべき特定の箇所がぼやけたシミのようになってしまったとします。AIは修正を試みますが、「パッチ(修正箇所)」が適合しません。なぜなら、指示が破損してしまったからです。
- 圧縮なし: AIは40回中27回のパッチ適用に成功しました。
- 圧縮あり: AIは40回中15回しか成功できませんでした。
この特定のテストでは、圧縮版は試行ご回あたりのコストが高くなっただけでなく、成功率自体も低下しました。著者らは、圧縮版は試行あたりの見た目のコストは安かったものの、「解決した問題あたりのコスト」で見ると、失敗が多すぎたために実際には2倍($0.515 vs $0.248)になっていたと指摘しています。
「ブラックボックス」の代償
彼らはまた、メッセージがAIに届く前に内容を書き換える仲介役として機能する、Headroomという別のツールもテストしました。これは、財布にとって完全な災難でした。何もしない場合よりもコストが48.4%高くなり(95% CIは [+42.3, +55.0])、しかも成功率は向上しませんでした。
結論
この論文が結論づけているのは、AIコーディング・エージェントの費用を節約したいのであれば、単に「トークンカウンター」を見て勝ったつもりになってはいけない、ということです。
- 証明されたこと: これらの具体的な現実世界のテストにおいて、テキストを削ることは確実にコストを下げるとは限りませんでした。実際、RTK-MLシステムでは、かえって高価になり、Headroomではさらに高価になりました。
- 測定されたもの: 彼らは推測したのではなく、メインのキャンペーンだけで約175.92ドルに達する、実際の請求に基づく2,908回の実行プロセスを追跡しました。さらに、標準的なトークン数では説明できない、思考の労力に比例する**8.7%**の請求額も計測しています。
- 提案: 圧縮ツールが本当に機能するかを知る唯一の方法は、削除された単語数ではなく、**「成功したタスクあたりの最終的な請求額」**を測定することです。
ですから、次に誰かが「データを50%圧縮して節約しました!」と言ってきたら、こう微笑んで言い返してやりましょう。「なるほど。でも、そのせいでAIが本を最初から読み直す羽目になっていないか確認したかい?」と。AIエージェントの世界では、時として最短ルートが最も高くつくこともあるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。