Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents
この事前登録されたベンチマーク研究は、プロンプトの言い回しやハーネス設計が、タスクの成功率を向上させることなく、大規模コーディングエージェントの推論コストをしばしば2.4倍から30倍も膨張させていることを示しており、「複数のアプローチを開発せよ」といった特定の指示や特定のハーネスアーキテクチャが、この非効率性の主な要因となっています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、壊れたトースターを直すために、超スマートなロボット助手を採用していると想像してください。単にロボットに直してほしいだけでなく、まず「どうやって直すべきか」を考えさせたいのです。人工知能の世界では、これらの「思考」のステップは**推論トークン(reasoning tokens)**と呼ばれます。人間がメモを取ったり、線を引いて消したり、パズルを解く前にさまざまなアイデアを試したりするように、これらのAIモデルは、答えを出す前に「熟考」するために時間と費用を費やします。
しかし、ここには落とし穴があります。ロボットが行うすべての思考、たとえそれが捨てられた思考であっても、あなたはそれに対して料金を支払うことになります。もしあなたがロボットに「一生懸命考えて」とか「5通りの方法を試して」と頼んだら、ロボットはまさにその通りに行動し、単に「トースターを直して」と頼んだ時よりも、予算を使い果たしてしまうかもしれません。この論文は、研究者が探偵のように振る舞い、あなたの指示のどの言葉がロボットに無駄遣いをさせ、どの言葉が予算を抑えるのかを突き止めようとしている、コンピュータサイエンスの奇妙な領域を探求しています。彼らはただ推測しているのではなく、異なるフレーズが具体的にどれほどのコストを生むのかを見るために、何千回もの制御された実験を行っています。
プロンプト実験の真実:なぜあなたの言葉がコストを生むのか
6機の異なる超知能ロボットシェフの艦隊を持っていると想像してください。あなたは彼らに、24の特定の料理の課題を解決するためのコード(コンピュータにとってのレシピのようなもの)を書かせようとしています。しかし、ひねりがあります。シェフが料理をしている間に生じる、あらゆる思考に対して、あなたは料金を支払わなければなりません。研究者たちはこう知りたかったのです。「注文の書き方によってシェフの思考量は変わるのか? そして、その思考は料理の味を本当に良くするのか?」
これを解明するため、彼らは大規模で非常に組織化されたキッチンラボを設置しました。彼らは単に推測したのではなく、料理を始める前にルールを書き留めました(これは「事前登録」と呼ばれ、買い物に行く前にメニューを書いておくようなものです)。彼らは、シェフとやり取りするために2種類の異なるキッチンマネージャー(「ハーネス」と呼ばれます)を使用しました。一方は直接的で簡潔なマネージャー、もう一方は非常に饒舌で詳細なマネージャーであり、すべての注文に対して膨大な背景情報を送ってきます。
4,600回以上の調理セッションを実行した後、彼らは以下の発見をしました。
1. 「あらゆる方法を試せ」という罠
最大の無駄遣いは、ロボットに**「いくつかのアプローチを開発し、それらを比較せよ」と命じることでした。
賢い指示に聞こえますよね? 例えば、ソースを3種類試してから一つを選ぶ優れたシェフのように。しかし、これらのAIロボットにとって、この指示は災難でした。これにより、通常よりも2.4倍から7.4倍多く思考させたのです。さらに最悪なことに、最終的な料理(コード)は全く良くなりませんでした**。彼らは、結局使わない選択肢について考えるために、余計なキャッシュを燃やしただけなのです。それは、サンドイッチのレシピを3つ書いて、すべてを試食させた挙句、単に「サンドイッチを作って」と頼んだ時と同じサンドイッチを出すシェフに、お金を払っているようなものです。
2. 何の意味もない「魔法の言葉」
人々は、より良い結果を得るために「ステップ・バイ・ステップで考えて」や「深く考えて」といった言葉をよく使います。研究者たちは、これらのコーディングロボットにとって、これらの「深い思考」を促す魔法の言葉は、単なる純粋な無駄であることを発見しました。これらは結果を改善することなく、ロボットを1.6倍から2.2倍長く思考させました。それは、電卓に対して「2 + 2」を計算する前に「一生懸命考えて」と言うようなものです。答えは同じですが、あなたは余分な思考時間に対して料金を支払ったことになります。
3. 「境界付きの効率性」というハック
一方で、お金を節約する秘策がありました。ロボットに厳格な枠組みを与え、目標は何か、ルールは何か、そしていつ止まるべきかを正確に伝えると、ロボットの思考時間は実際に減少しました。あるロボットは、思考時間を半分にまで削減しました。この「境界付きの効率性(bounded efficiency)」テンプレートは無料で利用でき、コードの質を損なうことなく、ロボットをより速く、より安価にしました。
4. シェフよりもマネージャーが重要
最も驚くべき発見の一つは、**「誰をロボットのマネージャーとして雇うかが、ロボット自体よりも重要である」**ということでした。
彼らは同じロボットを2種類の異なるマネージャーでテストしました。一方のマネージャー(PI.DEV)は効率的でした。もう一方のマネージャー(Claude Code)は、毎回のメッセージとともに12倍から15倍も大きい「導入のスピーチ」を送ってくるマイクロマネージャーのようでした。ロボットが問題を完璧に解決した場合でも、マイクロマネージャー版は会話の処理方法によって、5倍から30倍ものコストがかかりました。結局のところ、(AIを包み込んでいるソフトウェアである)「マネージャー」こそが、AI自体よりも大きな請求額の要因となっていることが多いのです。
5. 「隠れた割引」という錯覚
研究者たちは、企業がこれらのロボットに対してどのように料金を請求しているかも調査しました。彼らは、企業が毎回送る「導入のスピーチ」を記憶することで、自動的にコストを節約していることを発見しました。これにより、請求額の約**61%**が節約されました。しかし、研究者たちは警告しています。これを「効率化」と呼んではいけません。 これは単なる、以前と同じ作業に対する「割引」に過ぎないからです。ロボットがより速く、あるいはより賢く働いたわけではありません。企業が、ロボットが記憶している部分に対して料金を請求しなかっただけなのです。
6. 新しいロボット、変わらぬ手法
新しい超高速ロボット(Kimi-K3)がリリースされた際、研究者はすぐにそれをテストしました。この新しいロボットは、本来であれば実行コストが低いのですが、同じ悪い指示(「複数のアプローチを試せ」など)を与えると、通常よりも15倍多くの無駄遣いをしたのです。教訓はこうです。ロボットがいかに賢く、あるいは安価になろうとも、悪い指示は常に過剰支出を招くということです。
まとめ
この論文は、**「どのように質問するかによって、答えが同じであってもコストが変わる」**という事実を証明しています。
- 実際にそれらが必要でない限り、ロボットに「多くのアプローチを試して」や「深く考えて」と命じてはいけません。
- 明確な境界線と停止条件を与えてください。
- ロボットを管理しているソフトウェアが、ロボット自体よりも高いコストを強いている可能性があることを覚えておいてください。
研究者たちは、すべてのデータ、コード、およびテスト用のレシピを公開しました。彼らは、AIエージェントの世界において、「思考のパフォーマンス(theater)」を演じるのではなく、明確な指示を与えることが、最もお金を節約し、仕事を完遂させる最善の方法であることを、すべての人に伝えたいと考えています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。