← 最新の論文
🤖 AI

When Does Restricting a Coding Agent to execute_code Help? A Regime ×\times Agent-Design Ablation

本論文は、コーディングエージェントを単一の `execute_code` ツールに制限することが、ツール豊富な環境を使用するのと同等に効果的であることが多く、かつ頻繁により安価であることを実証しており、最適なツールの表面(tool surface)は、いずれか一方の要因のみによってではなく、タスクのレジームと特定のエージェント設計との相互作用によって共同で決定されることを明らかにしている。

原著者: Hong Yang, Qi Yu, Travis Desell

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Hong Yang, Qi Yu, Travis Desell

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの手元には、壊れたコードを直したり、数学のパズルを解いたりするのが仕事の、超スマートなロボット助手がいるとします。今、テック業界では、このロボットが仕事を完遂するために、どのようにコンピュータと対話すべきかについて、大きな論争が起きています。

ある人々は、「あらゆるタスクのための専用ボタンを備えた、フル装備のツールボックスを与えよ!」と言います(豪華なIDEのようなもの)。
他の人々は、「ただコマンドラインを与えて、シェルコマンドを打ち込ませればいい!」と言います(映画に出てくるハッカーのようなもの)。
第三のグループは、「いや!ただPythonスクリプトを書かせて、一度にすべて実行させるんだ!」と言います(execute_code アプローチ)。

この論文は、どの方法が実際にコストを節約し、仕事を完遂できるかを競わせる、巨大で公平な審判のようなものです。彼らは単に推測したわけではありません。全く同じロボット(ClaudeとCodexという2つの異なるモデル)を、全く同じタスクに対して走らせましたが、その際、ロボットに許可された「道具」だけを変更しました。

以下に、その結果を分かりやすいストーリーとして分解して説明します。

主な発見:それはロボットと仕事次第である

最大の驚きは何でしょうか? それは、「最高のツール」というものは一つも存在しないということです。勝者は、誰が何をしているかによって変わります。

このように考えてみてください:

  • 「数学のパズル」の仕事(Artifact タスク): もしロボットが計算やデータ処理を行っているなら、「スクリプトを書いて実行する」方法(code_only)が明確な勝者です。これは、完璧なレシピを一つ書き上げ、一度に料理を完成させるシェフを雇うようなものです。

    • Claude ロボットの場合、この方法でコストを 24.6% 削減できました。
    • Codex ロボットの場合、約 6.7% の削減となりました(ただし、論文によれば、これはコイン投げのように少し不安定な結果です)。
    • 結論: 数学やデータに関しては、スクリプト方式の方が安上がりであり、かつ問題解決能力も同等です。
  • 「乱れたコードベースの修正」の仕事(SWE-bench タスク): これはより複雑な作業です。これらのタスクは、複雑なプロジェクト内の多くのファイルを編集することを伴います。

    • Codex ロボットを使用する場合: スクリプト方式が依然としてチャンピオンです! これにより、コストを 19.9% 削減できました。なぜなら、スクリプト方式は、多くの小さなリクエストを一つの大きなパッケージにまとめることができるからです。例えるなら、50回歩いて荷物を運ぶのではなく、50個の荷物を積んだ配送トラックを使うようなものです。
    • Claude ロボットを使用する場合: おっと。スクリプト方式の方が、実は高くなってしまいました(14.4% 増)。ただし、論文ではこれは統計的に「証明された」差ではなく、あくまで強い傾向であると注記されています。なぜでしょうか? Claudeにとって、ファイルを編集するためにスクリプトを書くことは、タイヤを交換するために新しい車を組み立てるようなものです。編集内容をコードで説明するためにあまりにも多くの言葉(トークン)を消費してしまい、「編集の摩擦(edit friction)」を生んでしまうのです。

この論文が否定したもの

この論文は、「一つのツール表面が常にすべての人にとって優れている」という考えに対し、明確に反論しています。

  • 否定されたこと: 「特別なIDEボタンが常に必要である」(Codexがスクリプト方式で勝利したため)。
  • 否定されたこと: 「Bashコマンドだけで十分である」(数学タスクにおいてスクリプト方式がより安価だったため)。
  • 否定されたこと: 「コード実行が常に最も安価である」(複雑なコード修正において、それがより高価になったため)。

著者たちは非常に明確に述べています。ツールそのものに基づいてツールを選ぶことはできません。「ロボットの脳」と「仕事の種類」の組み合わせを見なければならないのです。

「合格率」の驚き

ここが最も重要な部分です。コストは変わりましたが、成功率は変わりませんでした。

二人のランナーを想像してください。一人は重いブーツを履いて走り(高価なツール)、もう一人はスニーカーを履いて走っています(安いツール)。論文の結果、両方のランナーは全く同じ速さでゴールに到達しました。

  • ロボットが豪華なツールボックスを使おうが、Bashコマンドを使おうが、あるいはスクリプト方式を使おうが、正しく解決できたタスクの割合はほぼ同一でした(3パーセント以内の差)。
  • 「スクリプト」方式は、ロボットを賢くも愚かにもしませんでした。それは単に、ゴールへの「歩き方」を変えただけなのです。その歩みがスプリント(安価)になることもあれば、つまずき(高価)になることもありました。

なぜコストが変わったのか?

論文は、スクリプト方式がなぜ安くなったり高くなったりしたのかを掘り下げています。

  1. 「編集の摩擦」税(Claude の場合): Claudeがスクリプト方式を使ってファイルを修正しなければならないとき、「5行目を変更せよ」と言うためだけに長いPythonスクリプトを書く必要がありました。これは、大量の「出力トークン(ロボットがタイピングしなければならない言葉)」を消費しました。まるで、ページをめくるたびに通行料を支払っているようなものです。これは主に、ロボットが失敗したり苦戦したりしたタスクで発生し、それらの特定の実行を非常に高価なものにしました。
  2. 「バッチ処理」ボーナス(Codex の場合): Codexがスクリプト方式を使用すると、多くの小さなコマンドを一つのスクリプトに詰め込むことができました。コンピュータに対して「ファイルAを読め」、「次にファイルBを読め」、「次にファイルCを読め」と(3回の別々の往復で)頼む代わりに、「A、B、Cを一度に読め」と頼むことができました。これにより、膨大な量の「入力トークン(ロボットが読む言葉)」を節約できました。
  3. 「失敗する実行」の影響: コード修正タスクにおけるClaudeの追加コストは、主にロボットがすでに失敗する運命にあったときに発生しました。それは、車がぐるぐる回っている間にガソリン切れになるようなものです。スクリプト方式が失敗を引き起こしたのではなく、失敗した試行のコストを高くしただけなのです。

どれほど確かなのか?

著者たちは、数学タスクCodex ロボットの結果については非常に自信を持っています。彼らは、結果が単なる偶然ではないことを確認するために、これらに対して3つの「シード(ランダムな開始点)」を用い、93 個の数学タスクと 100 個のコード修正タスクでテストを行いました。コード修正タスクにおけるCodexの節約は、統計的に有意でした(19.9% の減少、p値は 2.0 × 10⁻⁹ であり、これは事実上ゼロの確率、つまり偶然である可能性がほぼないことを意味します)。

しかし、コード修正タスクにおける Claude ロボットについては、結果は少し曖昧です。コストは 14.4% 上昇しましたが、統計テストによれば、これは「決定的な証拠(slam dunk)」とは言えませんでした(p値は 0.12)。著者たちはこれを「方向性を示すもの(directional)」と呼んでいます。つまり、傾向は見られるものの、それが偶然の紛らわしいものではないと100%確信するためには、もっと多くのテストを行う必要があるということです。

まとめ

もしあなたがコーディングエージェントを作っているなら:

  • 推測してはいけません。 「最高の」ツールは、あなたの特定のロボットと、特定の仕事によって決まります。
  • 数学/データに対して: 「スクリプトを書く」方法を試してください。その方が安く、性能も同等です。
  • コード修正に対して: それによります。Codexを使うなら、スクリプト方式は素晴らしいものです。もしClaudeを使うなら、標準的な編集ツールを使い続ける方がよいかもしれません。特に難しい問題においては、スクリプト方式だと「編集の摩擦」に足を取られてしまう可能性があるからです。
  • 知能については心配しないでください: ツールを変えても、ロボットを賢くしたり愚かにしたりすることはありません。それは単に、旅の「価格設定」を変えるだけです。

論文は次のように結論づけています。「最も安価な」エージェントの動かし方は普遍的なルールではありません。それは、ツールをロボットとタスクに適合させなければならないパズルなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →