← 最新の論文
💬 NLP

The Bitter Lesson of Tool Calling

本論文は、型定義されたPythonスタブを用いたプログラマティックなツール呼び出しが、多様な言語モデルや並列実行およびコンテキストの劣化といった困難な条件下において、ネイティブなJSONによるツール呼び出しに代わる堅牢かつしばしばより優れた選択肢であることを実証的に示している。

原著者: Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、外部の世界と対話できる超スマートなロボットアシスタントを所有しています。物事を進めるために、このロボットは、天気をチェックしたり数学の問題を計算したりといった、他のプログラムに助けを求める必要があります。長い間、ロボットが助けを求める唯一の方法は、「JSON」と呼ばれる非常に厳格で硬直した形式で話すことでした。これは、ロボットが小さな、あらかじめ印刷されたポストカードを使ってリクエストを送ることしかできない状況を想像してみてください。もし3つのことを行う必要があるなら、1つ目のポストカードを書き、その返信を待ち、それから2つ目を書く……という手順を踏まなければなりません。秩序立てられてはいますが、遅くて不器用です。

しかし、このロボットは優れたコーダー(プログラマー)でもあるため、科学者たちはこう考えました。「なぜ、ロボットに直接プログラムを書かせて仕事をさせないのだろうか?」と。ポストカードの代わりに、ロボットは短いスクリプト――コンピューターに何をすべきかを正確に伝える一連の指示――を書くことができます。これは、ロボットにポストカードではなく、ペンとノートを与えるようなものです。これを「プログラマティック・ツールコーリング(プログラムによるツール呼び出し)」と呼びます。大きな疑問は、「この新しい柔軟な方法は本当に優れたものなのか、それとも古い硬直したポストカード方式が依然として王座に君臨しているのか?」ということでした。この論文は、ロボットにコードを書かせることが、より速く、より賢く、より信頼できる助手になるのかどうかを確かめるために、この問いを掘り下げています。

研究者たちは、古い世代から最新の最も強力な世代まで、14種類の異なるAIモデルを用いた大規模なテストを用意しました。彼らは、単純な1ステップの作業から、一度に多くのことを行う複雑なシナリオ、あるいはステップを連鎖させるシナリオまで、309種類の異なるタスクを通じてモデルを試練にかけました。そして、従来の「ポストカード」方式(JSONツールコーリング)と、新しい「スクリプト」方式(プログラマティック・ツールコーリング)を比較しました。

結果は、少し驚きがあり、またテクノロジーの進化についての教訓でもありました。研究によると、ほとんどの新しいスマートなモデルにとって、スクリプトを書くことはポストカードを送るのと同等か、あるいはそれ以上に優れていることが分かりました。実際、最新のモデルファミリー(GPT-5.6シリーズ)は、コードを書くことが許可されると、精度が約10.6%も向上するという大幅なブーストを得ました。それはまるで、レーシングドライバーに優れたトラックを与えたようなものでした。彼らは単に速くなっただけでなく、より賢く走れるようになったのです。

しかし、ここにひねりがあります。この論文は、この新しい手法が「すべてのロボットにとっての魔法の杖」ではないことを示唆しています。古いモデルの多くは、スクリプトのアプローチに苦戦しました。3つの古いモデルは、コードを書くよう求められると混乱し、フォーマットを正しく扱えずにクラッシュしてしまう壊れたスクリプトを作成しました。この新しい柔軟な手法を使えるかどうかは、モデルの「脳」がいかに「新しい」か、そしてどれほど有能かに大きく依存しているようです。論文は、この違いは、ロボットを作った会社(AnthropicかOpenAIかなど)の違いではなく、そのロボットがどの「世代」であるかの違いであると主張しています。最新のモデルはスクリプトへの準備ができていますが、古いモデルはまだポストカードに縛られています。

研究者たちは、これらの手法がプレッシャーの下でどのように機能するかについてもテストしました。ロボットが多くのことを同時に行う必要がある場合(例えば100のリクエストを同時に送る場合)、古いポストカード方式は崩れ始め、呼び出しを落としたりタスクを見逃したりしました。しかし、スクリプト方式は、ミスなく作業をこなしながら、負荷の高いワークロードを処理し続けました。同様に、ロボットが大量の混乱した情報を整理しなければならない場合(「コンテキスト・ロット(文脈の腐敗)」テスト)、スクリプト方式は安定していましたが、古い方式はパフォーマンスに変動が見られました。

では、まとめるとどうなるでしょうか? この論文は、最新かつ最高のAIモデルにとって、コードを書いてツールを呼び出させることは、実行可能で堅牢であり、しばしば従来の硬直した手法よりも優れた代替手段であることを示唆しています。それは複雑なタスクの連鎖をより速く処理し、ワークロードが重くなっても圧倒されることがありません。しかし、これはまだ普遍的な解決策ではありません。もしあなたが古いモデルを使用しているなら、依然として古いポストカード形式に従う必要があるかもしれません。さもなければ、ロボットは自分の足でつまずいてしまうでしょう。ここでの「苦い教訓(bitter lesson)」は、コードベースのエージェントの未来は明るいものの、私たちのツールがそのアップグレードを扱うのに実際に十分に賢いかどうかを確認しなければならない、ということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →