Joint Optimization of Tool Creation and Use for Large Language Model Agents
本論文は、マルチ軸報酬を用いて単一のポリシー内でツールの作成と使用を共同で最適化する強化学習フレームワークであるSMITHを紹介しており、これにより4Bモデルがより大規模なベースラインを凌駕し、視覚的または表形式の学習データを必要とすることなく、多様なタスクにおけるツール拡張型推論を大幅に向上させることを実現している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人類の進歩は、常に私たちが作り出す道具に依存してきました。あらゆる新しい問題をゼロから解決するのではなく、私たちは単純なレバーから現代の世界を動かす複雑なソフトウェアに至るまで、世代を超えて洗練されてきた器具に頼っています。人間の言語を理解し生成できる高度なコンピュータプログラムである大規模言語モデルも、同様の限界に直面しています。これらのモデルは内部メモリに膨大な情報を蓄積していますが、正確な計算、最新の事実へのアクセス、あるいは信頼できる論理的推論を必要とするタスクには苦戦します。これを克服するために、研究者たちは、人間が難しい数学の問題を解くために計算機に手を伸ばすように、計算機や検索エンジンといった外部ツールを使用する方法をこれらのモデルに教えてきました。しかし、現在のシステムは、人間がすでに作成し提供したツールしか使えないという制限があります。もし人間が特定の新しいタスクのためのツールを作っていなければ、モデルは行き詰まってしまうのです。
この限界は、よりダイナミックなアプローチ、すなわち、モデルにオンデマンドで独自のツールを作成させることを教えるという方向への転換を促しました。そのアイデアは、モデルに問題を見極めさせ、それを解決するための小さなコードを書き、そのコードを使用して答えを見つけさせるというものです。しかし、これを行う既存の手法には根本的な欠陥があります。それらは通常、強力で高価なモデルにツールを書かせ、より弱いモデルにそれを使わせます。ツールを書くモデル自身がそれを使う必要がないため、モデルには、実際に明確で、信頼性が高く、呼び出しやすいツールを書くという動機が働きません。これは、ハンマーを作るが、それを振るう必要のない大工のようなものです。彼らは、単に自分が使うわけではないので、持ち手が滑りやすすぎたり、頭の部分が重すぎたりしても構わないと考えてしまうかもしれません。
ある研究チームは、この断絶を解決するために「SMITH」と呼ばれる新しいフレームワークを導入しました。核心となる革新は、単一のモデルに「道具を作る者」と「道具を使う者」の両方の役割を強制する学習手法です。このシステムでは、モデルに一連の例題を与え、コードとそれを使用する方法の明確な説明からなるツールを書かせます。その直後、同じモデルが、その全く同じツールを使って別の未知の問題を解決しようと試みます。もし説明が混乱していたり、コードが壊れていたりすれば、モデルは問題を解決できず、改善が必要であるという明確な信号を受け取ることになります。これにより、ツールはそれ自体によって使用できる能力がある限りにおいて価値があるのだという直接的なフィードメントループが生まれ、モデルは学習していきます。
研究者たちは、このアプローチを40億パラメータを持つモデルを用いてテストしました。これは、この分野でよく使われる巨大なモデルと比較すると比較的小さなサイズです。彼らは、算術パズルから論理ゲームに至るまで、13種類の異なる推論タスクを用いてこのモデルを訓練しました。結果は驚くべきものでした。訓練されたモデルは、未見の問題に対して高い精度を達成し、複雑な人間設計の指示に頼る手法や、単に利用の瞬間にツールを書くよう促される大型モデルをも上回りました。実際、この手法で訓練された小さなモデルは、新しいタスクのためのツールを作成する際、300億パラメータを持つ未訓練のモデルよりも優れた性能を示しました。これは、ツールを構築する方法を学ぶ能力は、単に膨大な量の生のメモリを持っていることよりも重要であることを示唆しています。
おそらく最も驚くべき発見は、これらの自作ツールが他のモデルにどれほど上手く転用できたかという点です。訓練された小さなモデルが書いたツールは、わずか3億5000万パラメータを持つさらに小さなモデルが、はるかに大きな未訓練のモデルと同等の性能を発揮するのを助けることができました。逆に、小さなモデルが書いたツールを非常に大きなモデルに与えた場合、その大きなモデルは、自らツールを書こうとした時よりも高い性能を発揮しました。これは、SMITHフレームワークによって作成されたツールが、単に一つのモデルに特化したトリックではなく、真に高品質で再利用可能なものであることを示しています。ツールは非常に効果的であり、モデルがテーブル(表)や画像に関するデータで訓練されていなかったにもかかわらず、複雑な表の解釈や画像に関する質問への回答といった、全く新しいタイプの問題に対しても性能を向上させました。
この研究はまた、学習プロセスがどのように構造化されているかの重要性も明らかにしました。研究者たちは、単にモデルにコードを書かせるだけでは不十分であり、ツールの説明がコードと一致しているか、そしてツールが呼び出されたときに実際に機能するかどうかでモデルを判断しなければならないことを見出しました。これらの異なる品質の側面を分離し、それぞれが正しく行われたときにモデルに報酬を与えることで、見た目は良いが使用できないコードを書いたり、説明は明確だがコードと一致しないものを書いたりするという一般的な落とし穴を回避しています。この注意深いバランス調整により、モデルは「正しく、かつ使いやすいツールを作る」という堅牢なスキルを学ぶことができました。
結局のところ、この研究は、より有能な人工知能への道は、より巨大なモデルを構築することではなく、モデルに自らの能力を構築させる方法を教えることにあることを示しています。創造と使用の間のループを閉じることで、研究者たちは、モデルが自分自身や他者が使用できるほど信頼できるツールを設計できることを証明しました。このアプローチは、人工知能の能力を拡張するためのスケーラブルな方法を提供し、人間がツールを提供してくれるのを待つのではなく、必要な特定の器具を自ら作り出すことで、新しい課題に適応することを可能にします。これらの知見は、ツール拡張型インテリジェンスの未来が、あらかじめ用意された静的なツールのライブラリにあるのではなく、モデルが自らの解決策を精巧に作り出すという、ダイナミックで自己改善的な能力にあることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。