Tunable Tool-Call Rates in LLM Agents via Representation Steering
本論文は、モデルの残差ストリームから抽出された単一の学習不要な線形ステアリング方向を適用することで、再学習を行うことなく、LLMエージェントにおけるツール呼び出し率を推論時に精密に制御可能であり、かつ、多様なアーキテクチャやツールタイプにわたって精度とコストのトレードオフを最適化するために呼び出しの傾向を単調に調整できることを実証するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、質問に答え、物語を書き、問題を解決することができる、テキスト生成の強力なエンジンです。しかし、これらのシステムには根本的な限界があります。それは、内部メモリに保存された情報に完全に依存しているという点です。質問が、記憶するにはあまりに無名すぎる、あるいは新しすぎる、あるいは複雑すぎる事実を必要とする場合、モデルはしばげに自信満々に推測を行い、もっともらしく聞こえるものの、完全に間違った回答を生成してしまうことがあります。これを修正するために、開発者はこれらのモデルに対し、回答する前にウェブ検索エンジンや計算機などの外部ツールを使用して情報を検索することを学習させてきました。しかし、モデルに対して、いつ立ち止まってツールに手を伸ばすべきかを教えることは、驚くほど困難な作業です。モデルがツールを呼び出しすぎると、時間とコストを浪費し、意図しないアクションを引き起こすリスクがあります。逆に、ツールを呼び出すのが少なすぎると、正しい答えを見つける機会を逃し、自信満々に間違ったままになってしまいます。
研究者たちは、こうした決定をより信頼性の高いものにする方法を長年模索してきました。通常は、新しい例を用いてモデルを再学習させるか、モデルに与えられる指示を注意深く書き換えるといった手法が取られます。これらの手法はコストがかかり、硬直的です。一度モデルが学習されたり、プロンプトが設定されたりすると、その挙動を変更するにはプロセスを最初からやり直す必要があります。カリフォルニア大学サンタクルーズ校とカリフォルニア大学バークレー校の研究者による新しい研究は、異なるアプローチを提案しています。彼らは、ツールを使用するという決定は、再学習を必要とするような複雑で隠れたプロセスではないことを発見しました。むしろ、それはモデルの内部メカニズムにおける単一の単純な信号によって制御されており、モデルの学習内容や指示を変更することなく、ダイヤルを回すようにリアルタイムで調整できるものなのです。
研究者たちはまず、検索エンジン、計算機、コーディングインタープリターといった利用可能なツールのリストが提示されたときに、言語モデルがどのように振る舞うかを観察することから始めました。彼らは、モデルが実際に回答を話したり書いたりする前に、「ツールを一切使うつもりがあるかどうか」を示す特定の内部信号を生成していることに気づきました。ツールを使うと決めたときのモデルの内部状態と、メモリから回答すると決めたときの内部状態を比較することで、チームは、モデルの数学的空間の中に「ツールを呼び出したいという衝動」を表す特定の方向を特定しました。この方向は、計算機や検索エンジンといった特定のツールに紐付いているのではなく、「ツールを使う」ということを単に意味する一般的な信号なのです。
この発見をテストするために、研究者たちはモデルを再学習させたり、プロンプトを変更したりはしませんでした。代わりに、特定されたこの「方向」を、回答を生成する際のモデルの内部処理に加算しました。この信号を少量加えることで、モデルがツールをより頻繁に使うよう促すことができました。逆に、この信号を差し引くことで、ツールを使う衝動を完全に抑制することもできました。彼らは、この調整が驚くほど精密に機能することを発見しました。信号の強度を高めるにつれて、モデルがツールを呼び出す割合は、ほぼゼロからほぼ100パーセントまで滑らかに上昇しました。重要なのは、モデルがランダムにツールを呼び出し始めたのではないということです。研究者がモデルにツールをより多く使うよう促すと、モデルは、歴史的な事実や複雑な計算など、自力では答えられない質問を的確にターゲットとし、すでに答えを知っている質問については無視しました。
この研究はまた、この制御メカニメントが高度に適応可能であることも明らかにしました。研究者たちは、3つの特定のツールを含むセットアップから「ツール使用」の信号を抽出し、それを天気予報、株価照会、メール送信を含む全く異なるツールのセットに適用しました。同じ信号が、あたかもそれらの新しいツールのために特別に学習させたかのように、効果的に新しいツールを使用するようにモデルを誘導することに成功しました。さらに、この手法は、小規模で標準的なモデルから、業界で使用されている大規模で複雑なシステムに至るまで、幅広い異なるモデルのアーキテクチャにわたって機能しました。あらゆるケースにおいて、この単一の信号により、モデルが正しい文章を形成したり、呼び出し後に適切なツールを選択したりする能力を損なうことなく、ツール呼び出しの挙動を上げ下げすることができました。
研究者が、モデルが実際にウェブ検索を実行できるライブ環境でこの手法をテストしたところ、結果は驚くべきものでした。難易度の高い事実に関する質問のセットにおいて、調整されていないモデルが正しく回答できたのは約29パーセントであり、検索すべき場面でも推測を行っていました。ツール使用を促すステアリング信号を適用したところ、精度は56パーセントに跳ね上がり、性能がほぼ倍増しました。この改善は、モデルが質問あたり約1回の検索呼び出しを行うという、管理可能なコストで実現されました。研究者たちは、ツールの使用コストと回答の正確さの間に明確な経路を見出すことができ、オペレーターがニーズに適した特定のバランスを選択できることを示しました。
この研究は、AIの挙動を制御するために重い再学習や複雑なプロンプトエンジニアリングが必要であるという仮定に異を唱えるものです。これは、決定的な意思決定プロセス――外部の助けを求めるべきかどうかを知ること――が、モデルの内部状態における単純な線形方向としてエンコードされていることを証明しています。この方向を見つけ出し、調整することで、研究者はモデルの根本的な学習を変更することなく、AIエージェントをより信頼性が高く効率的なものにできます。この手法は、AIシステムのコストと正確さを微調整するための軽量な手段を提供し、ツールが必要なときにのみ使用し、過度な依存や危険な推測という落とし穴を回避することを保証します。この技術は、ツールの実行方法におけるエラーを修正するものではありませんが、AIエージェントが行う最も基本的かつコストのかかる選択、すなわち「自ら行動するか、助けを求めるか」を管理するための強力な新しいレバーを提供します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。