← 最新の論文
🤖 AI

BONSAI: Evolvability-Guided Tree Search over Skills

BONSAIは、進化可能性に基づいたモンテカルロ木探索を用いることで、過学習によるスパイクと改善可能なプラトーを区別する、凍結されたエージェントのための新しいスキル最適化フレームワークであり、ホールドアウト精度において既存のベースラインを大幅に上回っています。

原著者: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、非常に賢いロボットに、スプレッドシートの修正や難解な数学の問題の解決といった複雑な仕事のやり方を教えようとしています。ただし、一つ問題があります。そのロボットは「凍結」されています。その脳は固定されており、あなたはロボットを再学習させたり、ニューロンを微調整したり、人間が学生のように間違いから学ばせたりすることはできません。唯一、それを向上させる方法は、英語による一連の指示、つまり「スキル(技術)」を書くことだけです。このスキルを、単なる単純なコマンドとしてではなく、どの道具を手に取り、どのような落とし穴を避け、回答を提出する前にどのように作業をダブルチェックすべきかを正確に伝える、詳細な「現場マニュアル」として考えてください。

科学者たちが直面している大きな問いは、「いかにして完璧なマニュアルを書くか?」ということです。もし、少し変更を加えてはテストし、うまくいったものだけを残すという方法を繰り返すと、行き詰まってしまうかもしれません。それは、地図には現在の高度しか表示されていない状態で登山をするようなものです。あなたは、非常に高く見えるものの、非常に鋭く尖った頂上に到達したかもしれません。しかし、その頂上はあまりに狭いため、次の一歩を踏み出した瞬間に崖から転落してしまいます。あるいは、あなたは広くて緩やかな高原にいるかもしれません。そこでは、一歩進むごとにさらに高い場所へと導かれますが、現在の高さを見るだけではその違いを判別することができません。この論文は、生物学から借りてきた「進化可能性(evolvability)」という概念を用いて、この風景をナビゲートする新しい方法を紹介しています。進化可能性とは、たとえ道を間違えたとしても、優れた結果を生み出し続ける能力のことです。


問題点: 「鋭い頂(シャープ・ピーク)」の罠

IBM Researchの研究者たちは、私たちがこれらのAIマニュアルを改善する方法における欠陥に気づきました。標準的な手法は単純です。マニュアルを取り、AIにそれを書き換えさせ、新しいバージョンをテストし、スコアが上がればそれを保持し、下がれば捨てます。

問題は、この方法が「盲目」であることです。これは現在のマニュアルのスコアしか見ていません。この方法では、マニュアルが「広い高原(小さな変化を加えても通常はさらに良い結果につながる、安全で安定した領域)」にあるのか、それとも「過学習による鋭いスパイク(スコアは高いが、わずかな変化でスコアが崩壊してしまう脆弱な頂上)」の上に位置しているのかを判別できません。もしスパイクの上にいるなら、次の編集によって一つの小さなエラーは修正されるかもしれませんが、機能していた他の10個のことが壊れてしまうでしょう。標準的な手法は、高いスコアだけを見て、崖から転落していく道を歩み続けてしまうのです。

解決策: BONSAI と 「進化可能性」 のコンパス

この問題を解決するために、チームは BONSAI と呼ばれる新しいフレームワークを作成しました。単に「今現在」のマニュアルがどれほど優れているかを見るのではなく、BONSAIは「そのマニュアルの周辺環境はどうなっているか?」と問いかけます。

彼らは自然界から借りた巧妙な比喩、**「進化可能性(Evolvability)」**を使用しています。生物学において、ある種は今日どれだけ生き残れるかだけでなく、将来的に有用な子孫を出し続けられる能力によって判断されます。広い高原にいる種は、突然変異しても生き残ることができます。一方、鋭いスパイクにいる種は、少し変化しただけで絶滅してしまいます。

BONSAIは、完璧なマニュアルを探すプロセスを、木を育てることに例えています。

  1. 木(The Tree): 一つの「種」となるマニュアルから始まります。
  2. 枝(The Branches): AIがマニュアルを書き換えるたびに、新しい枝(子ノード)が成長します。
  3. コンパス(The Compass): 次にどの枝を探索するかを決める際、BONSAIは単に最も高いスコアを持つ枝を選ぶのではありません。それは、その枝が「最高の未来」を持っているように見える枝を選びます。彼らは進化可能性と呼ばれるスコアを計算します。これは基本的には、そのマニュアルに加えられたあらゆる小さな変化(突然変異)の平均スコアです。

もしマニュアルが「スパイク」の上にあるなら、その周囲のスコアは悲惨なものになり、進化可能性のスコアは低くなります。BONSAIはそれを回避します。もしマニュアルが「高原」の上にあるなら、その周囲のスコアも良好であり、進化可能性のスコアは高くなります。BONSAIは、こうした安全で生産的な領域へと深く潜り込んでいくのです。

仕組み: 「グラフト(接ぎ木)」のトリック

研究者たちは、GRAFT と呼ばれる特別な機能を追加しました。想像してみてください、あなたには二つの枝があります。一つの枝は「数学の問題」の扱い方を学び、もう一つの枝は「スプレッドシート」の扱い方を学んでいます。これらは異なる経路にあり、互いに会話することはありません。

通常、AIは一度に一つのマニュアルしか見ることができないため、これらのスキルを組み合わせることはできません。しかし、GRAFTは、AIが「数学」の枝を覗き込み、そこで機能したテクニックを見つけ、そのテクニックを「スプレッドシート」のマニュアルにコピーすることを可能にします。これは、庭師が一本の木から強い枝を取り、新しい力を与えるために別の木に接ぎ木するようなものです。これは木の構造を壊すことなく行われ、AIが探索の異なる部分から最高のアイデアを混ぜ合わせ、組み合わせることを可能にします。

結果: より高く登る

チームは、以下の3つの課題に対してBONSAIのテストを行いました。

  1. SpreadsheetBench: Excelファイルの修正。
  2. SearchQA: 検索結果を用いたクイズへの回答。
  3. LiveMathematicianBench: 数学問題の解決。

彼らは、300億パラメータを持つ凍結されたAIエージェント(「実行者」)と、マニュアルを書くための別のAI(「最適化器」)を使用しました。計算資源(「予算」)が同じであることを確認した上で、BONSAIを他の2つの手法、GEPA および SkillOpt と比較しました。

結果は明白でした。

  • SpreadsheetBench において、BONSAIは初期のマニュアルよりも精度を 5.71ポイント 向上させ、競合する最高の手法(GEPA)を 2.14ポイント 上回りました。
  • SearchQA において、初期のマニュアルより 6.57ポイント 向上しました。
  • LiveMathematicianBench では、その差は歴然でした。BONSAIは 64.91% の精度に達しましたが、初期のマニュアルはわずか 28.23% であり、競合のGEPAは 56.14% でした。

研究者たちは、「進化可能性」のコンパスをオフにして、単にAIに貪欲に最高スコアを追いかけさせた場合(従来のメソッドのように)、AIが早い段階でそれらの「鋭いスパイク」に捕まり、改善が止まってしまうことを発見しました。しかし、BONSAIは、どの経路が安全に探索できるかを知っていたため、より深い場所でより良い解決策を見つけ続けることができたのです。

まとめ

この論文は、凍結されたAIエージェントをより賢くするためには、単に「現在の最高スコア」を探すべきではないことを示唆しています。むしろ、「最も有望な近隣環境」を探すべきなのです。即時的で脆弱な勝利よりも、安定性と将来の可能性を重視するツリー探索メソッドを用いることで、BONSAIはAIが従うべきより優れた指示を見つけ出しました。それはAIの脳を再学習させる必要はなく、ただより優れた現場マニュアルを書くだけであり、どの道が安全に歩めるかを知ることでそれを成し遂げたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →