← 最新の論文
🤖 AI

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

本論文は、複雑なタスクにおける堅牢性と汎用性を確保するために、再構成、結果、および評価基準というテキストベースの損失関数を通じて最適化された帰納・演繹サイクルにより高品質で再利用可能な大規模言語モデルのスキルを自動的に生成するマルチエージェントフレームワーク「MIND-Skill」を導入する。

原著者: Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。あなたは非常に優秀だが、少し不器用なロボットアシスタントを持っています。あなたは「Venmo で友人に返金を送る」といった特定のタスクを、あなたが完璧に実行している動画を見せることで教えます。ロボットは動画を見ますが、単にあなたの動きをそのままコピーするのではなく、将来同様のタスクをこなすために、自分自身のためのルールブックを書こうとします。

問題は、ロボットが不適切なルールブックを書くと、行き詰まってしまう可能性があることです。例えば、あなたの特定の友人の名前を覚えてしまいすぎたり(具体化しすぎ)、あるいは役に立たないほど漠然とした指示を書きすぎてしまったり(抽象化しすぎ)します。

MIND-Skillは、これらの AI エージェントが自動的に完璧で高品質なルールブックを書けるように設計された新しいシステムです。これは、実際にルールが機能することを保証する巧妙な「先生と生徒」のゲームを用いて実現されます。

その仕組みを、簡単な部分に分解して説明します。

1. 二人の登場人物:先生と生徒

このシステムは、二人の AI エージェントが協力して動作します。

  • 先生(帰納エージェント): このエージェントは、タスクが成功裏に完了する動画を見ます。その役割は、特定の個人名や数値に言及することなく、タスクのやり方を説明する一般的なルールブック(「スキル」)を作成することです。
  • 生徒(演繹エージェント): このエージェントはテスト役です。先生が書いたルールブックと、元のタスクの説明のみを与えられ、それらの指示だけを使ってゼロからタスクを実行しようとします。

2. 「再構成」テスト

これがマジックのトリックです。システムは単に「生徒は正しい答えを出したか?」と問うわけではありません。「生徒は元の動画と同じ論理に従ったか?」と問うのです。

  • もし先生が「赤いボタンをクリックせよ」というルールブックを書いたが、元の動画では青いボタンがクリックされていた場合、生徒は失敗します。システムはこの不一致を検知します。
  • もし先生が「そのことをやれ」といった、あまりに曖昧なルールブックを書いた場合、生徒は混乱して失敗します。
  • もし先生が「ユーザー #123 のボタンをクリックせよ」といった、あまりに具体的なルールブックを書いた場合、システムはこれが他の誰にも通用しないと認識します。

システムは、生徒のパフォーマンスを元の動画と比較します。一致すればルールブックは良好です。一致しなければ、ルールブックに欠陥があるとシステムは判断します。

3. 三つの「成績表」

ルールブックを完璧にするために、システムは各試行の後、先生に対して三つの具体的な成績表(「損失」と呼ばれる)を与えます。

  1. 「手順に従ったか?」カード(再構成損失): 生徒は元の動画と同じ戦略に従いましたか?(例:まずメールを確認し、その後送信ボタンをクリックしましたか?)
  2. 「仕事を完了したか?」カード(結果損失): 生徒は実際に現実世界でタスクを成功裏に完了しましたか?
  3. 「これは良いマニュアルか?」カード(評価基準損失): ルールブックはよく書かれていますか?明確ですか?名前や ID のような、含まれてはいけない具体的な詳細をコピーしていませんか?これにより、ルールブックは単なる特定の一イベントのコピー&ペーストではなく、有用なツールであることを保証します。

4. 改善のループ

このゲームは、システムによって繰り返し実行されます。

  • 先生が草案を書きます。
  • 生徒がそれを実行してみます。
  • システムが三つの成績表を用いて草案を評価します。
  • システムは先生に、何が間違っていたかを正確に伝えます(例:「特定の名前が含まれているので削除せよ」や「安全チェックを飛ばした」など)。
  • 先生はこのフィードバックに基づいてルールブックを書き直します。

これは自動的に繰り返され、ルールブックが完璧になるまで洗練されます。

なぜこれが特別なのか?

これまでのほとんどの手法は、単に賢い AI に動画の「要約」をさせることでルールブックを作成しようとしました。しかし、AI はしばしば、あまりに曖昧すぎたり、あまりに具体的すぎたりする間違いを犯します。

MIND-Skill は異なります。なぜなら、それはルールブックを即座にテストするからです。まるでシェフがレシピを書き、すぐに見習いシェフにその料理を作らせるようなものです。もし見習いシェフが料理を焦がしたり、間違った材料を使ったりすれば、シェフはレシピに問題があったと知り、他の誰かが試す前にそれを修正します。

結果

この論文は、二つの困難な世界でこれをテストしました。

  1. AppWorld: 実際のアプリ(送金、チケット予約、ファイル管理など)を使用するシミュレーション。
  2. BFCL-v3: コンピュータの関数を正しく呼び出す能力をテストするもの。

結果、MIND-Skill のルールブックを使用したエージェントは、他の手法で作成されたルールブックを使用したエージェントよりも、新しく未見のタスクを解決する能力がはるかに優れていることが示されました。たとえ「先生」の AI が利用可能な最も賢いモデルでなかったとしても、テストプロセスによって最終的なルールブックが非常に良質なものとなり、最も賢いモデルによって作られたものと同様のパフォーマンスを発揮しました。

要約すると: MIND-Skill は、AI エージェントを、それらのマニュアルが実際に機能するかどうかを絶えずテストすることで、自分自身の完璧な取扱説明書を書く自己改善型の教師へと変えます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →