MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
本論文は、MUSE-Autoskill という自己進化型エージェントフレームワークを導入するものであり、これはスキルを創造、記憶、管理、評価、洗練という統合されたライフサイクルを通じて管理し、それらを再利用性、信頼性、およびタスク間転移を向上させるために長寿命で経験に敏感な資産として扱うことで、タスク解決能力を強化する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが、非常に優秀だが物忘れの激しいアシスタント(AI エージェント)を持っていると想像してください。複雑な問題、例えば水漏れしている配管の修理や、巨大なスプレッドシートの整理を依頼すると、彼らは毎回ゼロから考え出そうとします。マニュアルを読み、いくつか試行錯誤し、失敗し、再びマニュアルを読み、別の方法を試すかもしれません。これは遅く、費用がかかり、彼らはしばしば同じ過ちを繰り返します。
この論文は、このアシスタントが学び成長するのを助ける新しい方法としてMUSE-Autoskillを紹介しています。「賢い頭脳」であるだけでなく、MUSE はアシスタントを個人の工房を持つ熟練職人へと変えます。
その仕組みを、簡単な概念に分解して説明します。
1. 問題点:「その場限り」のアプローチ
現在、ほとんどの AI アシスタントは、すべてのタスクを全く新しい冒険として扱います。特定の種類のコンピュータエラーの解決法を突き止めたとしても、その知識を「保存」するわけではありません。次に依頼すると、彼らは再び学び直す必要があります。完璧なラザニアを調理し、それを食べた後、レシピを完全に忘れ、次の客のために再び材料を推測しなければならない料理人のようなものです。
2. 解決策:「スキル工房」
MUSE は、アシスタントにスキルを構築、保存、洗練できる工房を与えることで、ゲームのルールを変えます。
スキルを魔法の呪文ではなく、完全な事前パッケージ化されたツールキットとして考えてください。
- レシピ (SKILL.md): ツールが何をするかについての明確な指示セット。
- ツール (スクリプト): 作業を行うために必要な実際のコードや手順。
- 品質チェック (テスト): ツールが棚に並ぶ前に、それが機能することを確認する内蔵検査員。
- ノート (.memory.md): アシスタントが「このツールは素晴らしいが、ファイルが大きすぎるとクラッシュする。私はその痛い経験から学んだ」と書き留める個人ログ。
3. 5 段階のライフサイクル(「職人のルーチン」)
この論文は、熟練の大工が道具を管理する方法に似て、MUSE がこれらのスキルを管理するための連続的なループを説明しています。
- 作成(ツールの構築): アシスタントが既存のツールでは解決できない問題に直面したとき、単に推測するのではなく、立ち止まって「新しいツールが必要だ」と言います。彼らはその場で新しいスキルパッケージを構築します。
- 記憶(個人ログ): スキルが使用されるたびに、アシスタントはその専用のノートにメモを書きます。成功しましたか?失敗しましたか?遅かったですか?これはスキルレベルの記憶です。これは、レンチのハンドルに「このレンチは速く回すとボルトを剥がす」と書き込むメカニックのようなものです。
- 管理(棚の整理): アシスタントは工房を整理整頓します。同じことをするツールが 2 つあれば、それらを統合します。壊れて全く機能しないツールがあれば、それを捨てます。彼らは、いつでも取り出せるように「最良の」ツールを準備しておきます。
- 評価(安全検査員): 新しいツールが棚に並ぶことを許可される前に、厳格なテストをパスしなければなりません。アシスタントは、そのツールを安全で隔離されたサンドボックスで実行します。テストに失敗すれば、そのツールは修理のために工房へ戻されます。完璧になるまで、棚に上がることはありません。
- 洗練(ツールの磨き上げ): ツールがテストや実際の作業で失敗しても、アシスタントは諦めません。彼らはエラーを確認し、コードを修正して再試行します。ツールは時間とともに向上します。
4. 「長視野」のトリック
AI にとって最大の課題の一つは、限られた「注意力」(コンテキストウィンドウ)です。50 ステップのタスクの場合、AI は 50 ステップ目に到達する頃には、1 ステップ目で何をしたかを忘れてしまいます。
MUSE は適応的圧縮でこれを解決します。長い物語を書いていると想像してください。書いたすべての単語を保持する代わりに、中盤の章を短い段落に要約し、序盤と終盤は詳細に保つようにします。MUSE はこれを自動的に実行します。最も重要な会話の部分を保持し、中盤を要約することで、AI は非常に長いタスクであっても、決して自分の立ち位置を失うことはありません。
5. 結果:実験室で何が起こったか
研究者たちは、SkillsBench(データ分析、コード修正、運用計画などの 51 の実世界タスクのセット)でこれをテストしました。
- 「人間」ベースライン: 人間が作成したツールを AI に与えた場合でも、MUSE アシスタントが最も優れたパフォーマンスを発揮しました。指示の読み解きやツールの使用において、他の AI よりも優れていました。
- 「自学」の奇跡: 最も興奮すべき点は?MUSE アシスタントは自らを教えることができたことです。
- 何のツールもない状態でタスクを試みました。
- 成功すると、その成功からスキルを構築しました。
- その後、その自作のスキルを使ってタスクを再度実行しました。
- 結果: スキルを構築できたタスクにおいて、その精度は約 53% からほぼ88%に跳ね上がりました。それは実際に、元のツールを作成した人間よりも優れるようになりました。
- 共有は慈愛: 最も素晴らしい点は、これらのスキルが 1 つの AI の中に閉じ込められていないことです。研究者たちは、MUSE によって構築されたスキルを取り出し、別の AI(Hermes と命名)に与えました。Hermes は即座にそのタスクで大幅に向上し、スキルが、どんな賢い労働者でも拾って使える普遍的なツールであることを証明しました。
要約の比喩
新人インターン(標準的な AI)と熟練職人(MUSE-Autoskill)を想像してください。
- インターンは、毎回マニュアルの 1 ページ目から読み直して、壊れた機械を修理しようとします。彼らは遅く、間違いを犯し、昨日学んだことを忘れがちです。
- 熟練職人には工房があります。
- 新しい問題に遭遇すると、それに合わせたカスタムツールを構築します。
- ツールが機能することを確認するためにテストします。
- ツールの使い方を最善にするためのメモを書き留めます。
- 次回、必要なツールを即座に見つけられるように、棚を整理します。
- ツールが壊れたら、それを修理してより強くします。
この論文は、AI にこの「工房」と自らのツールを構築する能力を与えることで、それが以前よりもはるかに高速で、正確になり、以前よりもはるかに困難な問題を解決できるようになることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。