← 最新の論文
🤖 AI

SkillAlchemy: Open-World Agent Skill Creation

SkillAlchemyは、対照的な証拠を通じて暗黙的な要件を特定し、ソースに根ざした手順をコンパイルすることで、オープンワールドエージェントのスキル作成を自動化する新しいフレームワークであり、人間が精査したスキルに匹敵する性能を達成し、SkillsBenchにおいて既存のベースラインを大幅に上回る。

原著者: Hengjun Wang, Shuyue Wei, Boyi Liu, Jun Yang, Yongxin Tong

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Hengjun Wang, Shuyue Wei, Boyi Liu, Jun Yang, Yongxin Tong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能が急速に進化する世界において、コンピュータモデルが「知っていること」と、実際に「できること」の間には、増大する乖離が存在します。大規模言語モデルは膨大なテキストのライブラリで学習しており、世界に対する広範で一般的な理解を備えています。しかし、複雑なデータセットの分析や専門的なソフトウェア環境の操作といった、特定の多段階のタスクを実行するよう求められると、それらはしばしば躓いてしまいます。なぜなら、その特定の仕事に必要とされる精密なステップ・バイ・ステップの指示を欠いているからです。このギャップを埋めるために、研究者たちは「スキル」という概念を開発しました。スキルを、新しい知識の断片としてではなく、エージェントが特定のワークフローを処理するためにロードできる、再利用可能なツールやあらかじめ書かれたマニュアルとして考えてみてください。これらのスキルにより、AIは一般的な学習を超えて専門的な手順を実行できるようになります。それは、大工が繊細なカットを行うために、ドライバーで釘を打とうとするのではなく、特定のノミを手に取る様子によく似ています。これらのツールが有用であるためには、信頼でき、正確であり、かつ単一の例題だけでなく、幅広い状況に適用可能でなければなりません。

しかしながら、課題は、タスクが未知である場合にどのようにしてこれらのスキルを作成するかという点でした。従来、スキルの作成には、人間の専門家がゼロからマニュアルを執筆するか、あるいはAIが過去の成功事例の記録から学習する必要がありました。しかし、タスクが新しく、人間の専門家も存在せず、学習すべき過去の試行錯誤も存在しない場合はどうなるでしょうか?そのような場合、必要な情報は、ドキュメント、コードのリポジトリ、フォーラムの議論といった形で、オープンなインターネット上に散在していることがよくあります。問題は、この情報が乱雑であることです。情報はしばしば、特定の人物、特定の瞬間、あるいは特定のコンピュータ環境に向けて書かれています。そこには、目の前の一般的なタスクには適用できない、隠れた前提条件やローカルな詳細が含まれています。AIが単にこれらの指示をコピーしてしまうと、あまりにも硬直したツールが出来上がってしまい、状況がわずかに変化しただけで失敗してしまうのです。

研究チームは、この問題に対する新しいアプローチを提案し、それを「SkillAlchemy」と呼びました。彼らはインターネットを、すぐに使える答えが揃ったライブラリとして扱うのではなく、使い勝手の良いツールへと昇華させる前に、注意深く検証しテストされるべき「生の証拠」の源泉として扱います。彼らの手法は、「旅行の計画を立てる」や「モデルを校正する」といった、単純でしばしば曖昧なスキルの要求から始まります。システムは即座に解決策を探すのではなく、まずその要求に何が欠けているのかを問いかけます。予算制限の確認が必要であることや、使用しているソフトウェアと特定のファイル形式が互換性を持っているかを確認する必要があることなど、人間のプロンプトでは明示されていなかった隠れた要件を特定します。これらの欠けている要素を具体的な質問へと変えることで、システムは広大な情報の海の中で、まさに何を探すべきかを正確に把握するのです。

システムが何を探すべきかを理解すると、さまざまなソースから情報を収集しますが、見つけたものすべてを受け入れるわけではありません。研究者たちは、最終的なスキルに含めるのに十分な信頼性があるかどうかを判断するための、厳格なプロセスを設計しました。システムは、異なる状況においてもその手順を支持する証拠を探します。もしある手法が、特定の種類のコンピュータや特定のデータセットに対してのみ機能する場合、システムはそれを「ローカルな例」として認識し、メインの指示からは切り離して保持します。その手順が複数のコンテキストにおいて確実に機能することが証拠によって示された場合にのみ、システムはその手順を「一般的なルール」へと昇格させます。このプロセスはフィルターとして機能し、普遍的な原則と一時的な詳細を分離します。その後、システムは承認された指示を、明確なステップ、安全確認、および各決定を裏付ける証拠への参照を含む、構造化されたパッケージへとまとめ上げます。

研究者たちは、ソフトウェアエンジニアリング、事務作業、財務分析、科学計算など、87種類の異なるタスクを用いてこの手法をテストしました。彼らは、人間が書いたスキルや、インターネットから直接指示を生成する自動化ツールを用いる手法を含む、いくつかの他の手法と比較しました。結果として、この新しい手法は自動化されたベースラインを大幅に上回りました。エージェントがこれらのスキルを使用したとき、スキルを全く持っていなかった場合と比較して、タスクの成功率は20パーセント近く向上しました。より重要なことに、このシステムは、ゴールドスタンダードとされる人間が精査したスキルと同等の性能を示しました。総計では、自動化されたシステムは人間が精査したスキルよりも1.5パーセント高い成功率を達成しましたが、統計的分析によれば、これらの結果は互いに肉薄していることが示されています。さらに、このシステムは、テストされた4つのエージェント・モデル構成のうち3つにおいて、最高の全体パフォーマンスを達成しました。

また、この研究は、なぜ従来の試みが失敗してきたのかについても明らかにしました。システムがその範囲(スコープ)を確認せずに単にウェブ上の情報を取得した場合、あまりに限定的な指示や、矛盾する証拠に基づいた指示を含んでしまうことが頻繁にありました。例えば、あるスキルに特定のバージョンのソフトウェアでのみ機能するルールが含まれていた場合、そのバージョンが利用できない状況になると、エージェントは失敗してしまいます。新しい手法は、手順が異なるシナリオ間で証拠に裏付けられているかどうかを明示的にチェックすることで、これらの罠を回避することに成功しました。また、混乱した情報や誤解を招く情報に対しても堅牢であることが証明されました。研究者が検索の中に矛盾した、あるいは無関係なドキュメントを混入させた際、他の手法はそれらの誤ったアドバイスを最終的なスキルに取り込んでしまったのに対し、本システムはそれらを正しく無視しました。

この研究は、私たちがどのようにインテリジェント・エージェントを構築していくべきかについての根本的な転換を示唆しています。AIが魔法のように新しい仕事をやり遂げることを期待したり、人間がすべてのマニュアルを書くことに頼ったりするのではなく、AIに「慎重な研究者」のように振る舞うことを教えることができるのです。AIは正しい問いを立て、証拠を集め、一般的なルールとローカルな例外を区別することを学びます。スキルの作成を直接的なコピーではなく、検証された証拠に基づかせることで、システムは柔軟かつ信頼性の高いツールを生み出します。研究者たちは、このアプローチによって、エージェントが以前は人間の介入なしには不可能であったレベルの能力を持って、未知のタスクに対処できることを発見しました。システムは完璧ではなく、高度に専門化されたメディア関連のタスクには依然として苦戦していますが、その結果は、出発点の情報が不完全でソースが乱雑であっても、信頼できるスキル作成が可能であることを示しています。鍵となるのは、即座に完璧な答えを見つけることではなく、何が真実であり、何が単なるローカルな詳細であるのかを検証するという、規律あるプロセスにあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →