Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?
本論文は、LLMエージェントが隔離された環境において、構造化されたスキルを自律的に認識し正しく適用できるかどうかを評価するベンチマークであるSkill-Useを導入しており、信頼性の高いスキルの使用は、モデル固有の能力ではなく、特定のエージェント・ハーネスに大きく依存しているという重大な課題が残っていることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、コードを書き、データを分析し、メールのドラフトを作成できる、極めて賢く、超クリエイティブなインターンを雇っていると想像してください。あなたは彼らに、膨大な「スキル・ブック(技能書)」のライブラリを与えます。各書籍は、「壊れたサーバーを修理する方法」や「法的契約書を作成する方法」といった、特定の仕事のためのレシピです。ただし、問題があります。あなたは彼らに本を丸ごと渡すわけではありません。代わりに、タイトルと背表紙のほんの短い紹介文だけを見せるのです。もし彼らがその本が関連していると判断すれば、彼らはその本を要求し、完全な手順書を見つけ出し、その後、手順を飛ばしたり禁止事項を行ったりすることなく、その指示に正確に従わなければなりません。これが、AI「エージェント」が「スキル」を使おうとしている世界です。しばらくの間、人々は、適切なスキル・ブックさえ与えれば、AIは即座に完璧な労働者になれるのではないかと期待していました。しかし、AIが実際にどの本を手に取るべきかを正しく判断できるのか、それとも単に推測して当てずっぽうで進めるだけなのか、誰も本当には分かっていませんでした。
Tencent Hunhengおよび複数のトップ大学の研究チームは、このアイデアを検証することに決めました。彼らは、AIエージェントが本当に「空気を読み」、これらのスキル・ブックを正しく使えるかどうかを判定するために設計されたベンチマークである、SKILL-USEという巨大なプレイグラウンドを構築しました。彼らは単に「AIがタスクを完了したか?」と聞いたのではありません。彼らはもっと難しい3つの問いを投げかけました。トリガー(AIは正しい本を手に取るべきだと判断できたか?)、コンプライアンス(レシピ通りにステップ・バイ・ステップで実行できたか?)、そしてバウンダリー(本に記載されている禁止事項を回避できたか?)です。彼らは、ソフトウェアのバグ修正からビジネスレポートの作成まで、177の異なる実世界のタスクを用いて、79の実際のスキル文書と、現在利用可能な最もスマートな8つのAIモデルを用いてテストを行いました。
結果は、一種の現実的な再確認となりました。研究者たちは、最高のAI構成であっても、「Skill-Use」スコアは0から1のスケールで約0.613しか獲得できなかったことを発見しました。これは、信頼できるスキルの活用はまだ手の届かないところにあることを意味しています。最大の問題は、AIが一度本を手にした後にルールに従えないことではなく、AIがそもそも本を手に取るべきだと気づかないことが多かった点でした。それは、レシピ通りに完璧に調理できる天才シェフが、材料を取りに冷蔵庫を開けるのを何度も忘れてしまうようなものです。さらに、研究者たちは、AIのパフォーマンスは単にモデルがいかに「賢い」かだけではなく、その周囲にある「ハーネス」、つまりソフトウェアのラッパーに大きく依存していることを発見しました。ラッパーを変えることはキッチンのレイアウトを変えるようなものであり、同じシェフであっても、ある時はスターになり、またある時はつまずくということが起こりました。
要するに、この論文は、AIエージェントにスキルのライブラリを与えることが、自動的に彼らをより優れた労働者にすることにはならないと示唆しています。「スキルを持っていること」と「スキルを使うこと」の間には大きな隔たりがあります。AIは、いつスキルを適用すべきかを認識できなかったり、選択肢が多すぎると間違ったスキルに気を取られたりすることがよくあります。AIは禁止された動きを避けることは上手くなっていますが、複雑な手順に忠実に従うことには依然として苦戦しています。著者らは、これらのエージェントがツールを使いこなすことを魔法のように学習すると想定することはできず、今まさに、それがパズルの最も難しい部分であるため、いつスキルを使うべきか、そしてどのように計画に従うべきかを認識させるためのシステムを構築する必要があると結論付けています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。