← 最新の論文
🤖 AI

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkillは、テキストによるスキルを事前学習済みハイパーネットワークを介してプラグアンドプレイのLoRAアダプターへと変換するフレームワークであり、LLMエージェントがタスクの手順をコンテキスト空間ではなく重み空間に再利用可能な形で保存することを可能にし、それによってトークンオーバーヘッドを大幅に削減しながら性能を向上させ、モジュール的なスキルの構成を実現する。

原著者: Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、複雑な問題を推論する上で極めて高い能力を発揮するようになり、計画を立て、検索を行い、ソフトウェアと相互作用してタスクを完了できるデジタルエージェントとして機能することが多くなっています。専門的な業務を扱うために、これらのエージェントはしばなく「スキル」に依存します。これは本質的には、仮想の部屋を整理したり、多段階の質問に答えたりといった、特定の種類の問題を解決する方法をモデルに伝える、書かれた指示や手順のことです。従来、これらのスキルは、スキルを使う必要があるたびに、まるでアクションを起こす前にマニュアルのページを一枚ずつ読み進めるかのように、直接モデルの入力へと投入されてきました。この方法は機能しますが、大きなボトルネックを生み出します。タスクが複雑になり、スキルのライブラリが大きくなるほど、モデルが処理しなければならないテキスト量が増え、動作が遅くなり、膨大な計算資源を消費してしまうのです。さらに、これらの指示をプレーンテキストとして入力に留めておくことは、それらが露出した状態となり、システムの他の部分によって誤読されたり、乗っ取られたりするリスクを残します。

上海交通大学とOPPOリサーチインスティテュートの研究者たちは、「LatentSkill」と呼ばれる異なるアプローチを提案しました。これは、これらの指示をテキスト入力からモデルの内部メモリ構造へと移動させるものです。スキル記述を毎回読み込む代わりに、このシステムは、スキルのテキストを「アダプター」と呼ばれる、モデルの脳に恒久的に取り付けられるコンパクトな一連の内部調整へと変換する特殊なジェネレーターを使用します。これにより、エージェントは指示を再び読み直すことなく、スキルを「知る」ことができるようになります。研究チームは、この手法がプロセスの高速化と処理データの削減を実現するだけでなく、異なるスキルを数学的な精密さをもって混ぜ合わせたり組み合わせたりできる、隠された整理された空間を作り出すことも発見しました。

この研究の核心となるアイデアは、スキルを「読むべき文書」としてではなく、「ロードすべき重み(ウェイト)のセット」として扱うことです。彼らのフレームワークでは、「スキルコンパイラ」がタスクの記述文を受け取り、言語モデルに対するユニークな一連の内部修正を即座に生成します。これらの修正は小さく、効率的で、モジュール式であるため、システム全体を再学習させることなく、メインモデルに付け外しすることができます。スキルがこの内部形式に変換されると、元のテキストは入力ストリームから破棄されます。その後、モデルはこれらの隠れた調整を用いて動作し、それらの調整は、テキストと同じくらい効果的にモデルの振る舞いを導きますが、タスクの各ステップごとに数千語もの余分な言葉を処理するという重いコストを伴うことはありません。

これを検証するために、研究者たちは彼らのシステムを2つの異なる課題に適用しました。一つは、家の中をナビゲートして家事をこなすロボットのテキストベースのシミュレーションであり、もう一つは、複数の情報源を検索する必要がある一連の複雑な質問回答タスクです。家の中のナビゲーションタスクでは、システムは物体を拾い上げ、洗浄し、特定の場所に配置する方法を理解しなければなりませんでした。質問回答タスクでは、いくつかの情報を結びつける必要がある回答を見つけ出さなければなりませんでした。スキルの指示をプロンプトに貼り付ける標準的な手法と比較して、この新しいアプローチは著しく効率的であることが証明されました。家の中のナビゲーションタスクにおいて、システムは既知のタスクでは成功率を20パーセント以上向上させ、未知のタスクでも13ポイント以上向上させた一方で、入力トークンをほぼ3分の1削減しました。質問回答のベンチマークにおいては、ステップあたりの処理トークン数を70パーセント以上削減しながら、より高い正確度を達成しました。

単なる時間とリソースの節約を超えて、研究者たちはこれらの内部スキル調整が驚くほどの構造を持っていることを発見しました。彼らがスキルの存在する数学的な空間をマッピングしたところ、掃除タスクや検索タスクといった同じカテゴリーに属するスキルは自然にグループ化され、明確なクラスターを形成していることが分かりました。これは、システムが単にテキストを記憶しているのではなく、手順の背後にある論理を学習していることを示唆しています。この構造により、高度な制御が可能になります。研究者たちは、スケーリング数によって表される「ダイヤル」を回すだけで、スキルの強度を調整できることを発見しました。数値が低すぎるとスキルは効果を発揮せず、高すぎるとモデルは混乱します。しかし、適切な設定値であればモデルは最適に動作し、この「スイートスポット」は異なる種類のタスクにおいても一貫していました。

おそらく最も興味深い発見は、これらの内部スキルを組み合わせることができるという点でした。料理を作るために材料を混ぜ合わせるように、研究者たちは、2つの異なるスキルの内部調整を取り出し、それらを足し合わせることで、新しい複合的なスキルを作成できることを示しました。ただし、これはスキルを混ぜ合わせる前に、それらを最小かつ整合性の取れた構成要素に分解した場合にのみ、信頼性を持って機能しました。単にスキルブロック全体をそのまま足し合わせただけでは、結果はしばしば効果が低くなりました。パーツを注意深く整列させることで、彼らは個々のステップを実行する能力を失うことなく、複雑な一連の動作を実行できるスキルを作り出すことができました。これは、システムが柔軟かつ精密な方法で、知識のモジュール化された断片を組み立てることで、複雑な振る辺を構築できることを示唆しています。

また、この研究は重要なセキュリティ上の利点も強調しました。スキルは可視化されたテキストではなく内部的な調整として保存されているため、改ざんが非常に困難です。研究者が指示の乗っ取りや隠された知識の抽出の試みに対してシステムをテストした際、この新しい手法は極めて優れた耐性を示しました。従来のテキストベースのアプローチは、攻撃を受けると崩壊したり秘密を露呈したりすることが多かったのに対し、内部スキル版はパフォーマンスを維持し、その指示を隠蔽し続けました。これは、スキルを可視的なプロンプトからモデルの内部ウェイトへと移動させることが、人工エージェントに専門知識を習得させるための、より堅牢で安全な方法であることを示しています。

研究者たちは、このアプローチが、より有能で効率的なAIエージェントを構築するための実用的な道筋を提供すると結論付けています。手続き的な知識の保存場所を、入力ストリームからモデルの内部パラメータへと移行させることで、彼らはエージェントをより速く、より安全に、そして異なる能力を組み合わせるのが上手いものにする方法を実証しました。これらの結果は、AIエージェントの未来が、より多くのテキストを流し込むことにあるのではなく、シンプルで目に見えないスイッチと共に、スキルを内部に携え、いつでも展開できるように教えることにあることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →