← 最新の論文
🤖 machine learning

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRiseは、大規模言語モデルエージェントが、スキルを漸進的なシーケンスとして整理し、タスクの解決と進化するスキルドキュメントのキュレーションを単一のポリシーで同時に行うことで、異なるタスク間で転移可能なスキルを進化させ再利用することを可能にする統合された強化学習フレームワークであり、既存のマルチステージ型または独立タスク型のアプローチと比較して優れた性能と効率性を実現します。

原著者: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにビデオゲームの遊び方を教えているところを想像してみてください。昔は、もしロボットがレベル1で失敗したら、すべてを忘れてレベル2をゼロからやり直し、ただ運に任せるしかありませんでした。それはまるで、自転車から転んだ後、どうやって転んだかを全く覚えていないまま、すぐに別の自転車に乗ろうとするようなものでした。多くの「AIエージェント」と呼ばれるコンピュータプログラムは、かつてこのように機能していました。彼らはあらゆる新しい挑戦を、全く新しい、孤立したイベントとして扱っており、以前の挑戦で学んだすべての教訓を無駄にしていたのです。

しかし、もしロボットが、プレイするたびに賢くなる「カンニングペーパー」や「日記」を持てるとしたらどうでしょう? これこそが、強化学習と呼ばれる分野の核心です。強化学習では、AIは試行錯誤し、成功に対して報酬を受け取り、失敗から学ぶことで学習します。最近、科学者たちは、エージェントに単一のパズルを解くだけでなく、多くの異なるパズルを解くのに役立つ一般的な「スキル」を学ばせようとしています。大きな疑問は、「AIが、最初のパズルの具体的な詳細に惑わされることなく、後で実際に役立つような形で、自分自身の教訓を書き留めるようにするには、どうすればよいのか?」ということです。

そこで登場するのが、AIエージェントのための超スマートな家庭教師のような新手法、「SkillRise」です。SkillRiseは、エージェントに過去を忘れさせるのではなく、タスクを簡単なものから難しいものへと「レベルアップ」していくシーケンスとして整理します。エージェントはプレイしながら、2つのことを同時に行います。現在のレベルを解こうとすること、そして「キュレーター」として自分自身のスキル日記を更新することです。これは、ビデオゲームのキャラクターがボスを倒した後、単に次のレベルに進むのではなく、すぐにジャーナルに新しい記述をするようなものです。「おい、あのボスは君が左側にいる時にだけ攻撃してきたのを覚えておけ。次は右側にいろ。」

SkillRiseの魔法は、AIへの報酬の与え方にあります。現在のタスクを解決したときにもポイントを与えますが、「日記の記述」が将来のタスクを解決するのにどれほど役立つかに対してもポイントを与えます。これにより、AIは具体的な詳細(例:「ボスの名前はボブだった」)ではなく、一般的なルール(例:「右側にいろ」)を書き留めるよう促されるのです。研究者たちは、これを3つの異なる「世界」でテストしました。掃除や整理を行う家(ALFWorld)、特定のアイテムを購入するオンラインショップ(WebShop)、そして実験を行う科学研究所(ScienceWorld)です。

結果は目覚ましいものでした。SkillRiseは、訓練された特定のタスクにおいて向上しただけでなく、「学び方」そのものを学習しました。研究者が、関連するタスクのより長いシーケンスで練習させたところ、エージェントはさらに優れた成績を収めました。これは、エージェントが単に答えを暗記しているのではなく、真にスキルを再利用していることを示唆しています。実際、SkillRiseは他のトップクラスの手法を大幅に上回り、成功率を最大8.5パーセントポイント向上させました。さらに驚くべきことに、異なるタスクで訓練されていたにもかかわらず、特定のタスクを何度も繰り返すことに対しても、そのために設計された手法より優れた成績を収めました。しかも、メモリ管理のために複雑な多段階のパイプラインを必要とする古い手法よりも、はるかに速く、少ない計算能力でこれらすべてを実現しました。

要するに、SkillRiseは、もしAIをより賢くしたいのであれば、ただ練習させるだけでなく、進化し続ける自分自身の知恵のノートを持たせるべきであることを示唆しています。「実行すること」と「学んだことを書き留めること」を分離し、その書き込みがいかに有用であるかに報酬を与えることで、私たちは単に問題を解決するだけでなく、より優れた問題解決者になるために自らの戦略を進化させることができるエージェントを構築できるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →