← 最新の論文
💻 computer science

Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks

COSPLAY は、LLM 意思決定エージェントが学習可能なスキルバンクからスキルを参照して行動し、別のエージェントがロールアウトから再利用可能なスキルを継続的に発見・更新する共進化フレームワークであり、長期的なタスクにおいて既存の最先端モデルを大幅に上回る性能を発揮します。

原著者: Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

公開日 2026-04-24
📖 1 分で読めます☕ さくっと読める

原著者: Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🎮 従来の AI の悩み:「その場しのぎ」のプレイヤー

これまでの AI は、ゲームをプレイする際、「その瞬間の状況を見て、その場でどう動くか」を毎回ゼロから考えていました。
まるで、初めて行く迷路で、毎回「あっちに行こう、こっちに行こう」と試行錯誤しているようなものです。

  • 問題点: 長いゲーム(長期的な目標)になると、途中で迷子になったり、同じ失敗を繰り返したり、重要な戦略を忘れたりしてしまいます。
  • 結果: 複雑なゲームでは、人間やトップクラスの AI に勝てないことが多いのです。

🚀 COS-PLAY のアイデア:「二人組のチームワーク」

この論文が提案する「COS-PLAY」は、AI を**「二人組のチーム」**として動かします。二人は互いに協力し合いながら、一緒に成長(共進化)していきます。

1. 作戦指揮官(決定エージェント)

  • 役割: ゲーム画面を見て、実際にボタンを押す人。
  • 特徴: 彼の手元には**「スキルバンク(スキル集)」**という辞書のようなものがあります。
  • 動き方: 「今、敵が攻めてきた!」「よし、この状況なら『防御スキル』を使おう!」と、辞書から適切な作戦(スキル)を引っ張り出して実行します。
  • 進化: 最初は辞書が空っぽですが、プレイするうちに「どの作戦が有効か」を学び、より良いスキルを選び取るようになります。

2. 記録係・編集者(スキルバンクエージェント)

  • 役割: 指揮官がプレイした履歴(成功も失敗も)をすべて記録し、分析する人。
  • 特徴: 彼の仕事は、**「無意味なメモを整理して、使える『マニュアル』に変えること」**です。
  • 動き方:
    • 「あ、このプレイヤーは、敵が近づいたら必ず『壁を作る』作戦を使っていたな。これは『防御スキル』だ!」と発見します。
    • 「このマニュアルは少し曖昧だな」と修正したり、重複しているものをまとめたりします。
    • 新しく発見した「すごい作戦」を辞書(スキルバンク)に追加します。
  • 進化: 記録係が作るマニュアルが良くなれば、指揮官はより上手にゲームをプレイできるようになります。

🔄 魔法のサイクル:「一緒に成長する」

この二人は、**「プレイ → 記録・整理 → 改善 → 再プレイ」**というループを回し続けます。

  1. 指揮官がゲームをプレイします(最初は下手でも OK)。
  2. 記録係がそのプレイを見て、「ここが良かった」「ここは失敗だった」と分析し、**「スキル(マニュアル)」**として辞書にまとめます。
  3. 辞書が更新されると、指揮官はより良いマニュアルを参照して、次はもっと上手にプレイします。
  4. 上手にプレイできるようになると、記録係はより高度なスキルを学べます。

これを繰り返すことで、AI は**「経験から学び、その知識を蓄積し、次回のゲームで活かす」**という、人間のような学習プロセスを身につけます。

🏆 実験の結果:どんなに小さな AI でも勝てる?

研究者たちは、この仕組みを使って、「80 億パラメータ」という比較的小型の AIを訓練しました。
(※「パラメータ」は AI の頭の良さを表す指標。大きいほど頭が良いとされますが、この研究では「小さい AI」でも十分戦えることを示しました。)

  • 結果: 単独プレイのゲーム(2048、マリオなど)では、世界最高峰の巨大 AI(GPT-5 など)よりも 25% 以上高いスコアを出しました。
  • 理由: 巨大な AI は「その場の記憶」だけで戦うのに対し、COS-PLAY は**「過去の成功体験(スキル)」**を整理して使えているからです。
  • 社交ゲームでも: 交渉が必要なゲーム(ディプロマシーなど)でも、人間や他の AI と互角以上に戦えました。

💡 簡単なまとめ:なぜこれがすごいのか?

この研究の最大のポイントは、**「AI が自分で『スキル』を見つけ、整理し、使いこなすこと」**を可能にしたことです。

  • 従来の AI: 「毎回、ゼロから考え直す」→ 疲れる、忘れる、失敗する。
  • COS-PLAY: 「過去の成功体験を『レシピ本』として作り、それを参照して料理する」→ 効率的、安定、成長する。

まるで、**「料理の天才が、失敗したレシピを捨て、成功したレシピを整理して『最強の料理本』を作り上げ、それを見て弟子がさらに上手に料理をする」**ようなイメージです。

この仕組みを使えば、AI は複雑なゲームだけでなく、現実世界の難しいタスク(ロボット操作や複雑な計画など)でも、失敗から学びながら、自律的に成長できるようになるかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →