← 最新の論文
🤖 machine learning

Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts

本論文は、300 以上のタスクからなる極めて長いタスクシーケンスを効果的に処理するためのバイレベルルーティング混合エキスパート機構を活用したスケーラブルな継続学習フレームワーク CaRE を提案し、評価用の挑戦的な OmniBenchmark-1K データセットの導入を伴う。

原著者: Meng Lou, Yunxiang Fu, Yizhou Yu

公開日 2026-05-11
📖 1 分で読めます☕ さくっと読める

原著者: Meng Lou, Yunxiang Fu, Yizhou Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに、新しいカテゴリを一つずつ、数千もの異なる物体を認識させることを想像してみてください。問題は、新しいもの(例えば「コーギー」)を教えるにつれて、以前学んだ古いもの(例えば「ハンバーガー」)を忘れがちになることです。これを「破滅的忘却」と呼びます。

本論文は、この問題を解決するために設計された新しいシステム、CaRE(Continual Learner with efficient Bi-Level Routing Mixture-of-Experts:効率的な二階層ルーティング混合エキスパートを備えた継続学習器)を紹介しています。その仕組みを簡単に説明します。

1. 問題点:「万能型」の罠

現在のほとんどの AI システムは、既存の「脳」を微調整することで新しいタスクを学ぼうとします。犬について教えると、猫を認識するルールが誤って上書きされてしまう可能性があります。

  • 論文の洞察: AI にすべてのタスクで同じ「脳」を使うことを強制するのではなく、CaRE は AI に膨大な専門ツール類のライブラリを与えます。新しいタスクが到来すると、AI は単に学ぶだけでなく、ライブラリから適切なツールを選ぶ方法を学びます。

2. 解決策:「賢い司書」システム(BR-MoE)

CaRE は、**二階層ルーティング混合エキスパート(BR-MoE)**と呼ばれるメカニズムを使用します。AI の脳を、内部に多くの専門的な「エキスパート」(ミニ脳)を持つ巨大な図書館と想像してください。

  • レベル 1:ヘッド司書(ルーティング選択)
    新しい画像(例えばコーギーの写真)が入力されると、システムは単に推測するわけではありません。一連の「ヘッド司書」(クラスパーセプトロンと呼ばれる)に画像を見て、「あなたの特定のセクションに属していることにどの程度自信がありますか?」と尋ねます。

    • 「犬の司書」が非常に確信を持っている(不確実性が低い)場合、それが選ばれます。
    • 「車の司書」が混乱している(不確実性が高い)場合、無視されます。
    • 工夫点: システムは、ただ一つだけでなく、最も関連性がありそうな上位の司書たちを数人選びます。これにより、AI は主要な概念に焦点を当てつつ、関連する概念(他の動物など)も考慮することができます。
  • レベル 2:専門エキスパート(動的エキスパートルーティング)
    上位の司書たちが選ばれた後、それぞれが自身のチームである専門エキスパート(小規模で効率的なアダプター)を呼び出します。

    • 各エキスパートは、過去の特定のタスクに特化して訓練されたミニ脳です(例えば、あるエキスパートは犬についてすべてを知っており、別のエキスパートは鳥についてすべてを知っています)。
    • 司書たちは、現在の画像に最も役立つ上位のエキスパートたちを活性化させます。
    • 「共有エキスパート」: さらに、これまでに学んだことすべてについて少しだけ知っている「スーパーエキスパート」が一人存在します。これにより、AI は一般的な知識を失うことがありません。

3. 「すべての層」の利点

通常、AI システムは最終段階でのみ意思決定を行います。CaRE は異なります。この「司書+エキスパート」システムが、脳内のすべての層に組み込まれています。

  • 比喩: 工場の生産ラインを想像してください。通常の工場では、最終的な管理者が製品に対して何をするか決定します。CaRE では、ライン上のすべての作業員(すべての層)が、その場でどの特定のツールを使用するかを決定する独自のミニ司書を持っています。これにより、AI は物体の非常に詳細で正確なイメージを、段階的に構築することができます。

4. 新しい課題:「OmniBenchmark-1K」

これが機能することを証明するために、著者たちは既存のテストが簡単すぎると気づきました。ほとんどのテストは 20 タスク(例えば 20 種類の動物を学ぶなど)のみを含んでいました。

  • 彼らは、OmniBenchmark-1Kと呼ばれる、新しい超難易度の高いテストを作成しました。
  • このデータセットには、1,000 種類の異なるクラス(カテゴリ)と、約 20 万枚の画像が含まれています。
  • 彼らは、CaRE を 100、200、そして連続して301 タスクという順序で学習させることでテストしました。
  • 結果: 他の AI システムはタスク数が増えるにつれて失敗し、何かを忘れ始めましたが、CaRE はさらに良くなり続けました。タスクリストが信じられないほど長くても、CaRE は他のすべての手法を大幅に上回りました。

まとめ

CaRE は、単に事実を暗記するのではなく、状況に応じて適切な記憶を呼び出す方法を学ぶ学生のようなものです。

  1. 自信を確認して、最も関連性の高い「記憶の部屋」を見つけます(レベル 1 ルーティング)。
  2. その部屋から特定の「ツール」を取り出して問題を解決します(レベル 2 ルーティング)。
  3. これは思考プロセスの最終段階だけでなく、すべての段階で行われます。

これにより、CaRE は古いものを忘れることなく数百の新しいものを学ぶことを可能にします。この規模で成功裏に実証されたシステムは他にありません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →