← 最新の論文
💬 NLP

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

CMAP は、CLIP の未活用テキスト埋め込み空間を活用して堅牢なタスクルーティング、信頼度推定、およびエンコーダー適応を実現するパラメータ効率の高いマルチドメインタスクインクリメンタルラーニングのフレームワークを導入し、外部データやタスク識別情報なしに MTIL ベンチマークにおいて最先端の性能を達成する。

原著者: Sriram Mandalika

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Sriram Mandalika

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超賢明な美術評論家を雇うと想像してください。その評論家はすでに数百万冊の本を読み、数百万点の絵画を見ています。この評論家(AI モデル)は、テキストのみに基づいて「猫」や「車」を完璧に記述する方法を知っています。しかし、あなたはこの評論家に、古い例を一度も再び見せることなく、新しい特定の物体(特定の犬種や珍しい花など)を一つずつ認識することを教えたいのです。

このシナリオにおける大きな問題は忘却です。「ゴールデン・レトリーバー」について教えると、「シャムネコ」の認識方法を見失う可能性があります。また、教える方法があまりに攻撃的すぎると、まだ学習していない新しい種類の鳥を見たときに混乱してしまうかもしれません。

現在の手法は、画像のみを眺めることでこの問題を解決しようとします。「この新しい写真は、以前見た写真に似ているか?」と問うのです。この論文は、これを「顔や声を無視して、靴だけを見て群衆の中から人物を特定しようとする」ようなものだと主張しています。特に学習に使える写真があまりない場合、これは非効率的で誤りを起こしやすい方法です。

著者たちは、CMAP(Cross-Modal Adaptive Prompting:クロスモーダル適応プロンプティング)と呼ばれる新しいシステムを提案します。その仕組みを簡単なアナロジーを用いて説明します。

1. 「テキストベースの ID カード」(テキスト空間タスクルーティング)

従来の方法: 新しい写真が届くと、従来のシステムは以前見たぼんやりとした写真の雲とマッチングさせようとします。写真がわずかに異なる場合(例えば、異なるポーズの犬など)、システムはそれがどの「タスク」(カテゴリ)に属するのか混乱してしまいます。
CMAP の方法: 写真の外観に基づいて推測する代わりに、CMAP はカテゴリのテキスト記述を参照します。「この写真は『ゴールデン・レトリーバー』という概念、それとも『シャムネコ』という概念に合致するか?」と問うのです。

  • アナロジー: 図書館の本のコレクションを持っていると想像してください。その人が探している本を、その人のシャツの色(視覚)から推測するのではなく、「探しているものに近い本題名はどれですか?」(テキスト)と尋ねます。本題名(テキストプロトタイプ)は決して変わらないため、学習に使える写真が 1 枚や 2 枚しかない場合でも、この方法は非常に安定しています。設定に追加コストはかかりません。

2. 「二重チェックシステム」(マルチプロトタイプ信頼性)

従来の方法: システムは、すべての物体が完全に同じように見える(完璧な円のような)と仮定しています。写真が少し奇妙だったりぼやけていたりすると、システムは不確実になり、誤った推測をする可能性があります。
CMAP の方法: CMAP は、「犬」は走る、寝ている、横から見えるなど、さまざまな姿に見えることに気づいています。そのため、各カテゴリに対して複数の「精神的なスナップショット」(プロトタイプ)を作成します。

  • アナロジー: 「犬とは何か?」に対する単一のルールを持つ代わりに、システムは 3 種類の犬のスケッチが入ったフォルダを保持します。走る犬、寝ている犬、座っている犬です。新しい写真が入ってくると、これら 3 つのスケッチのすべてに対して照合を行います。
  • ひねり: スケッチをチェックするだけでなく、テキスト記述もチェックします。「この写真はスケッチに似ており、かつ『犬』という言葉にも合致するか?」と問うのです。両方が合致すれば、システムは非常に確信を持ちます。もし不一致があれば、慎重になるべきだと認識します。

3. 「同期された門番」(対称的クロスモーダルゲーティング)

従来の方法: システムには 2 つの扉があります。一つは画像用、もう一つはテキスト用です。過去には、画像の扉が閉じられた場合(写真が奇妙または未知のため)、テキストの扉は依然として広く開いたままになりました。これは、翻訳者が聞き手が理解できない言語を話すような、不一致を引き起こしました。
CMAP の方法: CMAP はリンクされた機構を備えています。写真が混乱を招くため画像の扉が閉じられると、テキストの扉も同時に完全に閉じます。

  • アナロジー: 美術館の警備員を想像してください。警備員が疑わしい絵画(画像)を見つけた場合、訪問者が混在した信号で混乱しないよう、すぐにオーディオガイド(テキスト)をロックします。これにより、システムがこれまで見たこともないものに出会った場合でも、「絵」と「言葉」が完璧に調和を保つことが保証されます。

結果

著者たちは、車から花、手書きの数字までを含む11 の異なるデータセット1,200 を超えるカテゴリを扱う大規模な課題でこれをテストしました。

  • 性能: CMAP は、以前の最良の手法を大幅に上回りました(精度が約 3〜5 パーセントポイント向上)。
  • 効率性: これは、巨大なモデル全体を再学習させるのではなく、わずか 250 万の調整可能パラメータ(小さなアプリ程度のサイズ)を追加するだけで達成されました。
  • データ不足への対応: カテゴリあたりわずか 16 枚の写真しか与えられなかった場合、特に効果的に機能しました。これは、単に多くの写真を眺めるよりも、「テキスト ID カード」を使用する方が学習の賢明な方法であることを証明しています。

要約: CMAP は、AI に新しいタスクを学習させる際、写真を見ることと同じくらい、内部の「テキストの声」に耳を傾けることを教えます。これにより、AI は過去のレッスンを忘れることを防ぎ、奇妙な新しい入力に対処できるようになり、巨大なコンピュータや過去の膨大な写真ライブラリを必要とせずにすべてを実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →