← 最新の論文
💻 computer science

In-Context Collapse in Vision-Language Models and How to Mitigate it?

本論文は、視覚言語モデルにおける多数のショットを用いたインコンテキスト学習が、デモンストレーションの蓄積に伴い精度が急激に低下する破滅的な「インコンテキスト崩壊」を引き起こし得ることを明らかにし、この失敗を視覚と言語の統合経路における特定の崩壊として特定した上で、堅牢な学習を回復させるための軽量で転用可能な介入手法であるCircAを提案している。

原著者: Mohammad Rostami

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Mohammad Rostami

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

セットアップ:例示が増えることが裏目に出る時

あなたは、超スマートなロボットに新しいゲームの遊び方を教えていると想像してください。ロボットの脳全体を書き換える(それは時間がかかるしリスクもあります)代わりに、ロボットがターンを取る直前に、遊び方の例をいくつか見せます。これは**インコンテキスト学習(In-Context Learning)**と呼ばれます。これは、ロボットがプレイしている最中に、その場でパターンを掴んでくれることを期待して、耳元でルールをささやくようなものです。テキストベースのAIにとって、これは素晴らしい効果を発揮します。例を与えれば与えるほど、性能は向上します。

では、同じロボットに学習用の写真を大量に渡した場面を想像してみてください。「写真が多いほど、学習が進むはずだ!」と思うかもしれません。しかし、ここにひねりがあります。**ビジョン・ランゲージ・モデル(画像を見てテキストを読み取るAI)**の世界では、例を与えすぎると、ロボлоットがそれまで知っていたことを突然すべて忘れてしまうことがあるのです。それはまるで、ある学生に何百もの数学の問題を見せたところ、賢くなるどころか、実際の質問を無視して、まさに最後に見た問題に基づいて答えを推測し始めてしまったようなものです。この論文は、なぜこれが起こるのか、ロボットの「脳」のどこでこの不具合が発生しているのか、そして他の部分を壊すことなくどのように修正できるのかを掘り下げています。


偉大なる「インコンテキスト崩壊」

著者は、**インコンテキスト崩壊(In-Context Collapse)**と呼ぶ奇妙な不具合を発見しました。通常、AIに多くの例を見せると性能は向上します。しかし、多くのビジョン・ランゲージ・モデルにおいて、画像とラベルを追加すると、実際には性能が悪化してしまいます。場合によっては、精度が極端に低下し、ランダムに推測した場合よりも成績が悪くなることさえあります。

これは、テストを受けている学生を想像してみてください。助けがなければ、その学生は内容を理解しており、94%のスコアを取ります。しかし、正しい例が10個書かれたリファレンス・シートを手渡した瞬間、彼らの脳はショートしてしまいます。彼らは実際の質問を読むのをやめ、リファレンス・シートの最後にある例をただコピーするようになるのです。もしリファレンス・シートに「答えは青です」と書いてあり、質問が赤い車についてであったとしても、学生は自信満々に「青」と書き込みます。例を増やせば増やすほど、彼らは実際の質問を無視し、直近の例を模倣するようになります。

この論文は、これが単なるフォーマットのエラー(ロボットが支離滅裂な言葉を吐き出すようなこと)ではないことを示しています。ロボットは依然として完璧な文章を書いていますが、判断だけがひどいのです。これは、小規模なモデルから、誰もが注目している大規模な最先端の「フロンティア」モデルに至るまで、多くの異なるモデルで見られます。これは段階的な問題です。免疫があるモデルもあれば、激しくクラッシュするモデルもあり、ランダムな確率を下回るほど激しくクラッシュするモデルもあります。

2つの異なる「超能力」

面白い発見の一つは、論文が「学習」を、通常は同じものだと考えられている2つの別々のスキルに分けていることです。

  1. 堅牢性(Robustness): モデルは、崩壊することなくより多くの例を見ることに対応できるか?
  2. 学習(Learning): モデルは、それらの例から実際に「新しい」ルールを学ぶことができるか?

著者は、モデルが完全に堅牢(崩壊しない)であっても、新しいルールを全く学習できない可能性があることを発見しました。それは、リファレンス・シートを見せられても冷静さを保つものの、それを完全に無視して、自分がすでに知っていることに固執する学生のようなものです。逆に、学習しようとするものの、すぐにクラッシュしてしまうモデルもあります。論文はこれらが2つの異なるものであることを証明しており、モデルは一方を持ちながら他方を持たない可能性があることを示しています。

不具合の所在: 「統合(Integration)」ステーション

では、バグはどこにあるのでしょうか? 著者は単に推測したのではなく、AIの脳に対して一種の「手術」を行いました。彼らはモデルの層を3つのゾーンに分割しました。

  • コネクター(The Connector): 画像がAIが理解できる言語に翻訳される場所。
  • 初期/中間層(The Early/Mid Layers): AIが画像とテキストの例を混合しようとする場所。
  • 後期層(The Late Layers): AIが最終的な答えを決める場所。

彼らは、崩壊が具体的にコネクターおよび初期/中間層で発生していることを突き止めました。ここが「統合ステーション(Integration Station)」です。例があまりに積み重なると、このステーションはオーバーロード状態になります。新しい情報を現在の質問と混ぜ合わせる代わりに、AIは混乱し、直前に見た例をただコピーしてしまうのです。

決定的なのは、後期層(答えが選ばれる場所)を修正しても役に立たないことを彼らが証明したことです。実際、そこで修正を試みると状況は悪化します! それは、渋滞の原因が合流地点にあるのに、出口ランプで交通整理をしようとするようなものです。修正は、画像とテキストが最初に交わる場所で行われなければなりません。

治療法: 「統合ワクチン」

論文は、CircA(Integration-Circuit Adaptation)と呼ばれる巧妙な修正策を提案しています。この主役は**「ワクチン」**です。

この「コピー」の不具合を起こしやすいロボットがいると想像してください。ロボット全体を再学習させる(それは高価で時間がかかる)代わりに、著者は「統合ステーション」だけに特化した小さな専用のアダプター(小さな追加モジュール)を訓練しました。彼らはこのアダプターに、一つの単純なタスクを教えました。「例を見たら、それを実際に使ってルールを理解せよ。単に最後のものをコピーするな」というタスクです。

ここが魔法のような点です。この小さなアダプターを一つの特定のタスクに対して訓練すると、それは「ワクチン」として機能します。それは単にその一つのタスクを直すだけでなく、一度も見たことがない「全く新しい」タスクに対しても、ロボットを崩壊から守ります。ロボットは突如として、「例が増える=性能が悪化する」という罠に対して免疫を持つようになるのです。

論文は、ツールボックスに他に2つの道具も提案しています。

  • ゲート(The Gate): もしロボットの脳を変更できない場合(クローズドなAPIを使用している場合など)、ロボットがクラッシュし始める前に例を追加するのを止めてください。ロボットが最後の答えをコピーし始める兆候を見逃さず、そこで例の提供を遮断します。
  • インジェクター(The Inject): もし学習はできるが、例が長すぎてメモリに収まらない場合は、例を単一の「タスクベクトル」に圧縮し、すべての写真を見せる必要をスキップして、脳に直接注入することができます。

大きな教訓

最も驚くべき展開は、「速い」学習が行われる場所(統合ステーション)は、「遅い」永続的な記憶を保存すべき場所とは異なるということです。

ロボットに新しいスキルを恒久的に教えたい場合(重みを更新する場合)、それは後期層で行うべきです。しかし、いくつかの例から素早く学習させたい(かつクラッシュさせたくない)場合は、統合ステーションを修正する必要があります。これらは、2つの異なる役割のための、2つの異なるパーツなのです。

要約すると、この論文は、AIに多くの例を与えることが必ずしも「無料のランチ(得をする行為)」ではないことを示しています。時には、それは罠となります。しかし、その罠がどこに仕掛けられているかを正確に理解することで、モデルが理性を失うことなく、何百もの例から学習できるようにする、小さく安価な修正策を構築できるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →