← 最新の論文
💬 NLP

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

本論文では、ゼロショット分類をワッサースタイン最適輸送問題として定式化することでロバストな擬似ラベルを生成し、それらを理論的に整合したInfoNCE対照学習損失を用いて用いることで、分布シフト下での最先端の性能を達成する、推論と適応を橋渡しするVision-Language Modelのための統一されたTest-Time Adaptationフレームワークである\algnameを提案する。

原著者: Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能の世界において、コンピュータは驚くべき流暢さで「見る」こと、そして「読む」ことを学習してきました。ビジョン・ランゲージ・モデル(視覚言語モデル)として知られるシステムは、写真を見てそれを説明したり、文章を読んで一致する画像を見つけ出したりすることができます。これらは、特定のタスクのために明示的に教えられなくても実行可能です。これらのモデルは、画像と言葉を共通の数学的言語、つまり、猫の写真と言葉としての「猫」がすぐ隣に位置する共通の空間へと翻訳することを学習することで、この能力を実現しています。この能力により、モデルは一度も見たことがない物体を認識できるようになります。これは「ゼロショット学習」と呼ばれるスキルです。しかし、これらのモデルは脆弱です。現実世界が変化したとき、つまり、写真がぼやけていたり、悪天候の中で撮影されていたり、デジタルノイズによって歪んでいたりする場合、共有された言語は崩壊します。画像と言葉のつながりは綻び、モデルの確信度は崩れ去り、自動運転や医療診断のような重要なアプリケーションにおいて危険を伴うようなミスを引き起こします。

研究者たちは、モデルが作業中にその場で学習を行う「テスト時適応(test-time adaptation)」というプロセスによって、これを修正しようと試みてきました。そのアイデアは単純です。モデルが新しく、乱れた画像に遭遇した際、それらを理解するために内部設定を調整すべきであるというものです。しかし、これまでの試みは、根本的な問題に突き当たってきました。学習するためには、モデルは何を見ているのかを知る必要がありますが、こうした現実世界のシナリオでは、正解を誰も提供してくれません。モデルは自分自身のラベルを推測しなければなりませんが、これらの推測はしばしば誤っています。モデルが自身の誤った推測から学ぼうとすると、ノイズが増幅され、自身をさらに悪化させてしまうのです。さらに、古い手法は、グループ内のすべての画像を同じものとして扱うことで、エラーを平滑化しようとしました。この粗いアプローチは個々の画像のユニークな詳細を無視しており、特定の画像とその記述との間の具体的な関係を真に理解することを妨げていました。

研究チームは現在、この問題を解決するための新しい方法として、「ORIGIN」と呼ぶ手法を提案しています。モデルの生の、しばしば混乱した推測に頼る代わりに、彼らはこの問題を「グローバルな論理」を用いて解かれるべきマッチング・ゲームとして扱います。部屋の中に人々がいて、別の部屋に名前がある状況を想像してください。目標は、すべての人に正しい名前をペアリングすることです。もし一人ひとりを個別に見ていれば、間違いを犯すかもしれません。しかし、部屋全体を一度に見ることができれば、「すべての名前は正確に一度ずつ使われなければならない」という事実を利用して、エラーを修正できます。研究者たちは、まさにこれを行うために「最適輸送(optimal transport)」と呼ばれる数学的枠組みを使用しています。これは、モデルに画像とテキスト記述のバッチ全体をまとめて見させ、それらを組み合わせる最も論理的な方法を見つけ出すよう強制するものです。このグローバルな視点がノイズをフィルタリングし、画像に関するより信頼性の高い推測を生み出します。

モデルがこれらの信頼できる推測を得たら、それを用いて自己学習を行います。研究者たちは、これらの新しい、ノイズの多い画像から学ぶ最善の方法は、モデルが元々どのように訓練されたかを密接に模倣する方法であることを見出しました。彼らは、モデルが注視している特定の画像が、その共有された数学的空間において正しい記述に近づき、一方で誤った記述からは遠ざかるように、内部設定を調整するようモデルを導きます。これは、細粒度(ファイングレインド)のアプローチです。つまり、グループの平均ではなく、あらゆる単一の画像のユニークな詳細を重視するのです。このようにすることで、モデルは変化する世界に合わせて自らを再調整することを学び、画像が破損している場合でも、明確に「見る」能力を回復します。

この新しいアプローチの素晴らしさは、以前は別個のものとして扱われていた2つのステップを統合したところにあります。研究者たちは、初期の推測を行うための論理と、それらから学習するための論理は、実際にはコインの両面であることを示しました。最適なペアを見つける手法は、モデルに学習させる手法と数学的に同一なのです。これは、推測のプロセスと学習のプロセスが互いに戦っているのではなく、互いに助け合っていることを意味します。推測が優れれば学習も向上し、学習が向上すれば、将来の推測はより正確になります。これにより、モデルが歩む一歩ごとに、より賢く、より堅牢になる改善のサイクルが生まれます。

ノイズ、ぼけ、天候の影響によって意図的に歪められた画像を用いた標準的なベンチマークでのテストにおいて、この新手法は、これまでのあらゆる手法よりも大幅に効果的であることが証明されました。低解像度の小さな画像のデータセットにおいて、既存の最良の手法と比較して、精度を最大7.4パーセント向上させました。より複雑な画像を含む大規模なデータセットにおいても、依然として広い差をつけて競合を上回りました。おそらく同じくらい重要なことは、これがシステムの速度を低下させることなく行われたことです。最適なマッチングを見つけるために必要な追加の計算は非常に効率的であり、プロセスにほとんど遅延を与えませんでした。モデルはリアルタイムで適応し、高いパフォーマンスを維持しながら、データの流れにペースを合わせることができました。

研究者たちはまた、システムの異なる部分を分解することで、なぜこれがこれほど上手くいったのかを探求しました。彼らは、初期の推測を生成するためにグローバルなマッチング論理を使用することが極めて重要であることを発見しました。これなしでは、モデルはノイズの多いデータから学習することに苦労します。また、広範なカテゴリーのみを見る古い手法よりも、個々の画像とテキストのペアに焦点を当てた細粒度の学習手法を使用する方がはるかに優れていることも発見しました。これら2つの要素を組み合わせたとき、結果は一貫して最高となりました。システムは単に分布の変化を生き延びただけではありません。モデルの「考え方」と「学び方」を一致させることで、乱雑で予測不可能な現実世界の性質に対して、真にレジリエント(回復力のある)な人工知能を構築できることを実証したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →