← 最新の論文
🤖 machine learning

ΔEnergy\Delta \mathrm{Energy}: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

本論文は、視覚と言語の整合性におけるエネルギー変化に着想を得た新たな OOD スコアであるΔ\DeltaEnergy と、視覚と言語モデルにおける分布外検出と汎化性能を同時に向上させ、既存手法を上回る顕著な性能向上を実現する対応するファインチューニングフレームワーク(EBM)を導入する。

原著者: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、世界中を旅したガイド(ビジョン・言語モデル)がいると想像してください。このガイドは、膨大な書籍や写真のライブラリから数千もの物体を認識することを学びました。このガイドは、「ゴールデンレトリバー」や「赤いスポーツカー」など、以前に見たものを特定するのが得意です。

しかし、このガイドが現実世界に出ていくと、2 つの厄介な状況に直面します。

  1. 「コスプレ」問題(共変量シフト): ゴールデンレトリバーを見ますが、これはスケッチで描かれたものだったり、雨の中で撮影された写真だったり、絵画だったりします。犬は同じですが、スタイルが異なります。ガイドは混乱し、「これはまだ犬なのか?」と考えてしまうかもしれません。
  2. 「異星人」問題(意味的シフト): 訓練ライブラリに一度も存在しなかった、例えば「キラキラしたユニコーン」のような全く新しい生物を見ます。ガイドは自信を持って「あれは馬だ!」と推測するのではなく、「これは何だか分からない」と認識する必要があります。

この論文は、ガイドが両方の問題に同時に対処できるよう、Δ\DeltaEnergy(デルタ・エナジー)と呼ばれる新しい手法と、EBMと呼ばれる訓練技法を導入します。

核心となるアイデア:「沈黙」テスト

これがどのように機能するかを理解するために、ガイドが画像を見ており、さまざまなラベルに対してどれほど自信があるかを叫んでいると想像してください。

  • 犬の写真を見た場合、「犬!(99% の自信)猫!(1%)鳥!(0.1%)」と叫ぶかもしれません。
  • 「キラキラしたユニコーン」を見た場合、「馬!(40%)猫!(30%)犬!(20%)」と叫ぶかもしれません。混乱しており、賭けを薄く分散させています。

Δ\DeltaEnergy のトリック:
研究者たちは、ガイドに奇妙な実験をさせます。「もしあなたがトップの推測について完全に沈黙することを強要されたら、どうなるでしょうか?」

彼らはガイドのトップの推測(例えば「犬」)を取り、その自信をゼロに設定します。そして、「さて、'犬'と言えるなくなった今、あなたの全体的な'エネルギー'(または総自信)はどれほど低下しますか?」と尋ねます。

  • 本物の犬の場合(分布内): ガイドはそれが犬であることに非常に確信していました。その答えを沈黙させると、ガイドはパニックになります。その総自信は崩壊します。エネルギーの「低下」は非常に大きいです。
  • 異星人/未知の物体の場合(分布外): ガイドはすでに不確実であり、賭けを多くの選択肢に分散させていました。トップの推測を沈黙させても、それが一つの答えだけに依存していなかったため、あまり変化しません。エネルギーの「低下」は小さいです。

このエネルギーの変化Δ\DeltaEnergy)を測定することで、システムは「奇妙なスタイルの犬」(大きな低下)と「全く新しい生物」(小さな低下)を容易に見分けることができます。

訓練のアップグレード:EBM(エネルギー境界最大化)

違いを見分ける方法を知っていることは素晴らしいですが、この論文はガイドが学習しながらそれをより上手に行う方法も教えています。

彼らはEBMと呼ばれる訓練ルールを導入します。ガイドが犬の写真を見て勉強していると想像してください。

  1. ガイドは写真全体を見ます。
  2. 次に、研究者たちは写真の一部に「マスク」をかけます(犬の顔を覆うなど、または背景を覆うなど)、そしてガイドに再度それを見るよう求めます。
  3. 目標は、マスクがかかっている場合でも、ガイドが完全な写真を見たときと同じ「エネルギー」の変化を感じるように訓練することです。

比喩:
友人の声を認識することを学ぶようなものです。

  • 古い方法: 静かな部屋でその人の声を完璧に暗記します。もし彼らが騒がしいカフェで話したら(共変量シフト)、彼らを認識できないかもしれません。
  • EBM 方式: 彼らがささやいたり、叫んだり、壁越しに話したりしている間、彼らを認識する練習をします。完璧な条件だけでなく、声の核心を学びます。

訓練中にこれらの「マスクされた」または「切り抜かれた」データバージョンを処理することをモデルに強制することで、それはスタイルの変化(雨やスケッチなど)に対して頑健になりつつ、全く新しいものを発見する能力も維持することを学びます。

結果:超信頼性の高いガイド

この論文は、ImageNet(数千の画像を含む)のような大規模データセットでこれをテストしました。

  • 検出の向上: 新しい手法は、以前の手法よりも「異星人」(未知の物体)を検出する能力が大幅に向上しました。誤検知の数を大幅に削減しました(一部のテストでは 10%〜25% 向上)。
  • 汎化性の向上: また、何であるかを忘れることなく、「コスプレ」された犬(新しいスタイルの物体)を認識する能力も大幅に向上しました。

まとめ

この論文は、シンプルだが強力なアイデアを提案します:トップの推測を沈黙させたときに、モデルの自信がどれほど変化するかを測定する。

  • 自信が崩壊すれば、それは新しいスタイルの既知の物体である可能性が高い。
  • 自信が安定していれば、それは全く新しい物体である可能性が高い。

彼らはこの洞察を用いてモデルをより頑健に訓練し、未知を発見する優れた探偵であり、かつ新しい状況で既知を認識する優れた一般主義者であるシステムを構築しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →