← 最新の論文
💻 computer science

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

HANCLIPは、双曲幾何学と角度トリプレット目的関数を活用して、コンパクトな学習フレームワーク内で否定を明示的に符号化することで、大規模な再学習を必要とすることなく標準的なタスクでの性能を維持しながら、NegBenchのようなベンチマークにおける否定への感度を大幅に向上させるビジョン・ランゲージ・モデルのファミリーを導入する。

原著者: Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

公開日 2026-06-24
📖 1 分で読めます☕ さくっと読める

原著者: Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの手元には、非常に賢い司書(ビジョン・ランゲージ・モデル)がいます。彼らは何百万冊もの本を読み、何百万枚もの写真を見てきました。この司書は、「猫」の写真と「猫」という言葉を一致させることは得意です。しかし、この司書には面白い弱点があります。それは、「〜ではない(not)」という言葉に苦戦することです。

もし、あなたが猫の写真を見せて、「これは犬ではない(not a dog)のですか?」と尋ねたら、司書は混乱してしまいます。なぜなら、彼らはパターンを暗記することで学習してきたため、そこに「犬」という言葉と「猫」の写真を見ると、「おや、これら二つは私の学習データの中でよく一緒に現れる組み合わせだ」と判断してしまうのです。たとえ文章がそれらが「反対」であることを示していたとしてもです。彼らは論理を真に理解しているのではなく、浅い単語のマッチングに頼っているのです。

この論文では、これを解決するためにHANCLIPと呼ばれる新しいシステムを紹介しています。その仕組みを、簡単な比喩を使って説明しましょう。

1. 問題点:「平坦な」地図

司書の脳を、巨大で平坦な地図(ユークリッド空間)だと考えてみてください。この地図の上では、あらゆるものがただの「点」に過ぎません。

  • 「猫」の点は、「子猫」の点の近くにあります。
  • 「犬」の点は、そこから遠くにあります。
  • しかし、司書が「犬ではない(Not a Dog)」というフレーズを見たとき、その点をどこに置けばよいのか分かりません。「犬」からは遠すぎますが、「猫」とも完全には一致しません。平坦な地図では混乱が生じ、司書は間違った推測をしてしまいます。

2. 解決策:「樹形図」の地図(双曲空間)

著者たちは、司書の脳を樹形図のような地図(双曲空間)へと移行させることを提案しています。

  • 木を想像してください。幹が中心です。中心に近づくほど、概念はより一般的になります(例:「動物」)。枝や葉に向かって外側へ進むほど、物事はより具体的になります(例:「猫」、「犬」、「犬ではない」)。
  • この樹形の世界では、「猫」と「犬ではない」は同じ枝の上に位置することができます。なぜなら、それらは関連する概念だからです。一方で「犬」は全く別の枝にあります。
  • これにより、モデルは「ある画像が何であるか」と「ある画像が何ではないか」が、単なる平坦な床に転がるランダムな点ではなく、同じ木の異なる枝であることを理解できるようになります。

3. 「角度」のトリック(角度的三つ組否定損失)

このシステムは、**角度的三つ組(Angular Triplet)**と呼ばれるもう一つのトリックを使用します。3人の人物が部屋に立っていると想像してください。

  1. 負のアンカー (N): 「犬」と書かれた看板を持っている人。
  2. 正の対象 (P): 「猫」と書かれた看板を持っている人。
  3. 否定された正の対象 (P'): 「犬ではない(Not a Dog)」と書かれた看板を持っている人。

システムは、彼らの間の「角度」を教え込みます。

  • 整列(Alignment): 「犬」の人から見ると、「猫」の人と「犬ではない」の人は、ほぼ同じ方向を向いているはずです。彼らは共に「犬ではないもの」だからです。
  • 分離(Separation): しかし、「猫」の人と「犬ではない」の人は、互いに混同されないよう、十分に離れて立っていなければなりません。

これらの角度を調整することで、モデルは「犬ではない」という概念が「猫」と同じ方向を指している(どちらも「犬ではない」ため)一方で、それらを区別して混同を避ける方法を学習します。

4. 結果:スマートで効率的なアップグレード

著者たちは、司書の脳をゼロから作り直す必要はありませんでした。代わりに、わずか2万個の例(通常必要とされる数百万個という膨大なデータに比べれば、ほんの一滴に過ぎません)という、非常に絞り込まれた学習セットを使用しました。

彼らはこの新しい「HANCLIP」システムを、4つの既存モデル(CLIP, LongCLIP, SmartCLIP, HiMo-CLIP)でテストしました。その結果は以下の通りです。

  • 優れた論理性能: モデルは、「〜ではない(not)」を含む質問(例:「車が含まれていない画像はどれですか?」)に対して、回答能力が大幅に向上しました。
  • 記憶の喪失なし: 決定的なことに、モデルは以前の仕事を忘れることはありませんでした。彼らは依然として、単純な記述に基づいた画像の検索や、画像の分類において、以前と同様に優れた能力を維持しています。
  • 効率性: 彼らは、膨大な量の新しいデータやシステム全体の再学習を必要とすることなく、これらの改善を実現しました。

要約すると: HANCLIPは、AIモデルに、より優れた「メンタルマップ(心の地図)」と、概念としての「NOT(〜ではない)」を理解するための幾何学的なルールを与えます。これにより、モデルは「あるものが何であるか」を理解する能力を失うことなく、「あるものが何ではないか」について推論することが可能になるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →