Inducing Spatial Locality in Vision Transformers through the Training Protocol
本論文は、大規模な事前学習を必要とせずに、ゼロから訓練されたビジョントランスフォーマーの初期層において、現代の訓練プロトコル内でのCutMixデータ拡張技術が空間的局所性と集中した注意を誘発することを示す。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
写真の中で異なる動物を認識するように学生に教える場面を想像してください。教えるには 2 つの方法があります。
- 「旧式」の方法: 全体像を見せ、「これは猫です」と言います。学生は画像全体を見つめ、背景に混乱したり、全体的な雰囲気から答えを推測したりするかもしれません。
- 「現代」の方法: 全体像を見せますが、その後、別の写真から切り取った付箋で写真のランダムな部分を隠すゲームを行います。こうして「猫」と推測するには、残された猫の小さな可視部分に集中し、他を無視しなければなりません。
この論文は、これらの 2 つの異なる教授法を用いたとき、ビジョン・トランスフォーマー(ViT) という特定の種類の AI 脳内で何が起こるかを扱っています。
問題点:「全体を見る目」
ビジョン・トランスフォーマーは強力ですが、独特の癖があります。人間の目(または CNN と呼ばれる古い AI モデル)が自然に小さな近接した詳細から見るのに対し、ViT は設計上、すべてを同時に見るように作られています。画像のすべての部分が、即座に他のすべての部分と「会話」できます。
研究者たちは疑問に思いました:ViT に、数百万枚の画像を見せることなく、猫の耳のような小さな局所的な詳細を見るように教えることはできるでしょうか?
実験:2 つのトレーニングプロトコル
研究者たちは、小さく新しい AI モデルを取り出し、3 つの異なる写真セット(小さな動物園、中くらいの動物園、大きな動物園など)でトレーニングしました。AI の脳構造は完全に同じに保ちつつ、教え方を変えました。
- ベースライン(旧式): 画像を基本的な反転や切り抜きだけで見せました。
- 現代(「付箋」ゲーム): 3 つの凝ったトリックを追加しました。
- AutoAugment: 画像が異なるように見えるよう、色や形を自動的に変更します。
- ラベルスムージング: AI に「100% 確信するな、少し謙虚であれ」と伝えます。
- CutMix: これが主役です。ある画像から正方形を切り取り、別の画像に貼り付けます。AI は、一部が欠けていたり置き換わっていたりしても、動物を推測しなければなりません。
発見:「CutMix」の効果
研究者たちは、AI の注目がどれほど「局所的」かを測定しました。部屋全体を見たのでしょうか、それとも猫の耳だけを見たのでしょうか。
- 結果: 「現代」の方法は、AI の初期層(最初に「考える」もの)が、小さく近接した領域に非常に厳密に焦点を合わせるようにしました。それは人間の目や従来のカメラレンズに非常に似るようになりました。
- 驚き: 「現代」の方法を分解して、どのトリックが重労働を担っているか確認したところ、CutMix だけが重要であることがわかりました。
- 「色の変化」(AutoAugment)や「謙虚さ」(ラベルスムージング)だけを追加しても、AI が局所的に見るようになることはありませんでした。
- 基本的なトレーニングにCutMix だけを追加すると、AI は突然、局所的な詳細に焦点を当て始めました。
- 凝ったトレーニングから CutMix を取り除くと、他のトリックが残っていても、AI は局所的に焦点を当てる方法を忘れてしまいました。
比喩:「部分的な視点」の圧力
なぜ CutMix が機能するのでしょうか。この論文は、それは圧力によるものだと示唆しています。
人混みの中で友人を特定しようとしているが、誰かが常にその人の顔の前に看板を置いていると想像してください。もはや顔全体や一般的な服装に頼ることはできません。見える片目や耳に非常に注意深く見つめることを強いられます。あなたは全体像ではなく、局所的で特定の特性によって彼らを認識することを学びます。
CutMix は AI をこの同じ状況に追い込みます。画像の一部が絶えず入れ替えられるため、AI はグローバルな文脈に頼ることができないと学びます。正解を得るためには、小さく局所的な領域から有用な情報を抽出することを必ず学ばなければなりません。
結論
- 彼らが発見したこと: ビジョン・トランスフォーマーに局所的な詳細に焦点を合わせるようにするには、数百万枚の画像は必要ありません。必要なのは、CutMix という特定のトレーニング・トリックを使うことです。
- それがすること: AI の初期層を、小さなパッチに焦点を当てる「局所検出器」として機能させ、グローバルなスキャナーとして機能させるのではなく、そうさせます。
- それがしないこと: 他の一般的なトレーニング・トリック(色の変更や確信度の緩和)は AI のスコアを向上させますが、AI が画像を見る「方法」は変えません。注視を変えるのは CutMix だけです。
つまり、AI に森を見る前に木を見るようにさせたいなら、単に画像を多く見せるのではなく、穴の開いた画像を見せなさい。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。