Unified Pix Token And Word Token Generative Language Model
本論文は、現在の ViT ベースの視覚エンコーダが微細な視覚的特徴を認識する際の限界を克服するために、カラーフォールディングやグローバル条件付アテンションといった特定のアーキテクチャ的革新を用いてピクセルトークンと単語トークンを統合する新しい生成言語モデルを提案し、小規模なモデルや限られたデータであっても高い性能を示すことを実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータに同時に「見る」ことと「話す」ことを教えようとしていると想像してみてください。現在、最も優れたコンピュータは画像を見るためにViT(Vision Transformer)と呼ばれる手法を使用しています。この論文の著者たちは、この現在の手法は、複雑な絵画をぼやけた要約スケッチだけを眺めて説明しようとするようなものだと主張しています。車のナンバープレート番号や看板の小さな文字といった、細部を見逃してしまいます。
以下は、日常の比喩を用いた、彼らの新しいアイデアである統一ピクセルトークンと単語トークンモデルの簡単な解説です。
1. 問題:「ぼやけたスケッチ」対「ピクセルごとの現実」
現在の手法(ViT/CLIP)
100 万個の小さなタイルでできた巨大なモザイクがあると想像してください。現在の AI は、すべてのタイルを個別に見るわけではありません。代わりに、それらを大きな塊(パッチ)にグループ化し、「この塊全体はどう見えるか?」と問いかけます。そして、その塊を単一の「単語」や要約に変換します。
- 欠点: もしたった一つの小さなタイル(例えば、ナンバープレートの数字を 1 から 6 に変更)を変えただけでも、その塊全体の要約が完全に変わってしまいます。まるで文章のたった一文字を変えただけで、AI がその文章全体の意味が全く異なるものだと考えてしまうようなものです。これでは、小さな细节を見抜くのが苦手になります。
新しい手法(Pix Token)
著者たちは、「要約するのをやめよう。画像の最も小さな色の点であるすべてのピクセルに、固有の名札と辞書の見出しを与えよう」と言います。
- 比喩: タイルを塊にグループ化する代わりに、モザイクのすべてのタイルに固有の ID カードを与えます。もし一つのタイルを変えれば、その ID カードだけが変化します。残りの画像は全く同じままです。これにより、AI は微小な细节に対してはるかに敏感になります。
2. 課題:覚えすぎる名前
問題:
すべてのピクセルに名前をつけ、ピクセルが 1670 万色のいずれかになり得るとすると、途方もなく巨大な辞書ができてしまいます。すべての色を調べるには、コンピュータの処理能力が不足します。
解決策:「カラー・フォールディング」
著者たちは、カラー・フォールディングと呼ばれる巧妙なトリックを提案します。
- 比喩: 1670 万種類もの青の色の違いが入った箱があると想像してください。人間の目には、「空色」と「空色+小さな白い斑点」の違いは見えません。
- 対策: モデルは、これら区別がつかない微小な色合いをグループ化します。「1600 万もの名前が必要ない。人間が実際に認識できるすべての色をカバーする 4000 個の名前を使おう」と言うのです。
- 結果: これにより、辞書のサイズが劇的に縮小されます(巨大な地図をポケットサイズに折りたたむように)。しかし、人間の目には画像がぼやけて見えることはありません。膨大な計算資源を節約します。
3. 魔法のトリック:「グローバルからローカル」への注意
問題:
辞書が小さくなっても、画像全体をピクセルごとに眺めるのは依然として膨大な作業です。すべてのピクセルを一度に他のすべてのピクセルと比較しよう(グローバル・アテンション)とすると、コンピュータは圧倒されてしまいます。まるで 1 万人の人が同時に話しているのを聞こうとするようなものです。
解決策:「ウィンドウド・アテンション」
モデルは画像を小さなウィンドウ(小さな正方形のフレームを通して見るようなもの)に分割します。
- ステップ 1: ピクセルの小さなウィンドウを見て、それらが互いにどのように関係しているかを把握します。
- ステップ 2: そのウィンドウの「要約」を取り出し、次のウィンドウへ移動します。
- ステップ 3: これらのウィンドウの要約を組み合わせ、画像全体を理解します。
- 比喩: コンサート会場の群衆全体を一度に理解しようとする代わりに、友人の小さなグループが話しているのを聞き、次に別のグループを聞き、最後に群衆全体が何を言っているかを組み立てます。著者たちはこれを、全員を一度に聞くのと同じくらい効果的でありながら、はるかに高速な「賢い近似」と主張しています。
4. 大きな目標:言葉と画像の統合
現在、AI モデルはテキストと画像を別々のものとして扱っています。テキストは一つの脳で読み、画像は別の「翻訳機」(ViT エンコーダ)で見ています。
新しいモデル:
このモデルは、ピクセルを単語と全く同じように扱います。
- 比喩: 「Apple」が単語であり、特定の赤みが単語でもあるような言語を想像してください。AI は「The [赤いピクセル] is on the [緑のピクセル]」という文を、「The apple is on the table」と読むのと同じくらい簡単に読むことができます。
- 利点: ピクセルを単語のように扱うため、教師なしデータから学習できます。つまり、「これは猫だ」といった人間によるラベル付けを必要とせず、インターネット上の何百万もの生画像を眺めるだけで学習できるのです。まるで、フラッシュカードで教わるのではなく、世界を眺めるだけで視覚を学ぶ子供のようなものです。
5. 彼らは実際に何をしたのか?
著者たちは、このモデルの小型版(1 億 2000 万パラメータ)を構築し、画像のみ(まだテキストは混ぜていない)で訓練しました。
- 結果: モデルは正常に学習しました。「ロス」(AI がどの程度混乱しているかを測る指標)が減少し、ピクセルのパターンを理解し始めたことを意味します。
- 主張: 彼らは、このモデルにさらに計算資源とデータを与えれば、テキストベースの AI(GPT-3 など)をこれほど成功させたのと同じ「スケーリング則」に従って、さらに良くなると信じています。
まとめ
この論文は、コンピュータが視覚を得るための新しい方法を提案しています。
- 画像を要約するのをやめ、すべてのピクセルに固有のアイデンティティを与える。
- 色がカラー・フォールディングによって単純化され、コンピュータが圧倒されないようにする。
- エネルギーを節約するために、一度にすべてを見るのではなくウィンドウで見る。
- ピクセルを単語のように扱い、人間教師を必要とせずに生画像から AI が学習できるようにする。
著者たちは、これが現在の手法よりも将来の AI 視覚のより良い基盤になると信じていますが、大規模な規模でそれを証明するには、さらに多くの計算資源が必要であると認めています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。