Scalable Visual Pretraining for Language Intelligence
本論文は、図表やレイアウトといった豊かな情報を保持する生の視覚的ドキュメントを用いた教師なし視覚事前学習が、テキストのみのアプローチを一貫して上回り、言語知能の向上へのスケーラブルな経路を提供することを実証することで、基盤モデルの事前学習におけるテキストのみのパラダイムに異を唱えるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超スマートなロボットに世界を理解する方法を教えようとしていると想像してみてください。長い間、標準的なレシピは、大量の本、記事、ウェブサイトをロボットに読み込ませることでしたが、そこには一つ落とし穴がありました。それは、ロボットが読む前に、人間(またはコンピュータ)がすべての画像や、うねうねとした数式、チャート、そして凝ったページのレイアウトを取り除き、すべてをプレーンで退屈なテキストに変えてしまうというものです。それは、完成したケーキの写真や、ミキシングボウルの図解、オーブンの温度変化を示すカラフルなグラフをすべて捨てて、材料のリストだけが書かれたナプキンを渡して、誰かにケーキの作り方を教えようとするようなものです。
2026年の新しい論文は、この「テキストのみ」のアプローチが、パズルの非常に大きな部分を見逃していることを示唆しています。上海と浙江のチームによる研究者たちは、文書の視覚的な部分を捨ててしまうことで、ロボットが真に賢くなるために必要なまさにその手がかりを捨ててしまっているのだと主張しています。彼らはこの新しい手法を「ビジュアル・プリトレーニング(Visual Pretraining: VP)」と呼んでおり、それはロボットに、単なるテキストによる説明ではなく、図解や数式を含む教科書の「実際のページ」を読ませるようなものです。
大きな発見:見ることは信じること(そして学ぶこと)である
チームは、このアイデアを(QwenやLlamaのような)現在存在する最もスマートなAIモデルでテストしました。彼らは、全く同じ科学文書の山(物理学の論文、数学の教科書、技術レポートなど)を取り出し、それらを2つのグループに分けました。
- グループA(従来の方法): 彼らはページをプレーンなテキストに変換し、すべての視覚要素を取り除きました。
- グループB(新しい方法 - VP): 彼らはページの生の画像をモデルに直接入力し、言葉に変換することなく、図、表、レイアウトを「見せ」ました。
結果として、生の画像で訓練されたロボット(グループB)は、プレーンテキストで訓練されたもの(グループA)を一貫して上回りました。実際、難しい科学や数学のベンチマークにおいて、視覚的学習者はより高いスコアを記録しました。例えば、AIMEと呼ばれる難解な数学テストにおいて、視覚モデルはテキストモデルよりも大幅にスコアを向上させました。この論文は、複雑な図解を含むページを文字列の羅列に変換する「情報の欠落(lossy)」を伴うプロセスが、実は難問を解くために必要な情報そのものを削除してしまっているのだと示唆しています。
効率化のハック:少ないリソースでより多くを
ここからが本当に面白い部分です。視覚的な手法は単に優れていただけでなく、はるかに効率的でした。テキストベースのモデルは、これらの文書から学習するために約800億のテキストトークンを咀嚼しなければなりませんでした。しかし、視覚モデルは、同じ(あるいはより良い)結果を得るために、わずか約200億の視覚トークンしか必要としませんでした。つまり、データ予算のわずか25%しか使用していないのです!
これを例えるなら、テキストモデルが街を説明しようとして、すべての通りの名前と建物の住所をリストアップしている状態です。これでは時間がかかりすぎます。対照的に、視覚モデルは単に地図を見るのです。それだけで、瞬時に全体像を把握します。研究者たちは、ページに「視覚的な要素」(複雑な図解や数式など)が多いほど、視覚モデルの優位性が大きくなることを発見しました。チャートや数式が詰まったページでは、視覚モデルの優位性は巨大になりましたが、プレーンなテキストのページでは、両者はほぼ同じでした。
チートコードなし、純粋な視覚のみ
「ロボットに写真と答えの両方を見せてズルをしたのではないか?」と思うかもしれません。いいえ、彼らは特別な「画像からテキストへの」ラベルやカンニングペーパーを使用しませんでした。ロボットは、文章の中で次の単語を予測するように、単に画像の次のパッチを見て、それがどのように見えるかを推測するように指示されただけです。
驚くべきことに、この「ただ見るだけ」の訓練は、単に「見る」ことだけでなく、「理解する」こと全般においてロボットをより良くしました。ロボットはテキストの理解も向上し、後にテストした際には、画像と言葉を結びつける能力さえも向上していました。研究者たちは、ロボットの「脳」がどれほど画像と言葉を一致させているかをチェックすることでこれを測定しましたが、視覚的訓練によって、これら2つの概念がより密接に適合していることが分かりました。まるで、猫の画像と「猫」という言葉が実は同じものであることを、ロボットがついに理解したかのようです。
これが意味すること(そして意味しないこと)
著者たちは、これがテキストを読むことに代わる魔法の杖ではない、と慎重に述べています。テキストは、すでに明確に書き記されている事実を学ぶには依然として優れています。しかし、レイアウトや数式の形状、図の位置が重要な意味を持つ科学文書においては、視覚的なアプローチは、真の知能を解き放つためのスケーラブルな道を示唆しています。
彼らは、まだすべてを解決したわけではないことも認めています。例えば、彼らのテストは主に高密度な科学的PDFに関するものであったため、これが自然界のランダムな写真やビデオに対して同様に機能するかどうかは不明です。しかし、複雑な文書から学習するという特定のケースにおいて、AIに世界をありのままに——視覚的で、乱雑で、図解に満ちた姿として——見せることが、真の知能を解き放つ鍵になるかもしれないと、この論文は示唆しています。それは、「地図の記述を読んでいる」状態から、「実際に地図を見ている」状態への転換なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。