← 最新の論文
🤖 AI

ZAYA1-VL-8B Technical Report

本論文は、視覚特化型 LoRA アダプターと双方向注意機構を活用し、多様な視覚理解ベンチマークにおいてより大規模な最先端モデルと同等かそれ以上の性能を達成する、92 億パラメータのコンパクトな混合専門家型視覚言語モデル ZAYA1-VL-8B を紹介する。

原著者: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、ZAYA1-VL-8B の技術報告書を、平易な言葉と創造的な比喩を用いて解説したものです。

全体像:画像と言語のためのコンパクトな「スーパーブレイン」

あなたが、本については何でも知っているが、一度も写真を見たことがない天才的な司書(言語モデル)を持っていると想像してください。さて、この司書に写真、チャート、図表を理解できるようにするための「眼鏡」を与えたいとしましょう。

Zyphra Technologies のチームは、ZAYA1-VL-8B という新しい種類の「ビジョン・ランゲージモデル」を構築しました。これは、テキストを読みながら同時に画像も観察できる、コンパクトで非常に効率的な「脳」と考えてください。比較的小さい(80 億パラメータ)にもかかわらず、物体の数を数える、画像内のテキストを読み取る(OCR)、視覚的なパズルを解くなどのタスクにおいて、はるかに大きく高価なモデルと同等かそれ以上の性能を発揮します。

2 つの秘密の材料

この論文は、この小さなモデルをこれほど賢くするためにチームが用いた 2 つの具体的な「工夫」を強調しています。

1. 「ビジョン専用」の眼鏡(ビジョン固有の LoRA アダプタ)

  • 問題点: 通常、モデルが画像を見てテキストを読む際、両方に全く同じ内部の「筋肉」(パラメータ)を使用します。これは、同じ手で同時にピアノとドラムを演奏しようとするようなもので、信号が混同されてしまいます。
  • 解決策: チームは、脳の画像処理部分に専用の軽量な「眼鏡」(LoRA アダプタと呼ばれるもの)を追加しました。
  • 比喩: 司書には本を読むためのメインの机があります。写真を見るために新しいオフィス全体を建設するのではなく、既存の机の上に専用の虫眼鏡とカラーフィルターを掛けたと想像してください。これで司書は写真を見る際に、より多くのスタッフを雇ったり、建物を大きくしたりすることなく、これらの特殊な道具を使って詳細をよりよく見ることができます。これにより、モデルは巨大化することなく「モダリティ固有」(画像に優れている)になります。

2. 「パノラマ視点」(双方向アテンション)

  • 問題点: 標準的な AI モデルは、文章のように左から右へテキストを読み進めます。画像を同じように扱おうとすると、左上の隅を見て、右下の隅がどうつながっているかを「振り返って」見ることを怠る可能性があります。これは、絵画を理解しようとして、一度に一筆の筆跡しか見ず、全体像を見るために一歩下がることがないようなものです。
  • 解決策: チームはルールを変更し、モデルが画像を見る際、画像のすべての部分が瞬時に他のすべての部分と「会話」できるようにしました。
  • 比喩: 画像をテキストの行(左から右)のように読むのではなく、モデルはパノラマ視点をとります。空、山、川をすべて一度に見て、それらが互いにどのように関連しているかを即座に理解できます。これにより、モデルは画像の「全体像」の構造をはるかに良く理解できるようになります。

どのように訓練されたか:「カリキュラム」

チームは単にデータをモデルに投げつけたのではなく、学生が学校に通うように段階的に教えました。

  1. 幼稚園(アライメント): 低解像度の画像を用いて、モデルに簡単な画像を説明する方法から始めました。「脳」を凍結し、「眼鏡」(アダプタ)のみを訓練して、画像データがテキストと同じ言語を話すようにしました。
  2. 小学校(事前学習): 全モデルを解放し、3000 万の画像とテキストの例を与えました。重要なのは、小さな画像から始め、解像度を徐々に上げていったことで、モデルに小さなアイコンから巨大な高解像度写真まで、あらゆるものを扱えるように教えました。
  3. 高校(埋め込みの拡張): モデルに物を指し示すための新しい語彙を教えました。「この特定の場所を見ろ」とか、「あの物体の周りに枠を描け」と言えるよう、特別な「単語」(トークン)を追加しました。
  4. 大学院(指示チューニング): 最終的に、チャートに関する質問に答えたり、散らかった部屋から特定の物体を見つけたりする 2000 万の複雑なタスクを与え、推論能力を磨きました。

できること(結果)

この論文は、ZAYA1-VL-8B を他のトップモデルと比較してテストしました。以下がその得意とする分野です。

  • 画像内のテキスト読み取り: 光学文字認識(OCR)に非常に優れており、街路標識や書類など、写真内のテキストを読み取ることができます。
  • 数え上げ: 鳥の群れの写真を示せば、正確に数を数えることができます。
  • 指し示しと境界ボックス: 「赤い車を指し示して」と頼めば、その車の正確な座標を返すことができます。
  • 効率性: これらの結果を、競合他社よりもはるかに少ない計算資源(アクティブパラメータ)で達成しています。これは、ガソリンを大量に消費する車と同じ走行距離を達成しながら、燃料を半分しか使わないハイブリッドカーのようなものです。

まとめ

ZAYA1-VL-8B は、画像と言語を理解するために巨大で肥大化したモデルが必要ではないことを示しています。モデルに画像用の特殊な道具(「眼鏡」)を与え、一度に画像全体を見られるように(「パノラマ視点」)することで、チームは小さく、効率的で、非常に能力の高い AI を作り上げました。これは現在、誰でも利用できるようになっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →