← 最新の論文
💻 computer science

FineVision: Open Data Is All You Need

FineVision は、200 以上のソースを人間の監督のもとで統合し、汚染と重複を排除するために厳格な半自動パイプラインを通じて作成された、2400 万の綿密にキュレーションされた視覚言語サンプルからなる最大のオープンコーパスを導入し、これによりこのデータセットで訓練されたモデルが既存のオープンな代替手段を大幅に上回る性能を発揮することを可能にします。

原著者: Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, Andrés Marafioti

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, Andrés Marafioti

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに人間のように世界を見て理解することを教えると想像してみてください。そのためには、数百万枚の画像を見せ、それらについて話す方法を教える必要があります。これが「ビジョン・ランゲージモデル(VLMs)」が行うことです。

しかし、これまで一般に利用可能だった「教科書」(データセット)は散漫でした。それは、ある本は異なる言語で書かれ、あるページは破れ、ある箇所には誤字があり、さらにあるものは後でロボットが評価されるテスト問題そのもののコピーさえ含まれているような図書館のようでした。これにより、オープンソースのロボットは、大手テック企業が構築する高価で秘密裏のロボットほど上手に学習することが困難でした。

FineVision は、Hugging Face、ミュンヘン工科大学、スタンフォード大学の研究者たちによって作成された、新しく巨大で徹底的に整備された図書館です。彼らがこれをどのように構築し、なぜ重要なのかを、簡単に説明します。

1. 大掃除(データキュレーション)

研究者たちは、学術論文からクラウドストレージのフォルダに至るまで、200 以上の異なるデータソースを収集しました。しかし、それらを単に放り込むだけでは機能しません。

  • 翻訳者: 彼らは(AI ヘルパーを用いた)「半自動」システムを構築し、これらの異なる形式をすべて一つの標準言語に変換しました。200 種類もの異なるレシピ(フランス語のもの、日本語のもの、ナプキンに書かれたものなど)を集め、それらすべてを単一の、わかりやすい料理本形式に変換すると想像してください。
  • 人間の編集者: AI は完璧ではありません。そのため、人間の審査員が編集者として機能しました。彼らは AI の作業をチェックし、間違いを修正し、「レシピ」が安全で正確であることを確認しました。AI が変換を誤った場合、人間がそれを修正し、AI に再挑戦させました。
  • 重複除去: 彼らは、重複する画像を検出・削除するための特別な「コピー検出器」を使用しました。もし同じ猫の画像が図書館に 50 回登場していた場合、1 枚だけを残すか(あるいはそれらを単一の、より豊かな会話に統合するか)、ロボットが同じ猫を何度も暗記するのを防ぎました。
  • テスト安全地帯: 彼らは、これらのロボットを評価するために使用される 66 の標準テストに対して図書館をチェックしました。もし図書館の中に、将来のテストの画像と同一の画像が見つかった場合、それを削除しました。これにより、ロボットが単に答えを暗記して「カンニング」するのではなく、実際に学習していることを保証します。

2. 図書館の中には何が?

最終的な結果は、2,400 万のサンプル(約 1,700 万の画像)からなるコレクション、FineVision です。これは単なる画像の山ではなく、会話として整理されています。

  • 多様性: 「これは何ですか?」という単純な質問から、チャートの読み取り、数学の問題の解決、文書の理解といった複雑なタスクまで、すべてを網羅しています。
  • 「アクション」セクション: 図書館の特別な部分は、ロボットにコンピュータインターフェース(マウスのクリックやスマホ画面への入力など)の使い方を教えます。彼らはこれを標準化し、ロボットがデスクトップ、スマートフォン、ブラウザで機能する普遍的な「アクション言語」を学習できるようにしました。
  • 品質管理: 図書館内のすべての会話について、AI ジャッジ(および人間による確認)が以下の 4 つの点でスコアリングを行いました。
    1. フォーマット: テキストは清潔で読みやすいか?
    2. 関連性: 回答は実際に質問と一致しているか?
    3. 視覚的依存性: 回答が正しいかどうかを判断するために、画像を見る必要があるか?
    4. 対応関係: 画像は実際に質問で問われているものを示しているか?

3. 結果:機能するか?

研究者たちは、この新しい図書館を使って小さなロボットモデルを訓練し、他の人気のある散漫な図書館で訓練されたモデルと比較しました。

  • スコアボード: FineVision で訓練されたロボットは、11 の異なるテストで著しく高いスコアを記録しました。以前の最高のオープンソース図書館を大幅に上回り(競合に応じてパフォーマンスを約 11% から 38% 向上)、圧勝しました。
  • 「カンニング」テスト: 訓練データから、テストから漏れた可能性のあるわずかな「カンニング」画像(データ)を除去した際、FineVision ロボットのパフォーマンスはほとんど低下しませんでした。一方、他のロボットのパフォーマンスは大幅に低下しました。これは、FineVision がロボットに記憶させるのではなく、理解させることを教えたことを証明しています。
  • GUI マジック: FineVision で訓練されたロボットは、他の小さなモデルよりもコンピュータ画面の操作(ボタンクリックや入力など)がはるかに優れており、4 倍大きいモデルと同等のパフォーマンスを発揮しました。

結論

この論文は、クリーンで多様かつよく整理されたデータが秘訣であると主張しています。必ずしもより大きなモデルや秘密のデータセットが必要なのではなく、より良い図書館が必要なのです。FineVision は、データを整備し慎重に組織化することで、オープンソースモデルがついに巨大なクローズドソースモデルに追いつけることを証明しています。

研究者たちは、この図書館とそれを整備するために使用したツールを公開し、コミュニティ全体がより賢く、信頼性の高い AI 視覚システムを構築するのを支援することを期待しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →