← 最新の論文
💻 computer science

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

本論文は、明示的な視覚プロンプトを用いた指示チューニング手法「Inst-IT」を提案し、大規模マルチモーダルモデルのインスタンスレベルの理解能力を飛躍的に向上させるとともに、汎用的な画像・動画理解性能の強化も実現したことを報告しています。

原著者: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

公開日 2026-03-17
📖 1 分で読めます☕ さくっと読める

原著者: Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

Inst-IT:AI に「個々の存在」を教えるための新しい魔法の教科書

こんにちは!今日は、最新の AI 研究「Inst-IT(インスタ・アイティー)」について、難しい専門用語を使わずに、誰でもわかるようにお話しします。

🎬 物語の舞台:「全体」はわかるけど「誰」がわからない AI

まず、現在の最新の AI(大規模マルチモーダルモデル)について考えてみましょう。
この AI は、写真や動画を見せると、「これは海辺の風景ですね」「人が走っている動画です」といった**「全体像」**をとても上手に説明できます。まるで、遠くから山を眺めて「おお、立派な山だ!」と感嘆する観光客のようです。

しかし、ここで問題が発生します。
もしあなたが、「左側の青いシャツを着た男の子が、右側の犬にボールを投げている瞬間を教えてください」と聞いたらどうでしょう?
今の AI は、全体は見ていても、その「特定の人物」や「特定の瞬間」に焦点を当てて答えるのが苦手なんです。まるで、混雑した駅で「あの赤い帽子の人」を探そうとしても、みんなが同じように見えてしまい、誰だかわからなくなってしまうような状態です。

🔍 解決策:Inst-IT という「新しい教科書」

この研究チームは、AI が「個々の存在(インスタンス)」を正確に理解できるよう、**「Inst-IT」**という新しい方法を提案しました。

これは、AI に教えるための**「特別な教科書(データセット)」「テスト問題(ベンチマーク)」、そして「勉強法(学習レシピ)」**の 3 つから成り立っています。

1. 魔法の目印:「Set-of-Marks(SoM)」

Inst-IT の最大の特徴は、AI に教える写真や動画に、**「数字のシール」**を貼るというアイデアです。
例えば、写真に「1 番の男の子」「2 番の犬」「3 番のボール」と、それぞれに数字のシールを貼って AI に見せます。

  • 従来の方法: 「男の子」と言っても、どの男の子かわからない。
  • Inst-IT の方法:1 番の男の子がボールを持っている」と言えるように、数字でハッキリと指し示す。

これにより、AI は「あ、この数字のシールがついているのが『男の子』なんだ!」と、混乱せずに特定の存在に集中して学習できるようになります。まるで、子供向けの本に「ここが主人公のマークだよ」と印をつけて教えているようなものです。

2. 膨大な「個別の物語」

この研究では、AI に教えるために、5 万枚の写真と 2 万本の動画から、**「個々の存在に焦点を当てた」**膨大な量のテキストデータを作りました。

  • 「1 番の男の子は青い服を着ている」
  • 「2 番の犬は走って 1 番の男の子に近づいた」
  • 「3 番のボールは空高く舞った」

これらを動画のフレームごとに、そして動画全体として、詳細に記録しました。まるで、映画のすべての登場人物の「日記」や「台本」を、細部まで書き起こして AI に読ませているようなものです。

3. 継続的な「勉強法」

ただデータを見せるだけでなく、AI にこの新しい知識を定着させるための「勉強法」も工夫しました。
既存の AI が持っている「一般的な知識」と、新しく作った「個々の存在に特化した知識」をバランスよく混ぜ合わせて学習させることで、AI が**「全体もわかるし、特定の人物も詳しくわかる」**という、両方の能力を兼ね備えた賢い存在に成長させました。

🏆 結果:AI が「名探偵」に大変身

この新しい方法で学習させた AI をテストしたところ、驚くべき結果が出ました。

  • 特定の人物を見つける能力: 「Inst-IT ベンチマーク」というテストでは、従来の AI が 40% 程度だった正解率が、60% 以上に大幅に向上しました。
  • 一般的な能力も向上: 特定の人物に特化した学習をしたのに、逆に「写真全体の説明」や「動画の要約」といった、一般的な能力も向上しました。
    • これは、**「特定の人物を詳しく知ることで、全体の構造もより深く理解できるようになった」**ことを意味します。まるで、街の一人一人の顔を詳しく知ることで、街全体の雰囲気をより深く理解できるようになったようなものです。

🌟 まとめ:AI との未来

この研究は、AI が単に「何が見えているか」を答えるだけでなく、**「あなたが興味を持っている『誰』や『何』について、詳しく答えてくれる」**ようになるための重要な一歩です。

今後は、AI が「あの青い服の男の子、どうしたの?」と聞かれたら、「彼はボールを拾って走っていますよ」と、まるで親しい友人のように正確に答えてくれるようになるかもしれません。

Inst-IT は、AI に「個々の存在」への愛情と理解を植え付けた、画期的な研究なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →