← 最新の論文
💻 computer science

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSegは、マスクを次トークン予測のための視覚的トークンとしてエンコードすることで複数の画像セグメンテーションタスクを統合する視覚的自己回帰フレームワークであり、優れたマスク精度とオープンボキャブラリーなローカライゼーションを実現するために、新しい2M規模のSA-OVRSデータセットと新しいハウスドルフに基づく指標によってサポートされています。

原著者: Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの言葉を完璧に理解し、単に絵を描くだけでなく、言葉の意味まで汲み取ってくれる魔法のスケッチブックがあるとします。「左側のバスを描いて」と伝えると、それは単に推測するのではなく、ピクセル単位でその特定のバスの正確な輪郭を描き出します。これが、コンピュータが画像を、まるで物語を一つ一つの単語を綴るように理解する方法である、新しい手法「LlamaSeg」の核心となるアイデアです。

旧来の手法 vs 新しい手法

長い間、写真の中の物体を見つけようとするコンピュータは、「リレー形式」のアプローチをとってきました。まず、一つのAIがその物体が何であるかを推測し(例えば「バス」と言う)、次にその推測を、輪郭を描くための別の特化したAIへと渡すのです。これは、友人に車の説明をしてもらい、その説明を別の友人に渡して描いてもらうようなものです。機能はしますが、手間がかかり、二人の異なる専門家を必要とします。

また、座標のリストを使って輪郭を描こうとする手法もありました。「地点1から出発し、地点2へ行き、次に地点3へ行く」といった具合です。しかし、これは複雑な形を描くために、何百もの小さなステップをリストアップするようなもので、非常に煩雑で時間がかかります。

LlamaSegは、このリレー形式や座標リストを捨て去りました。代わりに、マスク(輪郭)を一つの「視覚的な物語」として扱います。画像を「トークン」と呼ばれる小さなパズルのピースに分解します。言語モデルが文章の次の単語を予測するように、LlamaSegは次の「視覚的トークン」を予測してマスクを構築していきます。それは、コンピュータがテキストのプロンプトから直接、一つ一つの小さなブロックを積み上げるように、バスの輪郭を書き上げているようなものです。

秘密の材料:巨大な新しいライブラリ

コンピュータにこのようなことを教えるには、膨大な例のライブラリが必要です。著者たちは、既存のライブラリは規模が小さすぎるか、多様性が足りないことに気づきました。そこで、彼らは「SA-OVRS」と呼ばれる新しいライブラリを構築しました。

SA-OVRSを、200万個の異なる物体が含まれた、巨大で超整理されたフォトアルバムだと考えてください。しかし、ここからが面白いところです。それぞれの物体は、単に「椅子」や「犬」とラベル付けされているだけではありません。ある椅子は「脚が折れた赤い椅子」とラベル付けされ、別の椅子は「左側にある椅子」とラベル付けされています。このデータセットには、日常的なアイテムから複雑なシーンまでを網羅する、5,800種類以上の異なるラベルと記述が含まれています。彼らは二段階のプロセスでこれを構築しました。まず、画像をラベルにマッチングさせ、次に、コンピュータが似たようなものを区別できるように、AIを使用して各物体に対してユニークで記述的な文章を作成しました。

どれほど優れた成果を出しているのか?

著者たちは、LlamaSegが実際に旧来の手法よりも優れた描画ができるかどうかを確認するため、いくつかの標準的な課題でテストを行いました。

  • スコアボード: ADE20KやCOCO-Stuffといった一般的な画像データセットを用いたテストにおいて、LlamaSegは従来の「視覚生成型(visual generative)」モデルよりも高いスコアを記録しました。例えば、より大型のモデルであるLlamaSeg-Lは、ADE20Kで52.0、COCO-Stuffで55.7というスコアを達成しました。これは、より大規模な他の生成モデルと比較しても、大幅な飛躍です。
  • 「エッジ」テスト: 物体の内側を描くのは簡単ですが、その「エッジ(端)」を完璧に描くのは困難です。著者たちは、これを測定するための新しい定規として「dAHD(平均ハウスドルフ距離)」を考案しました。スコアが低いほど、エッジが実物に近接していることを意味します。LlamaSegはこのテストにおいて極めて低いスコア(例:ADE20Kで25.54)を記録しており、その輪郭は他の生成モデルよりもはるかにシャープで正確であることを示しています。
  • スピード: LlamaSegは(文章を書くように)一つずつトークンを書き出すため、一部の並列処理を行う旧来の手法よりも低速です。しかし、同じことを行う他の生成モデルと比較すると、依然として高速です。例えば、LlamaSegは0.250 FPS(フレーム毎秒)で動作しますが、これは競合モデルであるUnified-IO2-Largeの0.017 FPSと比較して、大幅な改善となっています。

著者たちが「主張していない」こと

この論文が何を述べていないかを知っておくことも重要です。著者たちは、言語モデルが物体を推測した後に、マスクを描くための別の「専門家」モデルが必要であるという考えに対し、明確に反論しています。彼らは、単一の統合されたシステムがその全工程を行うことができることを示しています。

また、彼らのモデルはエッジを描くことには長けていますが、特定の参照セグメンテーション(referring segmentation)タスクにおいては、依然として「識別型(discriminative)」のモデル(旧来の専門家モデル)に後れを取ることもあると示唆しています。彼らはすべてを解決したと主張しているわけではありません。ただ、この「物語のように書く」アプローチが、最高の結果に非常に近い、強力で統一された方法であることを示しているのです。

結論

LlamaSegは、画像セグメンテーションを言語の問題として扱うこと――つまり、コンピュータがトークンごとにマスクを「書く」こと――によって、異なるAIの専門家チームを必要とせずに、驚くほど精密な結果を得られることを示唆しています。彼らの新しい200万サンプルのデータセットで学習することで、この手法が従来の生成的アプローチよりも微細で正確なマスクを作成できることを証明しました。これは、時には、絵を描く最善の方法は、それを「書く」ことであるということを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →