← Derniers articles
💻 computer science

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSeg est un cadre auto-régressif visuel qui unifie plusieurs tâches de segmentation d'images en encodant les masques sous forme de jetons visuels pour la prédiction du jeton suivant, soutenu par un nouveau jeu de données SA-OVRS de l'échelle 2M et une nouvelle métrique basée sur Hausdorff pour atteindre une précision de masque et une localisation en vocabulaire ouvert supérieures.

Auteurs originaux : Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

Publié 2026-07-10
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez un carnet de croquis magique qui ne se contente pas de dessiner des images, mais qui comprend parfaitement vos mots. Si vous lui dites : « Dessine le bus de gauche », il ne se contente pas de deviner ; il dessine le contour exact de ce bus spécifique, pixel par pixel. C'est l'idée centrale de LlamaSeg, une nouvelle façon pour les ordinateurs de comprendre les images en les traitant comme une histoire qu'ils écrivent un mot à la fois.

L'ancienne méthode vs La nouvelle méthode

Pendant longtemps, les ordinateurs essayant de trouver des objets dans des photos utilisaient une approche de type « course de relais ». D'abord, une IA devinait ce qu'était l'objet (comme dire « bus »), puis transmettait cette supposition à une seconde IA spécialisée pour dessiner le contour. C'est comme demander à un ami de décrire une voiture, puis de donner cette description à un autre ami pour qu'il la dessine. Cela fonctionne, mais c'est lourd et cela nécessite deux experts différents.

D'autres méthodes tentaient de dessiner le contour en listant des coordonnées, comme dire : « commence au point 1, va au point 2, puis au point 3 ». Mais cela revient à essayer de dessiner une forme complexe en listant des centaines de petites étapes ; cela devient désordonné et lent.

LlamaSeg abandonne la course de relais et les listes de coordonnées. Au lieu de cela, il traite le masque (le contour) comme une histoire visuelle. Il décompose l'image en de minuscules pièces de puzzle appelées « tokens ». Tout comme un modèle de langage prédit le mot suivant dans une phrase, LlamaSeg prédit le prochain « token visuel » pour construire le masque. C'est comme si l'ordinateur écrivait le contour du bus, un petit bloc à la fois, directement à partir de votre consigne textuelle.

L'ingrédient secret : Une nouvelle bibliothèque massive

Pour apprendre à un ordinateur à faire cela, vous avez besoin d'une bibliothèque massive d'exemples. Les auteurs ont réalisé que les bibliothèques existantes étaient trop petites ou manquaient de variété. Ils ont donc construit une nouvelle bibliothèque appelée SA-OVRS.

Considérez SA-OVRS comme un immense album photo super organisé contenant 2 millions d'objets différents. Mais voici la partie intéressante : chaque objet n'est pas seulement étiqueté « chaise » ou « chien ». Il possède une description riche à vocabulaire ouvert. Une chaise pourrait être étiquetée « la chaise rouge avec la patte cassée », tandis qu'une autre sera « la chaise sur la gauche ». Le jeu de données comprend plus de 5 800 types différents d'étiquettes et de descriptions, couvrant tout, des objets du quotidien aux scènes complexes. Ils ont construit cela grâce à un processus en deux étapes : d'abord, ils ont fait correspondre les images aux étiquettes, puis ils ont utilisé l'IA pour écrire des phrases uniques et descriptives pour chaque objet afin de s'assurer que l'ordinateur apprenne à distinguer des choses similaires.

À quel point cela fonctionne-t-il ?

Les auteurs ont testé LlamaSeg sur plusieurs défis standards pour voir s'il pouvait réellement mieux dessiner que les anciennes méthodes.

  • Le tableau des scores : Dans des tests sur des jeux de données d'images courants comme ADE20K et COCO-Stuff, LlamaSeg a obtenu des scores plus élevés que les modèles « génératifs visuels » précédents. Par exemple, leur modèle plus grand (LlamaSeg-L) a obtenu un score de 52,0 sur ADE20K et 55,7 sur COCO-Stuff. Il s'agit d'un bond significatif par rapport aux autres modèles génératifs, même ceux qui sont beaucoup plus gros.
  • Le test de l'« arête » : Dessiner l'intérieur d'un objet est facile ; dessiner l'arête (edge) parfaitement est difficile. Les auteurs ont inventé une nouvelle règle pour mesurer cela appelée dAHD (distance de Hausdorff moyenne). Un score plus bas signifie que l'arête est plus proche de la réalité. LlamaSeg a obtenu un score incroyablement bas sur ce test (par exemple, 25,54 sur ADE20K), ce qui signifie que ses contours sont beaucoup plus nets et précis que ceux des autres modèles génératifs.
  • La vitesse : Comme LlamaSeg écrit le masque un token à la fois (comme l'écriture d'une phrase), il est plus lent que certaines anciennes méthodes parallèles. Cependant, il est toujours beaucoup plus rapide que les autres modèles génératifs qui tentent de faire la même chose. Par exemple, il fonctionne à 0,250 FPS (images par seconde), ce qui est une amélioration énorme par rapport aux 0,017 FPS d'un modèle concurrent appelé Unified-IO2-Large.

Ce que les auteurs ne prétendent PAS

Il est important de savoir ce que ce papier ne dit pas. Les auteurs soutiennent explicitement l'idée selon laquelle vous auriez besoin d'un modèle « expert » distinct pour dessiner le masque après que le modèle de langage a deviné l'objet. Ils démontrent qu'un système unique et unifié peut accomplir l'ensemble du travail.

Ils suggèrent également que, bien que leur modèle soit excellent pour dessiner les contours, il reste en retrait par rapport aux modèles « discriminatifs » spécialisés (les experts de la vieille école) dans certaines tâches spécifiques de segmentation de référence. Ils ne prétendent pas avoir tout résolu ; ils montrent simplement que cette nouvelle approche de type « écrire comme une histoire » est une façon puissante et unifiée d'obtenir des résultats très proches des meilleurs.

L'essentiel à retenir

LlamaSeg suggère que si vous traitez la segmentation d'image comme un problème de langage — où l'ordinateur « écrit » le masque token par token — vous pouvez obtenir des résultats incroyablement précis sans avoir besoin d'une équipe de différents experts en IA. En s'entraînant sur leur nouveau jeu de données de 2 millions d'échantillons, ils ont montré que cette méthode peut produire des masques plus fins et plus précis que les approches génératives précédentes, prouvant que parfois, la meilleure façon de dessiner un tableau est de l'écrire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →