← Derniers articles
💻 computer science

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

Ce papier présente COCOTree, un jeu de données et une référence à grande échelle pour la décomposition visuelle arborescente ouverte, qui exploite un pipeline automatisé combinant un LVLM et SAM 3 pour générer 1,8 million de nœuds hiérarchiques à travers 21 000 images, accompagné d'une nouvelle métrique d'évaluation (OTQ) pour évaluer la précision des masques, l'exactitude des étiquettes et la cohérence structurelle.

Auteurs originaux : Junhyub Lee, Seunghun Chae, Hyosu Kim

Publié 2026-05-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Junhyub Lee, Seunghun Chae, Hyosu Kim

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardiez une photographie d'une cuisine animée.

L'Ancienne Méthode :
Les outils traditionnels de vision par ordinateur examinent cette photo et disent : « Je vois une personne, une table et une chaise. » Ils peuvent même décomposer un peu la personne : « Tête, torse, bras. » Mais ils s'arrêtent là. Ils traitent l'image comme une liste plate d'objets. Si vous demandez à l'ordinateur : « De quoi sert cette poignée attachée au meuble ? », il pourrait simplement voir une « poignée » flottant dans l'espace. Il ne sait pas que la poignée appartient au meuble, qui appartient à la cuisine, ni que la poignée est constituée d'un bouton spécifique et d'une vis. Il manque l'« arbre généalogique » des objets.

La Nouvelle Méthode (COCOTREE) :
Ce papier présente COCOTREE, une nouvelle façon d'enseigner aux ordinateurs de voir le monde non pas comme une liste plate, mais comme un géant arbre généalogique ramifié.

Pensez-y comme à une poupée russe ou à un arbre avec des racines et des branches :

  1. La Racine : L'image entière est le tronc.
  2. Les Branches : Le tronc se divise en grands objets (une personne, un meuble).
  3. Les Branchettes : Ces objets se divisent en parties (le meuble se divise en une porte, une étagère et une poignée).
  4. Les Feuilles : Les parties se divisent encore plus loin (la poignée se divise en un bouton et une vis).

L'objectif est de cartographier chaque pièce visible d'un objet, jusqu'au plus petit détail, et de les relier tous dans une hiérarchie logique.

Comment l'ont-ils construit ? (Le Chef Robot)

Élaborer une telle carte pour des milliers de photos à la main serait impossible. Il faudrait des années aux humains pour étiqueter chaque vis et chaque charnière.

Au lieu de cela, les auteurs ont construit un « Chef Robot » entièrement automatisé qui effectue le travail pour eux. Ce robot utilise deux puissants outils d'IA travaillant ensemble :

  1. Le Cerveau (LVLM) : Un grand modèle vision-langage agit comme un chef curieux. Il regarde l'image et dit : « Je vois un meuble. Qu'y a-t-il à l'intérieur ? Ah, une étagère et une poignée ! » Il utilise son « bon sens » pour deviner quelles parties existent.
  2. Les Mains (SAM 3) : Un modèle de segmentation précis agit comme une paire de mains stables. Une fois que le Cerveau devine « poignée », les Mains dessinent un contour parfait autour de cette poignée spécifique sur la photo.

Le Processus :
Le robot commence avec l'image entière. Il demande au Cerveau de trouver les parties principales. Les Mains dessinent des lignes autour d'elles. Ensuite, le robot prend juste la partie « meuble », zoome, et demande à nouveau au Cerveau : « Maintenant que je ne regarde que le meuble, que vois-je ? » Le Cerveau répond : « Une porte et une poignée. » Les Mains les dessinent. Cela se répète encore et encore, de manière récursive, jusqu'à ce que le robot ne trouve plus de pièces plus petites.

Le Résultat : Une Immense Bibliothèque d'Arbres

Le résultat est COCOTREE, un ensemble de données contenant plus de 21 000 images et 1,8 million de nœuds structurels (pièces d'objets).

  • Sans Contraintes : Contrairement aux anciens ensembles de données qui ne connaissent que 80 ou 100 mots spécifiques (comme « chien » ou « voiture »), cet ensemble de données utilise un « vocabulaire ouvert ». Il peut étiqueter un objet étrange et unique avec une longue description spécifique s'il le voit.
  • Profond : Il va beaucoup plus loin que les méthodes précédentes. Alors que les anciens ensembles de données s'arrêtaient peut-être à « porte », celui-ci va « porte -> poignée -> bouton -> vis ».
  • Vérifié : Les auteurs n'ont pas simplement fait confiance au robot. Ils ont fait vérifier le travail par 20 examinateurs humains. Les humains ont convenu que les « arbres généalogiques » du robot étaient précis et correspondaient à la façon dont les humains voient le monde.

Comment Noter le Robot ? (Le Score OTQ)

Comment noter un test où les réponses sont des arbres complexes ? On ne peut pas simplement vérifier si le robot a correctement identifié la « voiture ». Il faut vérifier :

  1. A-t-il dessiné le contour de la roue correctement ? (Précision du masque)
  2. L'a-t-il appelée « roue » et non « pneu » ? (Précision de l'étiquette)
  3. A-t-il correctement placé la roue sous la voiture, et le pneu sous la roue ? (Cohérence structurelle)

Pour ce faire, ils ont créé un nouveau système de notation appelé OTQ (Qualité de l'Arbre Ouvert). C'est comme un bulletin scolaire qui donne une note unique basée sur la façon dont le robot a dessiné l'image, nommé les parties et organisé l'arbre généalogique.

Résumé

En bref, COCOTREE est une immense bibliothèque générée automatiquement qui enseigne aux ordinateurs à voir le monde en couches. Elle va au-delà du simple « qu'y a-t-il sur la photo » pour explorer « comment les choses sur la photo sont construites et connectées », en utilisant une équipe de robots IA pour construire la carte et des examinateurs humains pour s'assurer que la carte est précise.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →