← Derniers articles
💻 computer science

Every9D-21M: Large-Scale Real-World 9D Canonicalization of Everyday Objects

Ce papier présente Every9D-21M, un jeu de données massif de 21,8 millions d'images du monde réel avec des annotations de pose 9D couvrant 700 catégories d'objets, construit en exploitant des vidéos centrées sur les objets et un alignement inter-exemplaires pour surmonter la rareté des supervisions à grande échelle du monde réel pour la canonicalisation 9D.

Auteurs originaux : Leonhard Sommer, Emil Akopyan, Adam Kortylewski

Publié 2026-05-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Leonhard Sommer, Emil Akopyan, Adam Kortylewski

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'enseigner à un robot à comprendre le monde. Pour ce faire, le robot doit savoir non seulement ce qu'est un objet (comme une chaise ou une tasse), mais aussi exactement comment il est posé, quelle est sa taille et dans quelle direction il est orienté. Dans le domaine de la vision par ordinateur, cela s'appelle l'estimation de la pose 9D (position 3D + rotation 3D + taille 3D).

Le problème est qu'enseigner cela à un robot est incroyablement difficile car nous ne disposons pas de suffisamment de « manuels » (jeux de données) contenant des exemples du monde réel. La plupart des manuels existants sont soit :

  1. Fictifs : Créés par ordinateur (synthétiques), ce qui confond le robot lorsqu'il voit de vraies photos désordonnées.
  2. Trop petits : Ils ne contiennent que quelques milliers d'images d'une poignée d'objets (comme seulement 9 types de jouets).

Voici « Every9D-21M » : un nouveau manuel massif

Cet article présente un nouveau jeu de données gigantesque appelé Every9D-21M. Imaginez-le comme une bibliothèque contenant 21,8 millions de photos de 700 objets du quotidien différents (des chaises et des tasses aux animaux et aux outils). Il est 100 fois plus grand que n'importe quel jeu de données réel de ce type précédemment existant.

Comment l'ont-ils construit ? (La magie du « copier-coller »)

Vous vous demandez peut-être : « Comment ont-ils pu étiqueter 21,8 millions de photos ? Cela prendrait une vie humaine ! »

Ils n'ont pas étiqueté chaque photo individuellement. Au lieu de cela, ils ont utilisé une stratégie astucieuse « basée sur la référence », comme un modèle maître et un tampon :

  1. Les indices vidéo : Ils ont commencé par 109 000 courtes vidéos prises par des gens ordinaires, où ils se déplaçaient autour d'un objet (comme une caméra faisant le tour d'un vase).
  2. La reconstruction 3D : En utilisant la vision par ordinateur, ils ont transformé ces vidéos en nuages de points 3D (nuages numériques de points formant la forme de l'objet).
  3. Le « Médoïde » (le meilleur représentant) : Ils ont regroupé des objets similaires (par exemple, toutes les « chaises »). Au lieu de choisir une chaise au hasard pour être le « chef », ils ont sélectionné celle qui ressemblait le plus à la moyenne du groupe.
  4. La touche humaine (la petite partie) : Les humains n'ont dû étiqueter manuellement que l'objet « chef » pour chaque groupe. Cela a pris environ 1 000 annotations au total (moins de 0,01 % des données au total).
  5. Le tampon (propagation) : Une fois que la chaise « chef » a été étiquetée avec son orientation correcte (par exemple, « le dossier de la chaise fait face dans cette direction »), l'ordinateur a utilisé la géométrie et la correspondance visuelle pour « tamponner » cette même orientation sur chaque autre chaise du groupe.
  6. Le contrôle qualité : Les humains ont ensuite rapidement vérifié les résultats tamponnés pour s'assurer que l'ordinateur n'avait pas fait d'erreur.

Le résultat : Ils ont créé un jeu de données massif et de haute qualité en utilisant seulement 199 heures de travail humain. S'ils avaient étiqueté chaque photo manuellement, cela aurait pris des milliers d'années.

Pourquoi cela importe-t-il ?

L'article affirme que l'entraînement de modèles d'IA sur ce nouveau jeu de données les rend beaucoup plus intelligents que les modèles entraînés sur d'anciens jeux de données plus petits.

  • Meilleure généralisation : Lorsqu'ils ont entraîné un modèle sur Every9D-21M et l'ont testé sur d'autres jeux de données célèbres (comme ImageNet3D ou HANDAL), il a nettement mieux performé. C'est comme un étudiant qui a étudié une vaste et diverse bibliothèque d'exemples du monde réel et qui est capable de résoudre des problèmes dans une salle de classe complètement nouvelle.
  • Conscience de la symétrie : Les chercheurs ont également créé des règles pour gérer la « symétrie ». Par exemple, une bouteille a la même apparence si on la fait tourner autour de son centre. Le jeu de données enseigne à l'IA à comprendre ces règles, afin qu'elle ne soit pas confuse par des objets qui semblent identiques sous différents angles.

L'essentiel

Les auteurs ont construit un « super-jeu de données » en transformant des milliers de vidéos centrées sur des objets en formes 3D, en étiquetant manuellement une infime fraction d'entre elles, puis en utilisant des algorithmes informatiques intelligents pour copier ces étiquettes sur des millions d'autres images. Cela offre à l'IA une base bien meilleure de « vision du monde », lui permettant de comprendre la forme 3D et l'orientation des objets du quotidien beaucoup plus précisément qu'auparavant.

Ce que l'article ne prétend pas :

  • Il ne prétend pas que cela résout immédiatement tous les problèmes de robotique.
  • Il ne prétend pas que les données de profondeur (distance) sont des données de capteur parfaites (il utilise une profondeur estimée par l'IA).
  • Il ne prétend pas que le système fonctionne sur des objets en mouvement et dynamiques (comme un chien qui court) de la même manière qu'il fonctionne sur des objets statiques ; les vidéos utilisées étaient principalement d'objets statiques filmés sous différents angles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →