Zero-shot 2D Grounding with Novel Affordance Types
Cet article introduit la tâche de localisation 2D zero-shot pour de nouveaux types d'affordances, proposant la méthode sans entraînement AffordAnything et sa variante entraînable AffordAnything+ qui exploitent des indices de segmentation pour obtenir des améliorations de performance significatives sur le nouveau benchmark NAT.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseigniez à un robot comment interagir avec le monde. Vous pouvez dire au robot à quoi ressemble un « couteau », et il peut en trouver un sur une image. Mais savoir ce qu'est un couteau n'est pas la même chose que savoir ce que l'on peut en faire. C'est la différence entre la reconnaissance d'objets et l'« affordance ». L'affordance est un mot sophistiqué pour désigner les indices cachés qu'un objet nous donne sur la manière de l'utiliser. L'anse d'une tasse « offre » la possibilité de la saisir ; le côté plat d'un couteau « offre » la possibilité de couper ; la peau d'une orange « offre » la possibilité d'éplucher. Pour que les robots soient véritablement utiles dans nos cuisines et nos salons désordonnés, ils doivent comprendre ces actions, et pas seulement les objets.
Le grand défi a été que la plupart des cerveaux de robots sont entraînés comme des étudiants qui étudient uniquement pour un examen spécifique. Si un robot apprend à « couper » une pomme, il pourrait être confus lorsqu'on lui demande de « couper » une tomate, ou il pourrait ne pas savoir comment « éplucher » une banane s'il n'a jamais vu cette action spécifique auparavant. C'est comme un étudiant qui mémorise les réponses d'une feuille d'exercices de mathématiques mais qui se fige lorsque le professeur pose une question similaire avec des chiffres différents. Les scientifiques ont essayé de construire des robots capables de gérer ces nouvelles instructions, mais jusqu'à présent, l'accent a surtout été mis sur l'enseignement de nouveaux objets, et non de nouvelles actions.
Cet article présente une nouvelle façon d'enseigner aux robots comment gérer les « types d'affordances novatrices » — en gros, de nouvelles façons d'utiliser des choses qu'ils n'ont jamais explicitement apprises. Les chercheurs, Haomeng Zhang et Raymond A. Yeh de l'Université Purdue, ont remarqué que les modèles d'IA existants sont excellents pour trouver de nouveaux objets mais très mauvais pour comprendre de nouvelles actions. Ils ont créé un nouvel ensemble de défis (appelés benchmarks) pour tester cette compétence spécifique. Ils ont constaté que les modèles actuels de pointe, qui sont très intelligents pour reconnaître les objets, échouent complètement lorsqu'on leur demande de trouver le bon endroit pour « éplucher » ou « s'asseoir sur » quelque chose si ces actions spécifiques ne figuraient pas dans leurs données d'entraînement.
Pour corriger cela, l'équipe a construit un nouveau système appelé AffordAnything. Considérez cela comme un détective qui ne se contente pas de regarder l'image entière, mais qui zoome sur de minuscules indices. Le système réalise que l'endroit où vous interagissez avec un objet est généralement une partie spécifique de celui-ci (comme l'anse d'une tasse ou le bord d'un livre). Au lieu d'essayer de mémoriser chaque action possible, ce système utilise une IA pré-entraînée puissante (un Modèle de Langage Visuel) pour décomposer l'objet en petits fragments et déterminer quel fragment correspond au mot de l'action. Par exemple, si vous dites « couper », il cherche le bord tranchant ; si vous dites « tenir », il cherche l'anse.
Les chercheurs ont testé deux versions. La première, AffordAnything, est une version « sans entraînement », ce qui signifie qu'elle fonctionne immédiatement sans avoir besoin d'être réenseignée. Elle a déjà obtenu des performances nettement supérieures aux méthodes existantes. La seconde version, AffordAnything+, est une mise à niveau « entraînable » qui apprend à mieux mélanger ces indices avec un tout petit peu de pratique. Sur leurs nouveaux ensembles de tests, ce modèle amélioré a augmenté la précision de la localisation du bon endroit de 12,3 % (mesurée comme une augmentation absolue de l'IoU@0.4) par rapport à la meilleure méthode précédente.
L'article soutient explicitement l'idée que le simple fait d'utiliser des modèles d'IA plus grands et plus intelligents ou de simplement reconnaître des objets ne suffit pas. Ils ont montré que même les modèles les plus avancés échouent lorsque l'action est nouvelle. Ils ont également démontré que bien que ces modèles puissent reconnaître un « couteau », ils ne savent pas automatiquement comment l'utiliser pour « éplucher », à moins d'être spécifiquement conçus pour chercher la relation entre l'action et la forme de l'objet. Les résultats suggèrent que pour rendre les robots vraiment adaptables, nous devons cesser de leur enseigner une liste fixe d'actions et commencer à leur enseigner comment raisonner sur les parties d'un objet qui rendent une action possible. Les auteurs espèrent que cette nouvelle façon de tester et de construire ces systèmes aidera les robots à devenir plus flexibles et prêts pour le monde réel, où les instructions sont toujours changeantes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.