← Derniers articles
💻 computer science

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp est un cadre efficace en termes de données qui découple le raisonnement sémantique de haut niveau de l'exécution géométrique de bas niveau en utilisant un modèle vision-langage pour prédire un point de semence pour un générateur de saisie léger, permettant ainsi une saisie robuste et multi-incarnation dans des scènes complexes sans nécessiter d'entraînement de bout en bout coûteux.

Auteurs originaux : Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

Publié 2026-07-23
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un robot essayant de ramasser un jouet sur le sol d'une chambre en désordre. Pour un humain, c'est facile : vous voyez le jouet, vous savez où se trouve sa poignée, et vous le saisissez. Mais pour un robot, le monde est un mélange confus de formes et d'ombres. Il doit comprendre deux choses très différentes à la fois : la « vue d'ensemble » (Quel est mon objectif ? « Ramasse la tasse rouge par sa anse ») et les « détails infimes » (Où exactement mes doigts doivent-ils toucher pour ne pas renverser la lampe ?). C'est le défi de la préhension robotique. Pendant longtemps, les robots étaient soit très intelligents mais maladroits (ils savaient quoi faire mais ne comprenaient pas la physique du contact avec les objets), soit très doués en physique mais stupides (ils pouvaient saisir n'importe quoi, mais seulement si on leur disait exactement où, sans comprendre le langage). Les scientifiques ont essayé de construire un robot capable d'écouter une phrase simple comme « Prends le panier par sa anse » et de déterminer ensuite la manière parfaite de le ramasser, même dans une pièce en désordre, en utilisant différents types de mains robotiques.

Entrez en scène SeededGrasp, une nouvelle méthode qui agit comme une équipe ingénieuse de deux membres : un « cerveau » et une « main ». Au lieu d'essayer d'enseigner à un seul cerveau robotique géant et super complexe de tout faire à la fois (ce qui revient à essayer d'apprendre à un chien à faire du calcul intégral tout en apprenant à rapporter une balle), les chercheurs ont divisé le travail. D'abord, ils utilisent un Modèle Vision-Langage (VLM) puissant — imaginez cela comme une IA super intelligente capable de lire et de voir — pour observer la scène en désordre et l'instruction. Cette IA ne cherche pas à calculer la position exacte des doigts ; elle se contente de pointer un unique « point de semence » (seed point), tel une punaise numérique, sur l'objet là où la saisie devrait commencer. C'est comme un humain qui dirait : « Attrape-le juste là », en pointant du doigt.

Une fois ce « point de semence » planté, un second modèle plus léger prend le relais. Ce modèle est comme un mécanicien hautement qualifié qui sait exactement comment bouger les doigts du robot en fonction de ce point unique. Comme le gros du travail de compréhension du langage est effectué par la première IA, et que le gros du travail de géométrie est effectué par la seconde, ils peuvent travailler ensemble de manière très efficace. Les chercheurs ont testé cela sur trois types différents de mains robotiques (une pince à deux doigts standard, une pince à trois doigts et une main très agile dotée de nombreux articulations) dans une pièce en désordre simulée. Ils ont constaté que cette approche par « point de semence » fonctionnait incroyablement bien, atteignant un taux de réussite de 72 % dans la simulation. Plus impressionnant encore, lorsqu'ils l'ont testé sur un vrai robot dans le monde réel, le système a réussi 78 % du temps.

L'article argumente également contre quelques idées reçues. Il suggère que tenter d'entraîner un seul modèle massif pour tout faire à partir de zéro est trop coûteux et nécessite trop de données. Il montre également que le simple fait d'utiliser un VLM pour deviner directement toute la pose de saisie conduit souvent à des erreurs car l'IA est confuse par la géométrie 3D. Au lieu de cela, le « point de semence » sert de pont parfait, permettant à l'IA intelligente de gérer le langage et au modèle spécialisé de gérer la physique. Pour prouver cela, l'équipe ne s'est pas contentée de s'appuyer sur des données existantes ; elle a créé un tout nouveau et immense jeu de données de 2,56 millions de saisies à travers 610 scènes en désordre pour entraîner son système. Bien que les résultats soient très prometteurs, les auteurs notent que cela a été testé en simulation et lors d'essais en conditions réelles avec des configurations spécifiques, et qu'il reste encore du travail pour s'assurer que le bras du robot puisse atteindre chaque endroit où le « point de semence » est indiqué sans heurter d'obstacles. Mais pour l'instant, SeededGrasp montre une façon amusante et efficace d'apprendre aux robots à écouter, regarder et saisir avec l'aide d'un simple doigt qui pointe.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →