← Derniers articles
🤖 machine learning

More with LESS -- Local Scene Representations for Tactile Imaging

Cet article introduit LESS (Local Encoder for Spatial Sensing), une représentation tactile centrée sur l'objet qui utilise une grille d'encodeurs récurrents dotés de champs récepteurs locaux pour parvenir à une généralisation robuste, une estimation de l'incertitude spatiale et une reconstruction 3D complète des structures internes d'objets mous via la palpation, tant contrôlée par un robot qu'une palpation manuelle de type humain.

Auteurs originaux : Zohar Rimon, Elisei Shafer, Tal Tepper, Daniel Kozin, Alon Malka, Roy Holland, Aviv Tamar

Publié 2026-06-15
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zohar Rimon, Elisei Shafer, Tal Tepper, Daniel Kozin, Alon Malka, Roy Holland, Aviv Tamar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de deviner ce qui se trouve à l'intérieur d'un ballon d'eau scellé et mou sans le faire éclater. Vous ne pouvez pas voir l'intérieur, mais vous pouvez le toucher avec vos doigts. Si vous appuyez sur un côté et sentez une bosse dure, vous savez qu'il y a quelque chose de solide à l'intérieur. Si vous appuyez ailleurs et que cela semble mou, cette zone n'est que de l'eau.

C'est le défi de l'imagerie tactile : utiliser le toucher pour « voir » l'intérieur d'objets mous, comme des tumeurs dans un sein ou des défauts à l'intérieur d'un robot souple.

Voici une décomposition simple de la manière dont les chercheurs du Technion (Institut de technologie d'Israël) ont résolu ce problème.

L'ancienne méthode : Le problème du « Un seul gros cerveau »

Les tentatives précédentes pour faire cela utilisaient un bras robotisé pour piquer l'objet et un ordinateur pour deviner la forme. Cependant, l'ordinateur utilisait une approche « globale ». Imaginez que cela revienne à essayer de décrire une ville entière en utilisant une seule phrase géante. Si vous voulez décrire une ville avec deux parcs, l'ordinateur doit apprendre chaque combinaison possible de « deux parcs » en partant de zéro. Si vous lui présentez une ville avec trois parcs, ou une ville qui est deux fois plus grande, l'ordinateur est confus car il n'a jamais vu cette combinaison exacte auparavant. Il est rigide et peine à généraliser.

La nouvelle méthode : LESS (Local Encoder for Spatial Sensing)

Les chercheurs ont proposé une nouvelle méthode appelée LESS. Au lieu d'un seul cerveau géant essayant de mémoriser l'objet entier à la fois, ils ont donné à l'ordinateur une équipe de petits détectives locaux.

  • L'analogie : Imaginez la carte d'une grande ville. Au lieu d'une seule personne essayant de mémoriser toute la carte, vous placez une petite équipe de détectives à chaque coin de rue.
  • Comment ça marche : Chaque détective ne regarde que ce qui se passe dans son voisinage immédiat (son « champ récepteur »). Il ne se soucie pas de ce qui se passe trois rues plus loin.
  • La magie : Si vous avez une ville avec un parc, le détective situé près du parc apprend à quoi ressemble un parc. Si, plus tard, vous présentez une ville avec trois parcs, ils ne paniquent pas. Ils disent simplement : « Hé, je vois un parc ici, et mon voisin voit un parc là-bas. » Parce qu'ils travaillent de manière indépendante, ils peuvent combiner leurs découvertes pour décrire des formes complexes qu'ils n'ont jamais vues auparavant. C'est ce qu'on appelle la généralisation compositionnelle.

Ce qu'ils ont réellement construit et testé

Le document détaille plusieurs réalisations spécifiques :

  1. Un nouvel ensemble de données massif : Ils ont construit une installation robotique qui pique automatiquement des centaines de « fantômes » (modèles factices de parties du corps) en silicone, tout en effectuant des examens IRM pour connaître la « vraie » réponse. C'est le plus grand ensemble de données de ce type.
  2. De la 2D à la 3D : Les méthodes précédentes ne pouvaient deviner qu'une tranche plate en 2D de l'intérieur. LESS peut reconstruire le volume 3D complet, offrant une image beaucoup plus claire de la forme et de la taille de l'objet.
  3. La percée de l'« appareil portatif » : Les anciennes méthodes robotisées nécessitaient que le capteur soit tenu par un bras robotique précis. Les chercheurs ont trouvé comment faire fonctionner cela avec un appareil tenu à la main (comme un médecin tenant une sonde).
    • Ils ont ajouté un traceur spécial pour suivre le mouvement de la main.
    • Ils ont entraîné l'IA sur des données qui imitent les mouvements de la main humaine (qui sont instables et variés) plutôt que sur des mouvements de robots parfaits.
  4. Cartes d'incertitude : Le système ne se contente pas de deviner ; il vous dit à quel point il est confiant. Si un détective n'a pas été assez sollicité par des pressions dans une zone spécifique, le système met cet endroit en évidence comme étant « incertain », indiquant à l'opérateur : « Appuyez ici à nouveau pour être sûr. »

Les résultats

  • Une meilleure précision : Lors de tests sur des objets avec plusieurs bosses (inclusions) ou de plus grande taille que l'IA n'avait jamais vus pendant l'entraînement, LESS a fonctionné nettement mieux que l'ancienne méthode « globale ». L'ancienne méthode échouait souvent complètement sur ces nouvelles formes, tandis que LESS les identifiait avec succès.
  • Imagerie en temps réel : Ils ont démontré un prototype fonctionnel où un utilisateur tient le capteur, le déplace sur un objet et voit la structure interne apparaître sur un écran en temps réel, avec une « carte de confiance » montrant les zones nécessitant davantage de pressions.

Ce qu'ils n'ont PAS affirmé

Il est important de s'en tenir à ce que dit l'article :

  • Ils ont testé cela sur des modèles de silicone synthétiques (fantômes), et non sur de vrais patients humains.
  • Bien qu'ils mentionnent les applications médicales comme un objectif, ils n'ont pas testé cela sur des humains et n'ont pas affirmé que c'est prêt pour un diagnostic clinique.
  • Ils n'ont pas affirmé que cela fonctionne sur n'importe quel objet au monde, mais spécifiquement sur des objets mous et déformables avec des structures internes similaires à leurs données d'entraînement.

En résumé, les chercheurs ont construit une façon plus intelligente et plus flexible pour les ordinateurs de « sentir » l'intérieur d'objets mous, passant de bras robotiques rigides à un système portatif et flexible capable de gérer des formes complexes qu'il n'a jamais vues auparavant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →