← Últimos artículos
💻 computer science

Towards Fine-Grained Object Manipulation: SAM3-Guided Visuomotor Policy with Persistent Memory Learning and Focused Visual Conditioning

Este artículo presenta un marco de trabajo visuomotor guiado por SAM3 que cuenta con FOM-SAM3 para la memoria persistente de objetos y FSAE para el condicionamiento visual enfocado, permitiendo que los robots distingan y manipulen de manera robusta objetos de grano fino entre distractores y similitudes visuales.

Autores originales: Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

Publicado 2026-09-21
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Haolong Meng, Fangbo Qin, Mengchen Bai, Houwu Wang, Cirong Liu, Shan Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots han sido durante mucho tiempo maestros de tareas amplias y generales: recoger una taza, mover una caja o apilar bloques. Para estos trabajos, los "ojos" de un robot suelen escanear toda la habitación, buscando cualquier objeto que encaje en una descripción general como "taza" o "caja". Este enfoque funciona bien cuando el objetivo es simplemente agarrar una taza. Pero el mundo real es mucho más específico. Imagine que un humano pide recoger una lata roja específica de jugo de fresa de un estante lleno de latas rojas de refresco, latas azules de agua y latas verdes de té. Un humano reconoce instantáneamente la marca, el sabor y las sutiles diferencias en la etiqueta. Un robot estándar, sin embargo, a menudo solo ve una "lata roja" y agarra la equivocada, o se confunde por el desorden. Esta brecha entre el reconocimiento general de objetos y la capacidad de distinguir detalles finos —como un modelo específico, un patrón de color o una marca— es la frontera de la manipulación de grano fino. El desafío no es solo ver el objeto, sino ver el objeto correcto entre muchos que son casi idénticos, y luego actuar sobre él con precisión.

Un equipo de investigadores ha desarrollado un nuevo sistema que enseña a los robots a hacer esta distinción, permitiéndoles manipular artículos específicos incluso cuando hay "gemelos" visualmente similares cerca. Su enfoque, detallado en un estudio reciente, va más allá de la idea de enseñar a un robot una nueva habilidad desde cero cada vez que encuentra un nuevo objeto. En su lugar, crearon una forma para que el robot construya una memoria persistente de los artículos específicos que ha aprendido a reconocer. El sistema se basa en un potente modelo de visión fundacional conocido como SAM3, que es excelente para encontrar y delinear objetos en imágenes. Sin embargo, la versión estándar de este modelo es limitada; se le puede decir que encuentre "una taza", pero le cuesta encontrar "la taza azul específica con un golpe en el borde" cuando hay otra taza azul casi idéntica justo al lado. Los investigadores solucionaron esto creando un "banco de memoria" donde el robot almacena huellas digitales únicas para cada artículo específico que necesita aprender.

Para construir esta memoria, los investigadores no reentrenaron todo el masivo sistema visual, lo cual sería lento y computacionalmente costoso. En su lugar, mantuvieron el motor visual central congelado y le enseñaron un nuevo truco: cómo asociar un conjunto específico de "tokens" internos con un objeto determinado. Le mostraron al robot unas pocas docenas de fotos de un artículo objetivo, como una lata roja de jugo de fresa Wontae, contra un fondo liso. A través de un proceso de aprendizaje sobre qué hace que esa lata específica sea diferente de otras latas rojas, el sistema generó un conjunto compacto de tokens de memoria. Estos tokens actúan como una tarjeta de identificación persistente para ese objeto específico. Una vez almacenados, el robot puede recuperar esta tarjeta de identificación cada vez que necesite encontrar esa lata específica de nuevo, incluso si la lata está en una habitación diferente, bajo una iluminación distinta o rodeada de imitadores confusos. Esto permite al robot cambiar entre tareas simplemente intercambiando el token de memoria que está buscando, en lugar de reaprender la tarea completa.

La segunda gran innovación es cómo el robot utiliza esta memoria para decidir qué hacer. En muchos sistemas robóticos, la información visual es una mezcla borrosa de toda la escena, lo que puede distraer la toma de decisiones del robot. Los investigadores introdujeron un método llamado codificación espacial-apariencia enfocada. Esta técnica obliga al robot a ignorar todo lo que esté fuera del objeto objetivo. Toma la forma y la ubicación exactas del objetivo, identificadas por los tokens de memoria, y extrae únicamente los detalles visuales del interior de esa forma. Combina esto con las coordenadas precisas de dónde se encuentra el objeto. Al alimentar al planificador de acciones del robot solo con estos datos enfocados y de alta calidad, el sistema asegura que el robot esté reaccionando al artículo específico que se le pidió encontrar, no al desorden del fondo o a los vecinos de apariencia similar. Esta vista enfocada se pasa luego al software de control del robot, que calcula los movimientos suaves necesarios para agarrar o empujar el objeto.

Los investigadores probaron este sistema en un brazo robótico equipado con dos cámaras, una que proporciona una vista de tercera persona de la mesa y otra montada en el brazo para una perspectiva de primera persona. Crearon un conjunto de datos de treinta objetos físicos diferentes, que van desde latas y tazas hasta tapas y cajas, muchos de los cuales tenían contrapartes visualmente similares. En un conjunto de pruebas, se le pidió al robot que recogiera una lata específica mientras se colocaban cerca otras latas del mismo color pero de diferentes marcas. Las políticas robóticas estándar, que dependen de descripciones generales de la escena, fallaron frecuentemente en estos escenarios, a menudo agarrando la lata equivocada o confundiéndose con los distractores. El nuevo sistema, sin embargo, identificó y manipuló con éxito el objetivo correcto en casi todas las pruebas. Cuando los investigadores cambiaron el objetivo por un objeto diferente del mismo tipo pero de una marca distinta, el robot simplemente recuperó el nuevo token de memoria y realizó la tarea correctamente sin necesidad de nuevo entrenamiento o demostraciones.

Los resultados mostraron que el sistema podía distinguir entre objetos que eran visualmente casi idénticos, una tarea que desconcertó a otros métodos. En pruebas donde el robot tenía que recoger un artículo específico de un grupo de tres o cuatro objetos similares, el nuevo enfoque mantuvo una alta tasa de éxito, mientras que otros métodos vieron cómo su rendimiento caía significativamente. El sistema también demostró ser robusto cuando el robot tenía que mover el objeto a una nueva ubicación, ya que la codificación visual enfocada le ayudó a rastrear la posición y orientación cambiante del artículo. Los investigadores señalaron que el sistema no es perfecto; si las características únicas de un objeto están ocultas, como si la etiqueta de una lata estuviera de espaldas a la cámara, el robot no puede identificarlo. Además, al enfocarse tan estrictamente en el objetivo, el robot podría pasar por alto otros obstáculos en la escena, lo que podría ser una limitación para navegar en entornos complejos. No obstante, el trabajo demuestra un paso significativo hacia el otorgamiento de la capacidad a los robots para manejar las demandas sutiles y específicas de las tareas del mundo real, moviéndolos de ser agarradores generales a operadores precisos capaces de distinguir lo familiar de lo confuso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →