← Últimos artículos
💻 computer science

Zero-shot 2D Grounding with Novel Affordance Types

Este artículo introduce la tarea de localización 2D zero-shot para nuevos tipos de asequibilidad (affordance), proponiendo el método sin entrenamiento AffordAnything y su variante entrenable AffordAnything+, los cuales aprovechan las pistas de segmentación para lograr mejoras significativas de rendimiento en el nuevo benchmark NAT.

Autores originales: Haomeng Zhang, Raymond A. Yeh

Publicado 2026-08-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Haomeng Zhang, Raymond A. Yeh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot cómo interactuar con el mundo. Puedes decirle a un robot cómo es un "cuchillo" y este puede encontrar uno en una imagen. Pero saber qué es un cuchillo no es lo mismo que saber qué se puede hacer con él. Esto es la diferencia entre el reconocimiento de objetos y la "afordancia" (affordance). La afordancia es una palabra elegante para referirse a las pistas ocultas que un objeto nos da sobre cómo usarlo. El mango de una taza "permite" el agarre; el lado plano de un cuchillo "permite" el corte; la cáscara de una naranja "permite" el pelado. Para que los robots sean verdaderamente útiles en nuestras desordenadas cocinas y salas de estar, necesitan entender estas acciones, no solo los objetos.

El gran desafío ha sido que la mayoría de los cerebros de los robots son entrenados como estudiantes que solo estudian para un examen específico. Si un robot aprende a "cortar" una manzana, podría confundirse cuando se le pida "cortar" un tomate, o tal vez no sepa cómo "pelar" un plátano si nunca ha visto esa acción específica antes. Es como un estudiante que memoriza las respuestas de una hoja de ejercicios de matemáticas pero se queda paralizado cuando el profesor hace una pregunta similar con números diferentes. Los científicos han estado intentando construir robots que puedan manejar estas instrucciones nuevas y no vistas, pero hasta ahora, el enfoque se ha centrado principalmente en enseñarles sobre nuevos objetos, no sobre nuevas acciones.

Este artículo presenta una nueva forma de enseñar a los robots a manejar "tipos de afordancia novedosos", básicamente, nuevas formas de usar cosas que nunca se les ha enseñado explícitamente. Los investigadores, Haomeng Zhang y Raymond A. Yeh de la Universidad de Purdue, observaron que los modelos de IA existentes son excelentes encontrando nuevos objetos, pero pésimos para descifrar nuevas acciones. Crearon un nuevo conjunto de desafíos (llamados benchmarks) para probar esta habilidad específica. Descubrieron que los modelos actuales de vanguardia, que son muy inteligentes al reconocer objetos, fallan por completo cuando se les pide encontrar el lugar adecuado para "pelar" o "sentarse en" algo si esas acciones específicas no estaban en sus datos de entrenamiento.

Para solucionar esto, el equipo construyó un nuevo sistema llamado AffordAnything. Piensa en esto como un detective que no solo mira la imagen completa, sino que hace zoom en pistas diminutas. El sistema se da cuenta de que donde interactúas con un objeto suele ser una parte específica de este (como el mango de una taza o el borde de un libro). En lugar de intentar memorizar cada posible acción, este sistema utiliza una potente IA preentrenada (un Modelo de Lenguaje Visual) para descomponer el objeto en pequeños parches y determinar qué parche coincide con la palabra de la acción. Por ejemplo, si le pides "cortar", busca el borde afilado; si le pides "sujetar", busca el mango.

Los investigadores probaron dos versiones. La primera, AffordAnything, es una versión "libre de entrenamiento", lo que significa que funciona directamente sin necesidad de ser reentrenada. Ya funcionó significativamente mejor que los métodos existentes. La segunda versión, AffordAnything+, es una mejora "entrenable" que aprende a combinar estas pistas aún mejor con solo un poco de práctica. En sus nuevos conjuntos de pruebas, este modelo mejorado aumentó la precisión de encontrar el lugar adecuado en un 12.3% (medido como un aumento absoluto en IoU@0.4) en comparación con el mejor método anterior.

El artículo argumenta explícitamente en contra de la idea de que simplemente usar modelos de IA más grandes y más inteligentes o solo reconocer objetos sea suficiente. Demostraron que incluso los modelos más avanzados fallan cuando la acción es nueva. También demostraron que, aunque estos modelos pueden reconocer un "cuchillo", no saben automáticamente cómo "pelar" a menos que estén diseñados específicamente para buscar la relación entre la acción y la forma del objeto. Los resultados sugieren que, para que los robots sean verdaderamente adaptables, debemos dejar de enseñarles una lista fija de acciones y empezar a enseñarles a razonar sobre las partes de un objeto que hacen posible una acción. Los autores esperan que esta nueva forma de probar y construir estos sistemas ayude a que los robots sean más flexibles y estén listos para el mundo real, donde las instrucciones siempre están cambiando.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →