← Últimos artículos
💻 computer science

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp es un marco de trabajo eficiente en datos que desacopla el razonamiento semántico de alto nivel de la ejecución geométrica de bajo nivel mediante el uso de un modelo de visión y lenguaje para predecir un punto semilla para un generador de agarre ligero, permitiendo un agarre robusto y multi-encarnación en escenas complejas sin un costoso entrenamiento de extremo a extremo.

Autores originales: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

Publicado 2026-07-23
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina a un robot intentando recoger un juguete de un dormitorio desordenado. Para un humano, esto es fácil: ves el juguete, sabes dónde está su asa y lo agarras. Pero para un robot, el mundo es un revoltijo confuso de formas y sombras. Necesita entender dos cosas muy diferentes al mismo tiempo: la "visión general" (¿Cuál es mi objetivo? "Recoger la taza roja por su asa") y los "detalles diminutos" (¿Exactamente dónde deben tocar mis dedos para no volcar la lámpara?). Este es el desafío del agarre robótico. Durante mucho tiempo, los robots eran o muy inteligentes pero torpes (sabían qué hacer pero no lograban comprender la física de tocar las cosas) o muy buenos en la física pero torpes (podían agarrar cualquier cosa, pero solo si se les decía exactamente dónde, sin entender el lenguaje). Los científicos han estado intentando construir un robot que pueda escuchar una frase sencilla como "Agarra la cesta por su asa" y luego deducir la forma perfecta de recogerla, incluso en una habitación desordenada, utilizando diferentes tipos de manos robóticas.

Entra en escena SeededGrasp, un nuevo método que actúa como un equipo inteligente de dos: un "cerebro" y una "mano". En lugar de intentar enseñar a un único cerebro robótico gigante y supercomplejo a hacer todo a la vez (lo cual es como intentar enseñarle a un perro a calcular cálculo diferencial mientras aprende a traer la pelota), los investigadores dividieron el trabajo. Primero, utilizan un potente Modelo de Lenguaje-Visión (VLM) —piensa en él como una IA superinteligente que puede leer y ver— para observar la escena desordenada y la instrucción. Esta IA no intenta calcular las posiciones exactas de los dedos; en su lugar, simplemente señala un "punto semilla", como un chincheta digital, en el objeto donde debería comenzar el agarre. Es como un humano diciendo: "Agárralo justo ahí", y señalando con el dedo.

Una vez plantado este "punto semilla", un segundo modelo ligero toma el control. Este modelo es como un mecánico altamente calificado que sabe exactamente cómo mover los dedos del robot basándose en ese único punto. Debido a que el trabajo pesado de comprender el lenguaje lo realiza la primera IA, y el trabajo pesado de la geometría lo realiza la segunda, pueden trabajar juntos de manera muy eficiente. Los investigadores probaron esto en tres tipos diferentes de manos robóticas (una pinza de dos dedos estándar, una pinza de tres dedos y una mano muy diestra con muchas articulaciones) en una habitación desordenada simulada. Descubrieron que este enfoque de "punto semilla" funcionó increíblemente bien, logrando una tasa de éxito del 72% en la simulación. Aún más impresionante, cuando lo probaron en un robot real en el mundo real, tuvo éxito el 78% de las veces.

El artículo también argumenta en contra de algunas ideas comunes. Sugiere que intentar entrenar un modelo masivo para que haga todo desde cero es demasiado costoso y requiere demasiados datos. También muestra que usar simplemente un VLM para adivinar directamente toda la pose de agarre suele provocar errores porque la IA se confunde con la geometría 3D. En cambio, el "punto semilla" actúa como un puente perfecto, permitiendo que la IA inteligente se encargue del lenguaje y el modelo especializado se encargue de la física. Para demostrar que esto funciona, el equipo no solo se basó en datos existentes; crearon un nuevo y masivo conjunto de datos de 2.56 millones de agarres a través de 610 escenas desordenadas para entrenar su sistema. Aunque los resultados son muy prometedores, los autores señalan que esto fue probado en simulación y en ensayos en el mundo real con configuraciones específicas, y que aún queda trabajo por hacer para asegurar que el brazo del robot pueda alcanzar cada lugar al que el "punto semilla" señala sin chocar con obstáculos. Pero por ahora, SeededGrasp muestra una forma divertida y efectiva de enseñar a los robots a escuchar, mirar y agarrar con la ayuda de un pequeño dedo que señala.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →