← Últimos artículos
🤖 AI

VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

Este artículo revela que los modelos de visión y lenguaje más avanzados tienen dificultades para seguir trayectorias visuales debido a una incapacidad fundamental para resistir distracciones locales, un cuello de botella que persiste a pesar del escalado, las intervenciones de razonamiento o las instrucciones explícitas.

Autores originales: Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

Publicado 2026-05-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando a "Conectar los Puntos" con un robot muy inteligente. Señalas un punto rojo específico y dices: "Sigue esta línea ondulada hasta el final y dime el color de cada punto que pases".

Esperarías que el robot hiciera esto fácilmente. Pero según este artículo, incluso los modelos de IA más avanzados (llamados Modelos Visión-Lenguaje o VLM) son terribles en esta tarea simple. No solo cometen errores aleatorios; se distraen y cambian a una línea diferente que se ve casi idéntica a la que les pediste seguir.

Aquí tienes un desglose de lo que descubrieron los investigadores, usando analogías simples:

1. El problema de la "Estación de Tren Abarrotada"

Los investigadores crearon dos pruebas principales para ver qué tan bien podían estas IAs trazar una línea.

  • La Prueba del Circuito: Imagina un tablero eléctrico desordenado con muchos cables del mismo color corriendo uno al lado del otro. Le pides a la IA que siga el cable conectado al "Puerto 7".
  • La Prueba del Remolino: Imagina una única escalera de caracol (con forma de bastón de caramelo) con puntos de colores sobre ella. Le pides a la IA que suba las escaleras desde la parte inferior hasta la superior.

El Resultado: La IA comienza correctamente, pero casi inmediatamente se confunde. Si hay otro cable o giro de la espiral justo al lado de la que se supone que debe seguir, la IA a menudo "salta" a ese vecino. Es como un excursionista tratando de seguir un solo sendero a través de un bosque, pero cuando dos caminos corren paralelos durante unos metros, el excursionista pisa accidentalmente el incorrecto y sigue caminando.

2. La distracción del "Gemelo"

El artículo descubrió que la IA no falla porque la tarea sea demasiado difícil o porque no pueda "ver". Falla debido a la competencia local.

Piénsalo así: Estás tratando de escuchar a tu amigo hablar en una habitación tranquila. Fácil. Ahora, imagina que tu amigo está hablando, pero justo al lado de él hay un gemelo usando la misma ropa exacta, hablando con la misma voz exacta, diciendo las mismas palabras exactas. Incluso si sabes quién es tu amigo, tu cerebro podría confundirse y empezar a escuchar al gemelo.

Los investigadores descubrieron que cuando la línea "vecina" se ve muy similar a la línea "objetivo" (mismo color, mismo ángulo, misma forma), la atención de la IA se fija en el vecino. La IA no "pierde el rastro" de manera nebulosa; elige activamente el camino incorrecto porque el camino incorrecto parece demasiado tentador a nivel local.

3. Por qué "Pensar Más Fuerte" No Ayuda

Los investigadores intentaron solucionar esto pidiéndole a la IA que "piense paso a paso" (una técnica llamada razonamiento). Esperaban que la IA se detuviera, mirara más de cerca y dijera: "Espera, esa es la línea incorrecta".

La Analogía: Es como pedirle a un turista perdido que "piense más fuerte" sobre hacia dónde ir. En lugar de mirar el mapa (la línea visual), el turista empieza a adivinar basándose en reglas generales como: "Normalmente, las carreteras giran así", o "El sol está a la izquierda, así que debería ir a la derecha".

El artículo encontró que:

  • El razonamiento no arregló la visión: La IA no comenzó a trazar la línea correctamente. En su lugar, comenzó a usar "atajos" o suposiciones. Por ejemplo, en la prueba de la espiral, algunas IAs dejaron de trazar la línea y simplemente adivinaron el orden de los puntos basándose en la forma de la espiral (por ejemplo: "El círculo interior es rojo, así que el siguiente debe ser azul").
  • Se volvió más costoso: Cuando la IA intentó "pensar", consumió una cantidad masiva de poder de cómputo (como un humano hablando consigo mismo durante 10 minutos solo para decir "rojo, azul, verde"), pero aún así obtuvo la respuesta incorrecta.
  • Las instrucciones fallaron: Incluso cuando los investigadores dieron a la IA un manual de reglas estricto diciendo: "No cambies de línea, incluso si se ven similares", la IA ignoró la regla y saltó a la línea incorrecta.

4. El Mito del "Gran Cerebro"

Por lo general, cuando la IA comete un error, asumimos que es porque el modelo es demasiado pequeño. Pensamos: "Si simplemente hacemos el cerebro más grande, lo hará bien".

Los investigadores probaron esto usando modelos que iban desde pequeños hasta masivos (hasta 235 mil millones de parámetros).

  • El Resultado: Los modelos más grandes funcionaron ligeramente mejor, pero no mucho. Incluso los modelos más grandes y costosos aún se perdían en la "estación de tren abarrotada". Hacer el cerebro más grande no le dio una mejor capacidad para mantenerse en un solo hilo en un enredo.

5. Caos del Mundo Real

Finalmente, los investigadores probaron esto en imágenes del mundo real, como cables enredados en una fábrica o mapas complejos de metro.

  • El Hallazgo: Ocurrió el mismo problema. Cuando la IA intentó trazar una línea de metro a través de una estación donde tres líneas se cruzan, o seguir un cable a través de un nudo, seguía cambiando a la línea incorrecta. El comportamiento de "salto" no fue solo un fallo en sus pruebas falsas; ocurre también en situaciones reales y desordenadas.

La Conclusión

El artículo concluye que los modelos de IA actuales son excelentes para reconocer qué son las cosas (por ejemplo: "Eso es un mapa de metro"), pero son sorprendentemente malos para seguir cosas (por ejemplo: "Traza esta línea específica de A a B").

Les falta un "músculo" específico para mantener su atención bloqueada en un solo camino cuando un camino con apariencia similar está justo al lado. Hasta que construyamos una IA con un mecanismo dedicado para ignorar estos "gemelos visuales", seguirán perdiéndose en los juegos más simples de seguir líneas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →