← Últimos artículos
🤖 AI

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

El benchmark LLM-WikiRace evalúa las capacidades de planificación y razonamiento de los grandes modelos de lenguaje al encomendarles la navegación de hipervínculos de Wikipedia, revelando que, si bien los modelos de vanguardia alcanzan un rendimiento sobrehumano en niveles fáciles, todavía presentan dificultades significativas en niveles difíciles debido a limitaciones en la planificación de largo alcance y en la recuperación ante fallos.

Autores originales: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

Publicado 2026-06-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando a un juego de "Wikipedia Rabbit Hole" (el laberinto de Wikipedia). Empiezas en la página de Bananas y tu objetivo es llegar a la página de Ferraris haciendo clic únicamente en los hipervínculos azules dentro de los artículos. No puedes usar un mapa, no puedes ver todo el internet y tienes un número limitado de clics (pasos). Si haces clic en el enlace equivocado demasiadas veces, te quedas atrapado en un bucle o se te acaban los pasos y pierdes.

Este es el núcleo de LLM-WikiRace, una nueva prueba creada por investigadores para ver qué tan inteligente es realmente la Inteligencia Artificial (IA) cuando navega por el mundo real.

Aquí tienes un desglose de lo que encontró el artículo, utilizando analogías sencillas:

1. La prueba: Un laberinto sin mapa

La mayoría de las pruebas de IA piden a la computadora que resuelva problemas matemáticos o escriba código. Esta prueba es diferente. Pide a la IA que navegue por un laberinto masivo e invisible hecho de conocimiento humano (Wikipedia).

  • La configuración: La IA ve la página actual, la página objetivo y una lista de 50 enlaces posibles para hacer clic a continuación.
  • El desafío: La IA tiene que adivinar qué enlace la acerca más al objetivo. No puede ver el "camino más corto" (como un GPS); tiene que usar su memoria interna de cómo funciona el mundo para trazar un plan.

2. Los resultados: Buenos para caminar, malos para correr

Los investigadores probaron muchos modelos de IA famosos (como Gemini, GPT-5 y Claude).

  • El nivel fácil: Cuando el objetivo está cerca (a solo 3 o 4 clics de distancia), las mejores IA son como excursionistas expertos. Tienen éxito aproximadamente el 90% al 96% de las veces. Saben de lo que hablan.
  • El nivel difícil: Cuando el objetivo está lejos (a 7 u 8 clics de distancia), las IA se pierden. Incluso el modelo más inteligente (Gemini 3.1) tiene éxito solo en el 29% de estos juegos.
  • La conclusión: El artículo afirma que, si bien estas IA tienen una enorme biblioteca de hechos en su "cerebro", luchan por usar esa biblioteca para trazar un plan a largo plazo. Son excelentes sabiendo qué son las cosas, pero malas determinando cómo ir de A a B cuando el camino es largo.

3. La "Brecha de Planificación": Saber vs. Hacer

Los investigadores descubrieron algo interesante llamado la "Brecha de Planificación" (Planning Gap).

  • Imagina a dos estudiantes tomando un examen. Ambos conocen exactamente la misma cantidad de datos históricos (Conocimiento del Mundo).
  • Estudiante A (una IA estándar) simplemente memoriza los datos.
  • Estudiante B (una IA de "Razonamiento") ha sido entrenada para pensar paso a paso.
  • El resultado: El Estudiante B obtiene hasta un 20% más de puntuación que el Estudiante A, a pesar de conocer los mismos hechos.
  • La lección: Tener conocimiento no es suficiente. Necesitas un "motor de razonamiento" especial para convertir ese conocimiento en una estrategia ganadora.

4. El fallo fatal: Quedarse atrapado en un bucle

El hallazgo más sorprendente fue cómo fallan las IA.

  • El Bucle: Cuando una IA comete un error, en lugar de decir: "Está bien, ese camino no funcionó, intentemos de otra manera", a menudo sigue haciendo clic en los mismos enlaces una y otra vez.
  • La metáfora: Es como una persona caminando en círculos en un bosque. Se da cuenta de: "Oh no, ya he estado aquí antes", pero en lugar de dar la vuelta, sigue caminando en ese mismo círculo hasta que se le acaba el tiempo.
  • Los datos: En los juegos más difíciles, los mejores modelos se quedaron atrapados en bucles el 86% de las veces. Una vez atrapados, casi nunca escapaban. Son malos para "replanificar".

5. El entrenamiento ayuda, pero solo un poco

Los investigadores intentaron "enseñar" a un modelo de IA más pequeño a jugar este juego dándole rondas de práctica (ajuste fino o fine-tuning).

  • El resultado: El modelo mejoró mucho en los juegos fáciles (pasando de un 22% a un 67% de éxito).
  • El límite: Sin embargo, este entrenamiento no hizo nada para ayudar con los juegos difíciles. El modelo seguía teniendo un 0% de éxito en el nivel más difícil.
  • La conclusión: No puedes simplemente "enseñar" a una IA a resolver estos problemas difíciles con simple práctica; la capacidad subyacente para planificar a largo plazo parece estar ausente.

Resumen

LLM-WikiRace es una prueba simple pero brutal. Demuestra que, aunque las superinteligentes IA de hoy tienen una enciclopedia masiva en sus cabezas, todavía son terribles navegando por ella cuando el viaje es largo. Pueden encontrar la salida si está justo al lado de la puerta, pero si tienen que caminar a través de un laberinto, tienden a confundirse, repetir sus errores y rendirse.

El artículo concluye que, para que la IA domine realmente las tareas complejas, debe mejorar mucho en su capacidad de planificar con antelación y cambiar de opinión cuando las cosas salen mal, no solo en conocer más datos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →