Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains
Relay-Bench es un benchmark holístico, exclusivamente de texto, diseñado para evaluar modelos de lenguaje de gran tamaño en cadenas de razonamiento de múltiples dominios mediante la presentación de problemas compuestos no saturados que requieren integrar diversas habilidades como la programación, las matemáticas y la búsqueda web dentro de un mismo prompt, donde el modelo líder GPT-5.5 (xHigh) alcanza una puntuación de 43.3%.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde tu asistente inteligente favorito no sea solo un bot de datos curiosos o un procesador de código, sino un verdadero mago de la multitarea. En el campo de la Inteligencia Artificial, que evoluciona rápidamente, los investigadores construyen constantemente "benchmarks" (puntos de referencia), que son esencialmente pruebas estandarizadas, para ver qué tan inteligentes son realmente estos cerebros digitales. Durante mucho tiempo, estas pruebas fueron como materias separadas en la escuela: un examen para matemáticas, otro para historia y un tercero para programación. Pero la vida real no funciona así. Cuando le pides a un humano que planee un viaje, no solo calcula distancias; consulta el clima, lee reseñas, reserva un hotel y tal vez incluso escribe un correo electrónico divertido a un amigo, todo de una sola vez. Este artículo se adentra en un rincón específico de la investigación de IA llamado "cadenas de razonamiento", donde el objetivo es ver si un modelo puede hacer malabares con muchos tipos diferentes de tareas a la vez sin dejar caer la pelota. La gran pregunta que a todos les importa es: ¿Pueden estos modelos de IA manejar los problemas desordenados y complicados del mundo real, o se confunden y se rinden cuando las cosas se vuelven demasiado congestionadas?
Presentamos Relay-Bench, una nueva prueba súper desafiante diseñada para ver si los modelos de IA pueden correr una "carrera de relevos" de la mente. En lugar de pedirle a un modelo que resuelva un problema matemático o escriba un poema, los creadores de esta prueba encadenan toda una serie de tareas diferentes —como resolver un acertijo matemático, encontrar un dato específico en la web, escribir un poco de código y decodificar un mensaje secreto— todo dentro de un único y masivo prompt. Piensa en ello como un nivel de un videojuego donde tienes que saltar sobre un foso, resolver un enigma para abrir una puerta y luego luchar contra un jefe, todo sin presionar el botón de "reiniciar". Los investigadores construyeron 31 de estos desafíos complejos, algunos de los cuales son tan largos y están tan llenos de información falsa que se sienten como leer una novela solo para encontrar un solo número. También añadieron una capa de "código secreto", donde cada palabra en las instrucciones es reemplazada por un extraño código de tres letras, obligando a la IA a decodificar el mensaje antes de que pueda siquiera empezar a resolver los problemas.
Cuando sometieron a los tres mejores modelos de IA de la época (GPT-5.5, Gemini 3.1 Pro y Claude Opus 4.7) a este calvario, los resultados fueron un poco impactantes. Incluso el modelo más inteligente, GPT-5.5, solo acertó aproximadamente el 43.3% de las respuestas. ¡Eso es menos de la mitad! Los otros modelos puntuaron incluso más bajo, con uno de ellos logrando apenas un 16.7%. El artículo sugiere que, si bien estos modelos de IA se están volviendo muy buenos en tareas individuales, tienen dificultades significativas cuando se les pide encadenar múltiples habilidades diferentes, especialmente cuando las instrucciones son confusas o la tarea es muy larga. De hecho, la prueba fue tan difícil que muchos modelos simplemente se rindieron o se quedaron atrapados en bucles, incapaces de terminar la carrera.
Los investigadores también descubrieron que estos modelos a veces "alucinan", que es una forma elegante de decir que inventan respuestas cuando no conocen la solución. Un modelo, Claude Opus 4.7, fue muy cauteloso; se negó a responder muchas de las preguntas codificadas por completo, probablemente porque sus filtros de seguridad eran demasiado estrictos. Otro modelo, Gemini 3.1, intentó adivinar más a menudo pero terminó con más respuestas incorrectas. El estudio destaca que los modelos de IA actuales aún están lejos de ser los expertos integrales que esperamos que sean. Son como estudiantes brillantes que pueden sacar una nota excelente en un examen de matemáticas, pero podrían entrar en pánico si les pides que hagan matemáticas mientras simultáneamente traducen un poema y buscan una receta. Los autores sugieren que podría tomar otro año o dos antes de que los modelos de IA sean lo suficientemente buenos como para pasar consistentemente este tipo de prueba de "carrera de relevos", y advierten que, a medida que los modelos se vuelvan más inteligentes, estas pruebas tendrán que volverse aún más difíciles para mantenerse al día.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.