← Últimos artículos
🤖 AI

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

El artículo presenta Messier, un corpus unificado de alta resolución de casi un millón de registros estandarizados que abarca 30 evaluaciones de referencia y diversos dominios, el cual permite una evaluación exhaustiva de agentes entre distintas evaluaciones de referencia, revela un progreso desigual a través de tipos de tareas y proporciona una infraestructura fundacional para auditar y escalar las capacidades de los agentes de IA.

Autores originales: Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de averiguar qué personaje de un videojuego es el absolutamente mejor en todo. Tienes un personaje que es increíble saltando, otro que es un mago resolviendo acertijos matemáticos, y un tercero que puede navegar un laberinto perfectamente. Pero aquí está el truco: cada juego mide la "habilidad" de manera diferente. Un juego te otorga una estrella de oro por saltar sobre un solo foso, mientras que otro requiere que resuelvas un problema de álgebra complejo para abrir una puerta, y un tercero exige que recolectes cada una de las monedas de un nivel sin tocar un solo enemigo. Si solo miras la puntuación final —un único número como "95%"— podrías pensar que todos son igualmente buenos. Pero ese número esconde los detalles desordenados. ¿Fracasó el personaje porque no pudo saltar, o porque se quedó trabado en una puerta? ¿Obtuvo un 95% porque hizo todo perfectamente, o porque falló en una sola cosa diminuta y el juego contó toda la partida como un cero?

Este es exactamente el problema que enfrentan los científicos que estudian los agentes de IA. Estos no son solo chatbots; son trabajadores digitales que pueden usar herramientas, escribir código, navegar por la web y tomar decisiones en entornos en tiempo real. Actualmente, existen cientos de pruebas diferentes (benchmarks), pero todas hablan idiomas distintos. Algunas pruebas son estrictas: si fallas un solo paso en una receta de 10 pasos, obtienes un cero. Otras son más permisivas. Debido a esto, es increíblemente difícil comparar un agente que es excelente programando con uno que es excelente en investigación legal. Es como intentar comparar a un corredor de maratón con un gran maestro de ajedrez usando solo una única puntuación de "atletismo". Para entender cómo la IA está mejorando realmente, necesitamos una forma de mirar bajo el capó de estas puntuaciones y ver exactamente dónde tienen éxito los agentes y dónde tropiezan.

Entra MESSIER, un nuevo y masivo proyecto que actúa como un gigante traductor universal para las pruebas de IA. Los investigadores detrás de MESSIER no solo construyeron una nueva prueba; construyeron una biblioteca gigante que recopila los resultados de 30 pruebas existentes, cubriendo 11.891 tareas específicas y 74.205 formas diferentes de verificar si un agente tuvo éxito. Reunieron datos de 714 agentes de IA diferentes e incluso realizaron nuevas pruebas frescas en seis áreas difíciles donde faltaban datos, como revisiones legales y diseño de circuitos cuánticos. En total, organizaron casi un millón de registros de ensayos en un formato único y estandarizado. Piensa en esto como tomar una pila caótica de recibos de 30 tiendas diferentes, cada una escrita en una moneda distinta y con diferentes reglas matemáticas, y convertirlas todas en una única hoja de cálculo clara que te permite ver exactamente qué se compró, cuánto costó y qué tienda tenía los mejores precios.

Lo más emocionante que encontró MESSIER es que la forma en que contamos los puntos cambia la historia. El artículo muestra que muchas pruebas utilizan una regla "estricta": si un agente falla incluso una pequeña parte de la tarea, todo el proceso se marca como un fallo. Los investigadores demostraron que si relajaban esta regla y observaban cuántas partes sí logró completar el agente, la imagen del progreso se ve muy diferente. Por ejemplo, en una prueba de referencia legal, la puntuación estricta de "todo o nada" decía que los agentes tenían éxito solo el 0,2% de las veces. Pero cuando analizaron los detalles, descubrieron que, en promedio, los agentes estaban satisfaciendo el 28,8% de los criterios. La regla estricta estaba ocultando un gran progreso parcial. Esto sugiere que, si bien la IA está mejorando, la forma en que la medimos podría ser demasiado severa, haciendo que parezca que los agentes fallan con más frecuencia de lo que realmente lo hacen.

El estudio también mapeó dónde la IA está "ganando" de verdad y dónde sigue teniendo dificultades. Encontraron que la IA es casi perfecta en la "llamada a funciones" (uso de herramientas), con una tasa de éxito de 0,97. También se está volviendo muy buena en la programación, mejorando rápidamente en los últimos dos años. Sin embargo, la IA todavía tiene problemas con los "flujos de trabajo empresariales": trabajos de oficina complejos de múltiples pasos, como la gestión de un proceso de negocio. En estas áreas, la tasa de éxito es solo de 0,57, lo que significa que los agentes fallan más a menudo de lo que tienen éxito. Los investigadores también demostraron que se puede usar esta enorme biblioteca para crear una nueva "escala de habilidades" para la IA que coincida muy de cerca con otros rankings importantes (con una correlación de 0,81), sin necesidad de gastar millones de dólares realizando nuevas pruebas.

En última instancia, MESSIER es una herramienta para la claridad. Sugiere que, al observar los detalles minúsculos de cómo falla un agente, en lugar de solo la puntuación final, podemos obtener una imagen mucho más real de lo que la IA realmente puede hacer. No dice que la IA haya resuelto todo, pero sí sugiere que nuestros actuales instrumentos de medición podrían ser demasiado toscos. Al estandarizar estos resultados, los autores esperan dejar de desperdiciar dinero repitiendo las mismas pruebas y ayudar a los investigadores a comprender exactamente qué trabajos están listos para la IA y cuáles todavía necesitan una mano humana. Los datos están ahora abiertos para que cualquiera los use, convirtiendo un caos confuso de números en un mapa claro del panorama de la IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →