← Últimos artículos
🤖 AI

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Este artículo presenta "Every Eval Ever", una iniciativa gobernada por la comunidad que aborda la fragmentación de los resultados de evaluación de la IA mediante el establecimiento de un esquema JSON unificado, la provisión de convertidores automáticos desde diversas fuentes y el alojamiento de un repositorio colaborativo en Hugging Face que actualmente agrega datos de más de 22.000 modelos y 2.000 benchmarks.

Autores originales: Jan Batzner, Sree Harsha Nelaturu, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra
Publicado 2026-06-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jan Batzner, Sree Harsha Nelaturu, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo de la Inteligencia Artificial (IA) como una liga deportiva masiva y caótica. Cada día, diferentes equipos (investigadores y empresas) hacen pasar a sus jugadores (modelos de IA) por diversas pistas de obstáculos (benchmarks) para ver quién es el más rápido o el más fuerte.

¿El problema? Todos llevan la puntuación de forma distinta.

Algunos equipos escriben sus resultados en un cuaderno, otros en una pizarra, otros en una hoja de cálculo y otros simplemente tuitean un único número. Un equipo puede decir que un jugador anotó "85", pero no te dice si usó un cronómetro o un reloj de arena, o si el jugador estaba corriendo en una cinta o en una pista. Debido a este desorden, es imposible comparar realmente al Jugador A del Equipo X con el Jugador B del Equipo Y.

"Every Eval Ever" (EEE) es el proyecto que intenta solucionar este caos. Piensa en él como el traductor universal y el anotador oficial de todo el mundo de la IA.

Así es como funciona, desglosado de forma sencilla:

1. La tarjeta de puntuación universal (El Esquema)

Antes de EEE, si querías comparar dos modelos de IA, tenías que actuar como un detective, buscando papeles, publicaciones de blogs y registros de código para averiguar cómo se calculó la puntuación.

  • La solución de EEE: Crearon una "tarjeta de puntuación" única y estandarizada (un formato específico llamado esquema JSON).
  • La analogía: Imagina si todas las ligas deportivas acordaran usar exactamente la misma hoja de estadísticas. En lugar de solo escribir "85 puntos", la hoja debe incluir: "¿Quién realizó la prueba? ¿Qué reglas siguieron? ¿Qué temperatura hacía en la habitación? ¿Usaron un cronómetro o un temporizador?"
  • Por qué es importante: Ahora, cuando ves una puntuación, sabes exactamente qué significa y puedes compararla de manera justa con otra puntuación, incluso si provienen de fuentes distintas.

2. El traductor mágico (Los Convertidores)

Podrías pensar: "Pero todos ya tienen sus propias tarjetas de puntuación desordenadas. ¿Cómo arreglamos esto?".

  • La solución de EEE: Construyeron "convertidores". Estos son como herramientas de traducción mágica.
  • La analogía: Imagina un traductor que pueda tomar una nota escrita a mano en francés, una hoja de cálculo en alemán y un mensaje de voz en español, y convertirlos instantáneamente en un documento perfecto y estandarizado en inglés.
  • Cómo funciona: El proyecto cuenta con herramientas que toman automáticamente los resultados de software de prueba de IA populares (como HELM o lm-eval) y los reformatea instantáneamente en su nueva tarjeta de puntuación estándar.

3. La biblioteca comunitaria (El Repositorio)

Una vez traducidas las puntuaciones, ¿a dónde van?

  • La solución de EEE: Construyeron una biblioteca pública gigante alojada en una plataforma llamada Hugging Face.
  • La analogía: Piensa en esto como un enorme archivo público donde cualquiera puede dejar sus tarjetas de puntuación estandarizadas. No es solo una lista de ganadores; es una inmersión profunda en los detalles.
  • La escala: Actualmente, esta biblioteca contiene resultados de más de 22,000 modelos de IA diferentes probados en 2,200 desafíos distintos. Es la primera vez que se ha reunido esta cantidad de datos en un solo lugar de una manera que las computadoras puedan leer y comparar.

4. Por qué esto cambia las reglas del juego (Los Casos de Estudio)

El artículo muestra cuatro formas específicas en las que este nuevo sistema ayuda a los investigadores a ver cosas que no podían ver antes:

  • Costo vs. Precisión: En el mundo de los "Agentes de IA" (robots que realizan tareas), EEE demosto que algunas configuraciones son costosas pero no ofrecen un mejor rendimiento. Es como darse cuenta de que un Ferrari te está costando $500 al día de conducir, pero un Toyota te lleva al mismo destino por $50.
  • La trampa de la "Perplejidad": Los investigadores suelen observar una métrica llamada "perplejidad" para ver qué tan bueno es un modelo prediciendo texto. EEE reveló que dos programas de computadora diferentes pueden calcular la "perplejidad" de maneras ligeramente distintas, haciendo que los números parezcan comparables cuando en realidad no lo son. EEE señala estas diferencias para que nadie sea engañado.
  • El "Fantasma" en la máquina: Cuando los investigadores intentaron volver a ejecutar pruebas antiguas de forma local, descubrieron que a veces los resultados oficiales carecían de ciertos datos (como respuestas vacías) que sus copias locales sí tenían. EEE ayudó a detectar estos errores "fantasma" que estaban ocultos a plena vista.
  • Calificación de dificultad: Al observar las preguntas individuales (no solo la puntuación final), EEE permitió a los investigadores utilizar un método estadístico (Teoría de Respuesta al Ítem) para determinar exactamente qué preguntas eran demasiado difíciles o demasiado fáciles, ayudando a diseñar mejores pruebas.

La conclusión

"Every Eval Ever" no es un nuevo modelo de IA, y no realiza las pruebas por sí mismo. En su lugar, es la infraestructura que da sentido a las pruebas que ya se están realizando.

Convierte un montón de notas confusas e incompatibles en una base de datos clara, organizada y justa. Permite que los investigadores dejen de preguntar "¿Midieron esto de la misma manera?" y comiencen a preguntar "¿Qué nos dice esto realmente sobre el progreso de la IA?".

El proyecto es dirigido por una coalición de investigadores, empresas y universidades que creen que, para que la IA mejore, todos debemos hablar el mismo lenguaje cuando hablamos de qué tan bien funciona.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →