← Últimos artículos
💬 NLP

CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark

Este artículo presenta CORE-Bench, un benchmark exhaustivo que comprende 270 tareas a través de tres disciplinas científicas diseñado para evaluar y mejorar la capacidad de los agentes de IA para reproducir computacionalmente resultados de investigación, destacando las significativas limitaciones actuales en la automatización de flujos de trabajo científicos.

Autores originales: Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

Publicado 2026-06-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef que acaba de publicar una receta famosa para un suflé perfecto. Le dices al mundo: "Aquí está la receta, aquí están los ingredientes y aquí hay una foto del resultado esponjoso". Pero cuando tus amigos intentan hacerlo, el suflé se desinfla, se quema o sabe a cartón. ¿Por qué? Tal vez usaron el horno equivocado, usaron la marca de huevos incorrecta o se saltaron un paso porque tus instrucciones eran vagas.

En el mundo de la ciencia, esto se llama una crisis de reproducibilidad. Los científicos publican artículos con código y datos, pero a menudo otros investigadores no pueden obtener los mismos resultados cuando intentan ejecutar ese código.

Este artículo presenta una nueva "cocina de pruebas" llamada CORE-Bench para ver si se pueden contratar robots de IA (llamados "agentes") para arreglar este lío.

El Problema: La "Caja Negra" de la Ciencia

La ciencia se basa en la confianza. Si un estudio dice que un nuevo fármaco funciona, necesitamos poder ejecutar las mismas matemáticas y el mismo código para verificarlo. Pero a menudo, el código es desordenado, el software está desactualizado o las instrucciones faltan. Es como intentar montar un mueble de IKEA sin las instrucciones, usando herramientas que no tienes, en una habitación con la iluminación incorrecta.

La Solución: Una Nueva "Prueba de Robot Chef"

Los autores construyeron CORE-Bench, un circuito de obstáculos gigante para agentes de IA.

  • La Configuración: Tomaron 90 artículos científicos reales de ciencias de la computación, medicina y ciencias sociales.
  • La Tarea: Pidieron a agentes de IA que actuaran como asistentes de investigación. El trabajo del agente es:
    1. Descargar el código y los datos.
    2. Instalar todo el software necesario (como descargar las aplicaciones adecuadas para un teléfono nuevo).
    3. Ejecutar el código.
    4. Observar los resultados (gráficos, números, texto) y responder preguntas específicas sobre ellos.
    5. Entregar un informe diciendo: "Obtuve el mismo resultado que el artículo original".

Los Niveles de Dificultad

Al igual que en un videojuego, la prueba tiene tres niveles:

  1. Modo Fácil: Se le da a la IA la "foto" terminada del resultado. Solo tiene que mirar la imagen y responder preguntas. (Como si le pidieran leer un menú).
  2. Modo Medio: Se le da a la IA un contenedor "Docker" (una caja pre-empaquetada de herramientas) y se le dice que lo ejecute. Tiene que saber cómo abrir la caja y presionar el botón de "inicio".
  3. Modo Difícil: La IA recibe solo la receta (el archivo README). Tiene que averiguar qué herramientas comprar, instalarlas, solucionar cualquier error y ejecutar el código desde cero. Esta es la prueba del mundo real.

Los Resultados: Los Robots Todavía Están Aprendiendo

Los investigadores probaron dos tipos de "chefs" de IA:

  1. AutoGPT: Un robot de propósito general que intenta hacer cualquier cosa.
  2. CORE-Agent: Un robot entrenado y guiado específicamente para hacer este trabajo específico.

La Hoja de Puntuación:

  • En el Modo Fácil: El robot especializado (CORE-Agent) lo hizo bastante bien, logrando completar aproximadamente el 60% de las tareas correctamente.
  • En el Modo Difícil: La puntuación cayó significamente. Incluso el mejor robot solo logró completar aproximadamente el 21% de las tareas más difíciles.

¿Qué salió mal?

  • Perderse: Los robots a menudo miraban el gráfico o el archivo equivocado cuando había muchos archivos en la carpeta.
  • La Trampa de la Instalación: En el nivel difícil, los robots se quedaban atascados intentando instalar software. Intentaban instalar lo mismo una y otra vez, se quedaban sin dinero (costos de API) y se rendían.
  • Problemas de Visión: Era mucho más difícil para los robots "leer" gráficos e imágenes que leer texto plano.
  • Problemas de Lenguaje: Los robots tuvieron más dificultades con el código escrito en el lenguaje R en comparación con Python.

La Conclusión

El artículo concluye que, si bien la IA está mejorando en la programación, todavía está lejos de ser capaz de reproducir de manera confiable investigaciones científicas complejas por sí sola.

Sin embargo, hay buenas noticias: El entrenamiento especializado ayuda. Cuando los investigadores le dieron al robot general algunas pistas y reglas específicas (como "siempre revisa la carpeta de salida primero" o "no adivines, busca el archivo"), su rendimiento aumentó significamente.

La Conclusión Final:
No podemos simplemente entregarle un artículo científico a un robot y esperar que verifique la ciencia hoy mismo. Pero si le damos al robot un poco de entrenamiento y las herramientas adecuadas, puede empezar a ayudar. El objetivo no es reemplazar a los científicos, sino construir un "asistente robótico" que pueda realizar el trabajo aburrido y repetitivo de verificar si las matemáticas realmente cuadran, liberando a los humanos para que realicen el descubrimiento real.

Los autores esperan que, al publicar esta prueba (CORE-Bench), otros desarrolladores construyan mejores robots para ayudar a que la ciencia sea más confiable.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →