← Últimos artículos
💬 NLP

NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

El artículo presenta NatureBench, un referente derivado de publicaciones de la familia Nature que revela que los agentes de codificación de IA actuales luchan por superar el estado del arte existente en tareas reales de descubrimiento científico, teniendo éxito principalmente mediante la traslación metodológica en lugar de la invención genuina y fallando debido a la selección incorrecta de métodos y presupuestos de cómputo limitados.

Autores originales: Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Z
Publicado 2026-06-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina una competencia de cocina masiva y de alto nivel. Los jueces (los investigadores) tienen un libro de cocina lleno de 90 recetas increíblemente complejas de las revistas de cocina más prestigiosas del mundo (la familia de revistas científicas Nature). No son solo recetas de "cómo hacer una tostada"; son platos intrincados como "deconstruir una estructura de proteína" o "predecir cómo se comportará una nueva molécula de fármaco".

Los concursantes en esta competencia son Agentes de Codificación de IA (AI Coding Agents): programas informáticos inteligentes diseñados para escribir código y resolver problemas.

Aquí está el giro: los concursantes no tienen permitido ver las recetas originales. Solo se les entregan los ingredientes crudos (los datos) y una descripción de cómo debería saber el plato final (el objetivo). Su trabajo es inventar su propio método para crear un plato que sea tan bueno como, o mejor que, la versión premiada original.

Esta es la historia de NatureBench, una nueva prueba diseñada para ver si la IA puede pasar de simplemente copiar una receta a inventar una nueva.

El Problema: La Trampa del "Copiar y Pegar"

Antes de esta prueba, muchos parámetros de referencia de IA eran como darle a un estudiante un problema matemático y la clave de respuestas, y luego pedirle que mostrara su procedimiento. Si el estudiante simplemente copiaba la clave de respuestas, aprobaba. Pero la ciencia real no se trata de copiar; se trata de descubrir.

Los creadores de NatureBench se dieron cuenta de que las pruebas anteriores eran desordenadas. A veces, la "cocina" (el entorno informático) estaba rota, o faltaban los ingredientes, lo que hacía imposible saber si la IA fallaba porque era tonta o porque la prueba estaba amañada.

Para solucionar esto, construyeron NatureGym. Piensa en NatureGym como un equipo de cocina superorganizado y automatizado.

  1. El Filtro: Escanearon miles de artículos y seleccionaron solo los 90 que eran justos, tenían todos los ingredientes disponibles y podían ser calificados por una máquina.
  2. El Cortafuegos: Construyeron un "muro de cristal" alrededor de la IA. La IA puede ver los ingredientes y el objetivo, pero no puede ver las notas del chef original ni la salsa secreta utilizada en el plato ganador.
  3. El Contenedor: Cada tarea se coloca en su propia cocina pequeña, sellada y perfecta (un contenedor) para que la IA no pueda hacer trampa utilizando herramientas externas o internet.

La Competencia: ¿Cómo le fue a la IA?

Invitaron a 10 de los chefs de IA más inteligentes (como Claude Opus 4.7, GPT-5.5 y Gemini 3.5) para abordar estos 90 platos. Tenían una regla estricica: Prohibido buscar en Google. Tenían que resolverlo desde cero.

Los resultados fueron aleccionadores:

  • El Club de los "Suficientemente Buenos": Incluso la mejor IA solo logró igualar la receta original premiada aproximadamente el 48% de las veces.
  • El Club de los "Mejor que el Original": La IA solo logró crear un plato mejor que el original en apenas el 18% de los casos.
  • El Golpe de Realidad: El resto del tiempo (el 82%), la IA creó un plato peor que el original o no pudo terminarlo.

¿Cómo tuvieron éxito (y por qué fallaron)?

Los investigadores observaron de cerca cómo trabajaron los chefs de IA para comprender los resultados.

La Estrategia Ganadora: "El Truco de la Traducción"
Cuando la IA tenía éxito, usualmente no proponía un nuevo descubrimiento científico brillante. En su lugar, utilizaba un truco llamado Traducción Metodológica.

  • La Analogía: Imagina que la receta original era para un complejo suflé francés (un problema científico difícil). La IA no intentó hacer un suflé. En su lugar, miró los ingredientes y dijo: "¡Oye, esto parece una pizza que ya sé hacer!". Convirtió el difícil problema científico en un problema matemático simple y familiar que había visto un millón de veces antes.
  • El 45% de los éxitos ocurrieron porque la IA simplemente convirtió la ciencia en un juego estándar de "adivinar la respuesta". No inventó nueva ciencia; simplemente aplicó trucos viejos a datos nuevos.

La Estrategia Perdedora: "Herramientas Equivocadas y Falta de Tiempo"
Cuando la IA fallaba, no era usualmente porque no entendiera las instrucciones.

  • Herramienta Equivocada (45%): Eligió el "utensilio de cocina" incorrecto. Intentó usar una licuadora cuando necesitaba un batidor de mano. Eligió un método que era fundamentalmente erróneo para el tipo de problema.
  • Se acabó el Tiempo/Dinero (24%): La IA comenzó a cocinar pero se quedó sin el límite de 4 horas o el presupuesto de potencia informática necesario para terminar el plato.
  • Malentendido (Raro): Era muy raro que la IA simplemente no entendiera de qué se trataba el plato.

Los Niveles de Dificultad

No todos los platos eran igual de difíciles.

  • Los Platos Fáciles: Las tareas que involucraban "Razonamiento Relacional" (conectar puntos) y "Biología de Proteínas" fueron las más fáciles para la IA.
  • Los Platos Difíciles: "Modelado Físico" (simular la física) y "Diseño Molecular" fueron los más difíciles.
  • Los Platos "Frankenstein": Las tareas más difíciles de todas fueron aquellas que mezclaban dos campos diferentes (como mezclar biología y física). La IA tuvo dificultades para combinar conocimientos de diferentes "cocinas".

La Gran Conclusión

NatureBench nos dice que, si bien los agentes de codificación de IA están volviéndose muy buenos siguiendo instrucciones y corrigiendo errores, aún no son verdaderos inventores científicos.

Son excelentes tomando un problema científico complejo y diciendo: "¡Conozco un atajo para esto!". Pero aún no son buenos mirando un problema y diciendo: "Tengo una idea nueva que ningún humano ha pensado todavía".

El artículo concluye que, para que la IA realmente ayude a la ciencia, debemos dejar de pedirle simplemente que copie a los ganadores y empezar a enseñarle cómo elegir las herramientas adecuadas y pensar como un científico, no solo como un programador.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →