← Últimos artículos
🤖 AI

COMPOSITE-Stem

Este trabajo presenta COMPOSITE-STEM, un nuevo benchmark de 70 tareas expertas en ciencias y matemáticas diseñado para evaluar y superar las limitaciones actuales de los agentes de IA en la aceleración del descubrimiento científico.

Autores originales: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wol
Publicado 2026-04-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kyle Waters, Lucas Nuzzi, Tadhg Looram, Alessandro Tomasiello, Ariel Ghislain Kemogne Kamdoum, Bikun Li, Damien Sileo, Egor Kretov, Francesco Fournier-Facio, Georgios Soloupis, Haile Kassahun, Hew Wolff, Jiaqi Cai, Lianghui Li, Marc Roth, Mohinder Naiya, Naixu Guo, Qicheng Tang, Richard Wheeler, Samuele Sala, Serguei Popov, Steven Dillman, Yuqi Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que el mundo de la Inteligencia Artificial (IA) es como una escuela de superhéroes en entrenamiento. Durante años, hemos estado poniendo a estos "superhéroes" (los modelos de IA) a resolver exámenes de opción múltiple muy difíciles, como si fueran preguntas de un concurso de cultura general. Pero, ¿y si en la vida real, los científicos no hacen exámenes de opción múltiple? ¿Y si necesitan construir un laboratorio, analizar una foto de un microscopio y escribir un código para descubrir una cura?

Aquí es donde entra COMPOSITE-STEM, un nuevo "campo de entrenamiento" creado por un equipo de expertos llamado PortexAI.

Aquí tienes la explicación sencilla, con algunas analogías para que todo quede claro:

1. El Problema: Los exámenes ya no sirven

Imagina que entrenas a un atleta solo para saltar una valla de 1 metro. Al principio, es difícil. Pero pronto, el atleta salta 1 metro sin esfuerzo. Luego, saltas 1.5 metros. El atleta sigue mejorando.
El problema es que muchos de los "exámenes" actuales para la IA son como esas vallas bajas: la IA ya los ha memorizado o es tan buena que los resuelve casi siempre. Además, en la vida real, un científico no elige entre "A, B, C o D"; tiene que crear su propia solución desde cero.

2. La Solución: COMPOSITE-STEM (El "Olimpiada de la Ciencia Real")

Los autores crearon un nuevo desafío con 70 misiones reales en cuatro áreas: Física, Biología, Química y Matemáticas.

  • No son preguntas de libro de texto: Son como si le dieras a un estudiante de doctorado un problema real y le dijeras: "Tienes una computadora, tienes acceso a internet y tienes herramientas de laboratorio digitales. Resuelve esto".
  • El entorno: La IA no solo habla; tiene que "entrar" en una computadora virtual (un laboratorio digital), instalar programas, leer archivos de imágenes (como radiografías) y escribir código. Es como si le dieras a la IA un maletín de herramientas y le dijeras: "Arregla esto".

3. ¿Cómo se califica? (El Jurado Humano vs. El Jurado Robot)

En los exámenes antiguos, si la respuesta no era exactamente la misma palabra que el profesor tenía en mente, era un "suspenso". Eso es como si un chef hiciera un pastel delicioso, pero el juez lo rechazara porque puso 10 gramos de azúcar en lugar de 12.

En COMPOSITE-STEM, usan un sistema más inteligente llamado "AsymmetryZero":

  • El Jurado: No es una sola persona, sino un "jurado" de 5 IAs muy avanzadas que actúan como jueces expertos.
  • La Rúbrica: En lugar de buscar una palabra exacta, los expertos humanos crearon una lista de criterios (como una receta). Por ejemplo: "¿Identificó la molécula correcta? ¿Usó la herramienta adecuada? ¿El razonamiento tiene sentido?".
  • El resultado: Si la IA hace un buen trabajo pero no es perfecto, recibe puntos parciales. Es como un juez de gimnasia que da puntos por la dificultad, la ejecución y la belleza, no solo por si cayó de pie.

4. Los Resultados: ¡La IA aún tiene mucho que aprender!

Pusieron a prueba a 4 de las IAs más potentes del mundo (como Claude, Gemini, GPT y Grok).

  • La sorpresa: ¡Ninguna de ellas aprobó la mayoría de las pruebas! La mejor de todas (Claude Opus 4.6) solo aprobó el 21% de las misiones.
  • La analogía: Imagina que le das a un genio matemático un problema de física cuántica y un microscopio electrónico. Si solo logra resolver 2 de cada 10 problemas, significa que aún no está listo para trabajar en un laboratorio real sin supervisión humana.
  • Por qué fallaron:
    • Algunas IAs se rindieron rápido (no intentaron instalar las herramientas necesarias).
    • Otras intentaron hacer trucos caseros en lugar de usar las herramientas profesionales (como intentar calcular una molécula con la mano en lugar de usar un software de química).
    • Las IAs más fuertes fueron las que más "persistencia" tuvieron: intentaron instalar programas, leyeron los archivos de imagen y no se rindieron ante el primer error.

5. ¿Por qué es importante esto?

Este documento es como un mapa de la realidad. Nos dice: "Oye, la IA es genial, pero todavía no podemos confiarle la llave del laboratorio científico sin supervisión".

Al hacer público este conjunto de pruebas (las 70 misiones), los investigadores de todo el mundo pueden usarlas para entrenar a sus IAs y ver si realmente están mejorando. Es como abrir las puertas del gimnasio para que todos vean cuánto falta para que el atleta sea un campeón olímpico.

En resumen:
COMPOSITE-STEM es un examen de "mundo real" para la Inteligencia Artificial, donde no basta con saber teoría, hay que saber usar herramientas, leer imágenes y resolver problemas complejos paso a paso. Y la lección principal es que, aunque la IA avanza rápido, todavía tiene un largo camino por recorrer antes de ser una verdadera compañera de investigación científica.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →