← Últimos artículos
🤖 AI

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

Este artículo presenta SciCodePile, un masivo corpus de código científico de 128 GB y un benchmark ejecutable de 200 tareas, para demostrar que los modelos de lenguaje extensos actuales tienen dificultades significativas con la generación de código científico, al tiempo que muestra que el entrenamiento con este conjunto de datos mejora sustancialmente su rendimiento.

Autores originales: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

Publicado 2026-07-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente cómo escribir código. Ya le has enseñado lo básico: cómo construir un sitio web sencillo, cómo hacer una calculadora o cómo organizar una lista de reproducción. Es bastante bueno en estas tareas "generales" porque ha leído millones de libros y sitios web sobre ellas. Pero ahora, quieres ver si este robot puede encargarse de las cosas realmente difíciles: escribir código para científicos. Estamos hablando de código que simula cómo se propaga un virus, calcula el plegamiento de una proteína o modela el comportamiento de los átomos en un nuevo fármaco. Este es "código científico". Es diferente al código normal porque no se trata solo de hacer que la computadora haga algo; se trata de asegurar que las matemáticas y la lógica de la computadora coincidan con las leyes reales, desordenadas y complejas de la naturaleza. Si el robot acierta la sintaxis pero se equivoca en la ciencia, el resultado no es solo un error de programación; es un experimento fallido o un cálculo peligroso. La gran pregunta es: ¿Pueden nuestros actuales robots de IA, que son excelentes escribiendo código estándar, realmente realizar el trabajo pesado para los científicos?

Entra SCICODEPILE, un nuevo y masivo proyecto que actúa como un gigantesco campo de entrenamiento especializado y un riguroso examen final para estos robots de IA. Los investigadores detrás de este artículo decidieron que, para probar realmente si la IA puede manejar la codificación científica, necesitaban dos cosas: una enorme biblioteca de código científico del mundo real para estudiar, y una prueba estricta donde el código realmente tenga que ejecutarse y funcionar, no solo verse bien en el papel.

Primero, construyeron la biblioteca. No se limitaron a agarrar código al azar; salieron a cazar 37,737 repositorios de código públicos en internet, buscando específicamente proyectos relacionados con la química, la biología, la física y otras ciencias. Filtraron la basura y terminaron con una colección masiva de 128 GB de código científico. Piensa en esto como una biblioteca que contiene cada manual de instrucciones, cada plano y cada fragmento de código de miles de laboratorios científicos reales. Organizaron esta biblioteca de cuatro formas diferentes: archivos de código bruto, resúmenes de lo que hacen los proyectos, instrucciones para funciones específicas y pares de problema-solución. Es como tomar un garaje desordenado lleno de piezas de coche y organizarlo en un museo perfectamente etiquetado donde puedes ver el motor, el manual y un diagrama de cómo encajan las piezas, todo al mismo tiempo.

Después, construyeron el examen. Crearon un banco de pruebas de 200 tareas. Pero aquí está el truco: no solo le pidieron a la IA que escribiera código y verificara si se parecía a la respuesta de un humano. Pusieron el código de la IA en un "sandbox" —un patio de juegos digital seguro y aislado— y lo ejecutaron. Si el código fallaba, daba un número incorrecto o no superaba una prueba, era un fallo. Era una prueba de aprobado/suspenso basada en si el código realmente funcionaba.

Entonces, ¿cómo les fue a los robots? Los resultados fueron un poco un golpe de realidad. Incluso los modelos de IA más inteligentes, los que suelen sacar notas excelentes en las pruebas de programación, tuvieron serias dificultades con el material científico. En las tareas de estilo "completar el espacio en blanco", los mejores modelos solo alcanzaron aproximadamente el 38% de la puntuación perfecta. Pero en el examen de "haz que funcione", las cifras fueron aún más contundentes. El mejor modelo logró pasar solo el 12.30% de las veces. Eso significa que, por cada 100 problemas de codificación científica, la IA se equivocó en 88. Sugiere que, si bien la IA se está volviendo buena escribiendo código que parece correcto, todavía está muy lejos de escribir código que sea científicamente fiable.

Los investigadores también demostraron que esta nueva biblioteca es, de hecho, útil para enseñar a los robots. Cuando tomaron un modelo de IA más pequeño y le permitieron estudiar su biblioteca de 128 GB, su rendimiento aumentó significamente. Es como darle a un estudiante una pila de libros de texto en lugar de solo unas pocas fichas de estudio; de repente, entienden mucho mejor el material.

En resumen, SCICODEPILE es una nueva y masiva herramienta que dice: "Oye, IA, eres buena programando, pero aún no estás lista para ser científica". Proporciona los recursos para entrenarlos mejor y las pruebas estrictas para ver si realmente han aprendido. Es una llamada de atención de que, si bien estamos haciendo grandes progresos, todavía hay una brecha enorme entre un robot que puede escribir código y un robot que puede hacer ciencia real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →