← Últimos artículos
🔬 materials science

BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models

Este artículo presenta BOOM, el primer referente de código abierto con información química para evaluar sistemáticamente la generalización fuera de la distribución (OOD) en la predicción de propiedades moleculares, revelando que los modelos actuales de aprendizaje automático tienen dificultades para extrapolar más allá de sus datos de entrenamiento y destacando la necesidad de nuevos enfoques para lograr un rendimiento robusto en OOD.

Autores originales: Evan R. Antoniuk, Shehtab Zaman, Tal Ben-Nun, Peggy Li, James Diffenderfer, Busra Sahin, Obadiah Smolenski, Everett Grethel, Tim Hsu, Anna M. Hiszpanski, Kenneth Chiu, Bhavya Kailkhura, Brian Van Esse
Publicado 2026-09-17
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Evan R. Antoniuk, Shehtab Zaman, Tal Ben-Nun, Peggy Li, James Diffenderfer, Busra Sahin, Obadiah Smolenski, Everett Grethel, Tim Hsu, Anna M. Hiszpanski, Kenneth Chiu, Bhavya Kailkhura, Brian Van Essen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La búsqueda de nuevos medicamentos y materiales a menudo comienza con una pregunta simple y desalentadora: ¿cuál de los miles de millones de posibles estructuras químicas funcionará realmente? Durante décadas, los científicos han dependido del ensayo y error, pero una nueva ola de inteligencia artificial promete acelerar este proceso al predecir cómo se comportará una molécula antes de que sea construida. Estos modelos informáticos se entrenan con vastas bibliotecas de productos químicos conocidos, aprendiendo a reconocer patrones que vinculan la forma de una molécula con sus propiedades, como qué tan bien se disuelve en agua o cuánta energía libera al quemarse. La esperanza es que estos modelos puedan entonces observar una molécula completamente nueva y no vista, y adivinar con precisión su comportamiento, permitiendo efectivamente a los investigadores diseñar el futuro de la química en una pantalla de computadora.

Sin embargo, hay un inconveniente significativo. La mayoría de estos modelos de IA son excelentes reconociendo patrones dentro de los datos con los que fueron enseñados, pero suelen tropezar cuando se les pide predecir las propiedades de moléculas que son verdaderamente diferentes de cualquier cosa en su biblioteca de entrenamiento. En el mundo del aprendizaje automático, esto se conoce como el problema de la "fuera de la distribución" (out-of-distribution). Es la diferencia entre un estudiante que memoriza las respuestas de un examen de práctica y uno que realmente puede resolver un problema nuevo e inesperado. Si un modelo no puede generalizar más allá de sus datos de entrenamiento, se convierte en una herramienta para confirmar lo que ya sabemos, en lugar de una herramienta para descubrir lo desconocido. Esta limitación es un gran cuello de botella para la próxima generación de descubrimiento de fármcos y ciencia de materiales, donde el objetivo es encontrar moléculas que superen los límites de lo que es posible actualmente.

Un equipo de investigadores del Laboratorio Nacional Lawrence Livermore y la Universidad de Binghamton ha analizado a fondo este problema con un nuevo referente llamado BOOM. En lugar de simplemente probar qué tan bien se desempeñan los modelos con datos familiares, diseñaron un conjunto riguroso de pruebas específicamente para ver si estos sistemas de inteligencia artificial pueden manejar lo unfamiliar (lo desconocido). Reunieron diez conjuntos de datos diferentes que contenían miles de moléculas, que iban desde compuestos orgánicos pequeños hasta estructuras complejas con propiedades electrónicas específicas. Para cada conjunto de datos, separaron cuidadosamente las moléculas en tres grupos: un conjunto de entrenamiento, un conjunto de prueba estándar de moléculas familiares y un conjunto de prueba especial "fuera de la distribución". Este grupo especial consistía en moléculas con propiedades extremas: valores tan altos o tan bajos que rara vez aparecen en los datos de entrenamiento. Los investigadores luego sometieron a quince modelos diferentes de aprendizaje automático a la prueba, pidiéndoles a cada uno que predijera las propiedades de estas moléculas extremas.

Los resultados fueron desalentadores. A pesar de las impresionantes capacidades de la inteligencia artificial moderna, el estudio encontró que ningún modelo individual podía predecir consistentemente las propiedades de estas moléculas extremas en todas las tareas. Incluso los modelos con mejor desempeño cometieron errores en estos casos difíciles y no vistos que fueron tres veces mayores que sus errores en datos familiares. Los investigadores observaron un modo de falla común: los modelos eran buenos agrupando moléculas similares, pero fallaban al extender sus predicciones hacia el territorio desconocido. En lugar de adivinar un valor que fuera verdaderamente externo al rango de lo que habían visto, los modelos tendían a comprimir sus predicciones, atrayendo los valores extremos de vuelta hacia el promedio. Este comportamiento sugiere que los modelos están aprendiendo atajos que funcionan bien para los datos estándar, pero que se rompen cuando se enfrentan a la verdadera novedad requerida para el descubrimiento científico.

El equipo también investigó por qué estos modelos tenían dificultades y probó varias estrategias comunes para solucionar el problema. Examinaron si el preentrenamiento de los modelos en conjuntos de datos masivos de miles de millones de moléculas —una técnica que ha revolucionado los modelos de lenguaje— ayudaría. Sorprendentemente, encontraron que, si bien este preentrenamiento hacía que los modelos fueran mejores para manejar datos familiares, no mejoraba su capacidad para predecir valores extremos. De hecho, para algunos modelos, el preentrenamiento hizo que el desempeño fuera peor en la distribución fuera de la normalidad. También probaron si simplemente añadir más datos al conjunto de entrenamiento ayudaría. Aunque incluir un pequeño número de ejemplos extremos mejoró el desempeño para algunas propiedades, no fue una cura universal. El estudio sugiere que la forma en que estos modelos se construyen actualmente, particularmente su dependencia de representaciones basadas en texto de las moléculas, puede estar limitando fundamentalmente su capacidad para comprender las leyes físicas profundas que gobiernan el comportamiento químico.

Uno de los hallazgos más reveladores fue que el tipo de representación de los datos importaba más que el tamaño del modelo. Los modelos que utilizaban información geométrica tridimensional sobre los átomos y sus posiciones funcionaron significativamente mejor que aquellos que dependían de cadenas de texto lineales, que son como nombres químicos escritos en una secuencia. Los modelos tridimensionales, que respetan las simetrías físicas del espacio, pudieron generalizar mucho mejor a los casos extremos. Esto señala un camino claro a seguir: para construir una IA que realmente pueda descubrir nueva química, los modelos deben estar fundamentados en la realidad física de cómo se mueven e interactúan los átomos, en lugar de solo en los patrones de cómo se describen en texto. Los investigadores concluyeron que lograr un fuerte desempeño en estas tareas difíciles probablemente requerirá una combinación de conjuntos de datos más grandes y diversos y modelos que comprendan explícitamente la estructura electrónica de las moléculas.

El benchmark BOOM sirve como un baño de realidad para el campo, mostrando que la generación actual de IA química, aunque poderosa, aún no está lista para navegar de manera confiable lo desconocido. El estudio no afirma que el problema sea irresoluble, pero sí descarta la idea de que simplemente escalar los modelos existentes o usar técnicas de preentrenamiento estándar será suficiente para resolverlo. En cambio, destaca que la próxima frontera en el aprendizaje automático químico requiere un cambio en cómo se diseñan estos sistemas. Al proporcionar una forma estandarizada de probar esta debilidad específica, los investigadores esperan guiar a la comunidad hacia la construcción de modelos que no sean solo buenos recordando el pasado, sino que sean verdaderamente capaces de imaginar el futuro. El camino para descubrir la próxima generación de medicamentos vitales y materiales avanzados puede depender de la resolución de este rompecabezas específico de la generalización.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →