← Últimos artículos
📄 chemistry

JURY: A Comprehensive Training-Free to Fully-Supervised Framework for Evaluating Chemical Language Models

El artículo presenta JURY, un marco integral que utiliza cuatro sondas distintas, que van desde métodos libres de entrenamiento hasta métodos totalmente supervisados, para evaluar rigurosamente los modelos de lenguaje químico, revelando que sus verdaderas capacidades de codificación química suelen estar oscurecidas por potentes cabezales de predicción y son más comparables a las huellas dactilares tradicionales de lo que se pensaba anteriormente.

Autores originales: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

Publicado 2026-08-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En la carrera por descubrir nuevos medicamentos, los científicos se enfrentan a un cuello de botella que ralentiza cada avance: antes de que un nuevo compuesto químico pueda convertirse en un fármaco, debe pasar por una rigurosa serie de controles de seguridad. Los investigadores necesitan saber si el cuerpo lo absorberá, cómo viajará a través de la sangre, si el hígado lo descompondrá y si podría ser tóxico. Estos controles, conocidos como absorción, distribución, metabolismo, excreción y toxicidad, son costosos y lentos de realizar en un laboratorio. Para acelerar este proceso, los científicos han recurrido a las computadoras, utilizando la inteligencia artificial para predecir estas propiedades simplemente observando la estructura de una molécula. Durante años, las herramientas más exitosas han sido los "modelos de lenguaje" entrenados con millones de fórmulas químicas escritas como cadenas de texto. Estos modelos aprenden a comprimir una molécula compleja en una lista única y fija de números, una huella digital que captura su esencia química. La forma estándar de juzgar qué tan buenos son estos modelos ha sido adjuntarles una herramienta de predicción simple, entrenar esa herramienta con un pequeño conjunto de datos experimentales y ver qué tan bien adivina la respuesta. Si la suposición es buena, el modelo recibe una puntuación alta.

Sin embargo, un nuevo estudio sugiere que este método estándar ha estado ocultando una verdad crucial. Los investigadores descubrieron que la propia herramienta de predicción a menudo realiza gran parte del trabajo pesado, lo que enmascara lo que el modelo subyacente realmente aprendió. Una herramienta poderosa puede aprender mucho solo de las respuestas que se le dan, incluso si la huella digital que está leyendo es débil o poco útil. Para resolver esto, un equipo de investigadores de Alemania desarrolló una nueva forma de probar estos modelos, llamada JURY. En lugar de depender de una única herramienta entrenada, utilizaron cuatro métodos diferentes para leer las huellas digitales de los modelos. Dos de estos métodos no requerían entrenamiento alguno, simplemente observando qué tan cerca se encuentran las moléculas entre sí en el espacio digital. Los otros dos métodos utilizaron un entrenamiento simple, que variaba desde un cálculo lineal básico hasta una red pequeña y flexible. Al aplicar estos cuatro métodos a diez modelos químicos diferentes a través de setenta y tres pruebas de seguridad distintas, el equipo descubió que los modelos son mucho más similares entre sí de lo que nadie imaginaba. Ningún modelo era el mejor en todo. De hecho, un método artesanal creado hace décadas para describir moléculas funcionó igual de bien que la IA más avanzada en muchos casos.

El descubrimiento más sorprendente fue que los modelos no difieren en cuánto conocimiento químico poseen, sino en cómo organizan ese conocimiento. Algunos modelos disponen sus huellas digitales de modo que las moléculas con propiedades similares se sitúan naturalmente cerca, lo que las hace fáciles de encontrar sin ningún entrenamiento adicional. Otros modelos esconden ese mismo conocimiento químico de una manera que solo es visible después de que se entrena un predictor para reorganizar los datos. Es como mirar una biblioteca donde un bibliotecario ya ha clasificado los libros por género, mientras que otro los ha apilado al azar pero sabe exactamente dónde encontrar un libro específico si se le hace la pregunta adecuada. El estudio mostró que un modelo que sobresale en el primer enfoque puede fallar en el segundo, y viceversa. Esto significa que una sola puntuación no puede decirte si un modelo es bueno; debes observar su perfil a través de diferentes métodos de prueba para entender dónde residen sus fortalezas.

Los investigadores probaron diez modelos de lenguaje químico diferentes, incluyendo varios que utilizan tres familias de transformadores distintas, junto con un método tradicional artesanal conocido como huella digital de conectividad extendida. Aplicaron sus cuatro métodos de prueba a setenta y tres tareas diferentes, que cubrían desde cómo se absorbe un fármaco hasta qué tan tóxico podría ser. Cuando analizaron los resultados, descubrieron que la clasificación de los modelos cambiaba completamente dependiendo de qué método de prueba se utilizara. Un modelo que ocupaba el primer lugar cuando se probaba con un método que no requería entrenamiento, a menudo caía al fondo de la lista cuando se probaba con un método que implicaba el entrenamiento de un predictor. Por el contrario, un modelo que tenía dificultades sin entrenamiento subía a la cima una vez que se añadía un predictor simple. Esta inconsistencia demostró que los modelos no eran simplemente "mejores" o "peores", sino que almacenaban su conocimiento químico de formas fundamentalmente distintas.

Un modelo, llamado MoLFormer-XL, demostró que había organizado su espacio digital de forma tan clara que las moléculas con comportamientos similares ya estaban agrupadas. Funcionó excepcionalmente bien cuando los investigadores simplemente observaron los vecinos más cercanos en el espacio digital, sin entrenar ninguna herramienta adicional. En contraste, otro modelo, MolEncoder, funcionó mal cuando los investigadores observaron la disposición bruta del espacio. Sin embargo, una vez que se entrenó un predictor simple en sus datos, MolEncoder saltó a la cima de las clasificaciones. Esto demostró que MolEncoder poseía la misma cantidad de conocimiento químico, pero estaba oculto en un formato que requería una herramienta entrenada para desbloquearlo. El estudio también encontró que el método de huella digital tradicional y artesanal, que precede a la IA moderna, a menudo superó a los modelos más avanzados cuando no se permitía el entrenamiento, particularmente al predecir cómo se comportan las sustancias químicas en el cuerpo. Esto sugiere que, para ciertas tareas, la forma antigua de organizar los datos químicos sigue siendo altamente efectiva.

El equipo concluyó que el campo ha estado dependiendo de un solo número para juzgar sistemas complejos, lo cual es como juzgar a un músico por solo una canción. Un modelo puede ser excelente para un tipo de predicción pero terrible para otro, dependiendo de cómo esté estructurada su información interna. El nuevo marco, JURY, reemplaza esa puntuación única con un perfil detallado que muestra cómo se desempeña un modelo a través de diferentes niveles de supervisión. Esto permite a los científicos elegir la herramienta adecuada para el trabajo. Si un investigador necesita realizar un cribado rápido de una biblioteca de productos químicos sin gastar tiempo entrenando una nueva herramienta, debe elegir un modelo que funcione bien en las pruebas sin entrenamiento. Si tiene abundantes datos y desea entrenar un predictor específico para una tarea de alto riesgo, puede elegir un modelo que destaque solo después del entrenamiento. Al comprender dónde reside el conocimiento de un modelo y cómo está organizado, los científicos pueden tomar mejores decisiones sobre qué herramientas utilizar, yendo más allá de las simples clasificaciones hacia una comprensión más profunda de lo que estas inteligencias artificiales han aprendido realmente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →