← Últimos artículos
🤖 machine learning

Molecular Representations for Large Language Models

Este artículo presenta MolJSON, una representación molecular novedosa que supera sistemáticamente a formatos tradicionales como SMILES y nombres IUPAC en diversas tareas de razonamiento cuando se utiliza con modelos de lenguaje grandes, demostrando que los esquemas explícitos de grafos moleculares mejoran significativamente el rendimiento de los LLM en química.

Autores originales: Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane

Publicado 2026-05-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot brillante pero literal cómo entender y dibujar estructuras tridimensionales complejas, como una molécula. El problema no es que el robot sea tonto; es que le estás hablando en el idioma incorrecto.

Este artículo trata sobre encontrar el "dialecto" adecuado para los Modelos de Lenguaje Grande (LLM) para que hablen sobre química.

El Problema: Hablar "Químico" vs. Hablar "Robot"

Durante décadas, los químicos han utilizado dos formas principales de escribir moléculas en una computadora:

  1. SMILES: Piensa en esto como una larga y confusa cadena de texto que describe una molécula "caminando" a través de ella. Es como describir una casa diciendo: "Comienza en la puerta principal, gira a la izquierda, sube las escaleras, gira a la derecha y estás en la cocina". Si te saltas un paso o te equivocas en el orden, toda la descripción se desmorona.
  2. Nombres IUPAC: Son los nombres oficiales, legibles por humanos (como "ácido etanoico"). Son como leer un contrato legal complejo para describir una casa. Son precisos para los humanos pero muy difíciles de analizar para un robot porque las reglas son increíblemente estrictas y las oraciones son largas.

Los investigadores descubrieron que cuando pedían a los modelos de IA leer o escribir moléculas usando estos formatos antiguos, los modelos cometían muchos errores. Era como pedirle a un robot que construyera un castillo de Lego basado en un párrafo de instrucciones escritas en un idioma extranjero; a menudo construía la cosa equivocada o se confundía.

La Solución: Introduciendo "MolJSON"

Los autores crearon un nuevo formato llamado MolJSON.

Piensa en MolJSON no como una historia o un conjunto de instrucciones, sino como un plano o una lista de piezas.

  • En lugar de decir "camina desde el punto A hasta el punto B", MolJSON dice: "Aquí tienes una lista de todos los ladrillos (átomos) y aquí tienes una lista de exactamente qué ladrillos están pegados entre sí (enlaces)".
  • Se parece a una lista estructurada (JSON) que a las computadoras les encanta. Enumera explícitamente cada pieza y cómo se conectan, sin obligar a la IA a "caminar" a través de la molécula ni descifrar reglas gramaticales complejas.

El Experimento: La Prueba de Traducción

Para ver si este nuevo idioma funcionaba mejor, los investigadores establecieron tres tipos de pruebas con diferentes modelos de IA (como GPT-5 y Claude):

  1. La Prueba del Traductor: Dale a la IA una molécula en un formato (como una cadena SMILES) y pídele que la reescriba en otro formato.

    • Resultado: Cuando la IA tenía que generar el nuevo formato como MolJSON, fue correcta aproximadamente el 71% de las veces. Cuando tenía que generar SMILES o nombres IUPAC, solo fue correcta aproximadamente el 43% de las veces. La IA simplemente no podía "hablar" bien los idiomas antiguos.
  2. La Prueba del Laberinto (Camino Más Corto): Dale a la IA una molécula y pregunta: "¿Cuántos enlaces hay entre este átomo de Flúor y ese átomo de Cloro?"

    • Resultado: Con MolJSON, la IA lo acertó el 98.5% de las veces. Con SMILES, fue el 92%, y con nombres IUPAC, bajó al 82%.
    • Bonus: La IA también utilizó menos "tokens cerebrales" (potencia de computación) para resolver el laberinto cuando se le dio el plano MolJSON. No tuvo que desperdiciar energía tratando de entender la estructura primero.
  3. La Prueba del Constructor (Generación Restringida): Pide a la IA que "Construya una molécula que tenga un Flúor, un Cloro y dos anillos".

    • Resultado: Cuando se permitió a la IA generar la respuesta en MolJSON, tuvo éxito el 95% de las veces. Cuando se la obligó a generar una cadena SMILES, solo tuvo éxito el 64% de las veces.

¿Por qué Ganó MolJSON?

El artículo sugiere que SMILES y los nombres IUPAC obligan a la IA a hacer dos cosas difíciles a la vez:

  1. Descifrar la estructura: Tiene que averiguar cómo se ve la molécula a partir del texto.
  2. Recodificar la estructura: Tiene que convertir esa imagen mental de nuevo en un formato de texto estricto.

MolJSON omite la parte difícil. Le da a la IA la estructura directamente (los átomos y los enlaces) y le permite generar la estructura directamente. Es como darle al robot una caja de ladrillos de Lego y una foto del castillo final, en lugar de un párrafo de texto describiendo cómo construirlo.

La Conclusión

Los investigadores descubrieron que la elección de cómo representar una molécula importa tanto como la inteligencia de la IA misma. Aunque los modelos de IA fueron entrenados con millones de cadenas SMILES y nombres IUPAC, funcionaron significativamente mejor al usar este nuevo formato estructurado de "plano" (MolJSON).

En resumen: Si quieres que la IA haga química, deja de hablarle en acertijos químicos (SMILES/IUPAC) y empieza a hablarle en planos claros y estructurados (MolJSON).

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →