From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications
Este artículo aboga por la adopción de "diagramas como código" en las publicaciones científicas para eliminar la ambigüedad interpretativa, permitiendo así transferencias de información fiables entre científicos, modelos de lenguaje de gran tamaño y agentes de IA autónomos para el futuro descubrimiento científico.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La ciencia siempre ha dependido de dos lenguajes para compartir sus descubrimientos: la palabra escrita y la imagen. Un investigador puede describir un proceso biológico complejo en un párrafo de texto, o ilustrarlo con un diagrama que muestre cómo interactúan las diferentes partes de una célula. Durante décadas, estos métodos han servido bien a los lectores humanos, permitiendo que los científicos construyan sobre el trabajo de otros. Sin embargo, tanto el lenguaje como las imágenes poseen un fallo oculto: están sujetos a la interpretación. Una oración puede leerse de formas ligeramente distintas según la formación del lector, y un dibujo puede entenderse de manera diferente según cómo el espectador interprete las formas y las flechas. Esta ambigüedad es manejable para los humanos, pero crea un problema significativo para la nueva generación de sistemas de inteligencia artificial diseñados para leer literatura científica y realizar descubrimientos por su cuenta. Estos sistemas, conocidos como agentes de IA, necesitan información que sea precisa e inequívoca, que no deje lugar a la conjetura. Si una IA malinterpreta un diagrama o una descripción, puede cometer errores que repercutan en su trabajo, conduciendo a conclusiones incorrectas.
En un estudio reciente, los investigadores Mila Glavaški y Lazar Velicki, de la Universidad de Novi Sad en Serbia, propusieron una solución a este problema. Sugieren que los artículos científicos deberían incluir "diagramas como código". En lugar de simplemente subir un archivo de imagen estático, los autores proporcionarían el código informático real utilizado para generar esa imagen. Este código actúa como un conjunto de instrucciones matemáticas estrictas que le dice a una computadora exactamente cómo dibujar cada línea, forma y conexión. Debido a que el código es un lenguaje de lógica en lugar de arte, elimina la conjetura. Cuando una computadora lee el código, ve exactamente la misma estructura que el autor pretendía, sin variación en el significado. Los investigadores probaron esta idea tomando tres tipos comunes de contenido científico sobre la insuficiencia cardíaca —descripciones textuales de causas, explicaciones de mecanismos biológicos y vías clínicas para la atención al paciente— y convirtiéndolos a este formato de código. Encontraron que el enfoque funciona, creando un puente que permite tanto a los científicos humanos como a los agentes de IA comprender los procesos científicos con total claridad.
Los investigadores comenzaron analizando cómo se comparte actualmente la información científica. Observaron que, si bien el lenguaje natural permite una variedad infinita de expresión, también permite una variedad infinita de interpretación. Un científico podría escribir que una afección cardíaca es causada por la presión arterial alta, mientras que otro podría describirla como resultado de un daño en las válvulas. Ambos son ciertos, pero la redacción específica puede llevar a una IA a perder la conexión entre ambos. Del mismo modo, un diagrama visual podría mostrar flechas conectando diferentes partes de un sistema, pero sin una definición estricta, una IA podría no saber si esas flechas representan una causa, un efecto secundario o una simple asociación. El objetivo del desarrollo de la IA moderna es crear sistemas que puedan realizar descubrimientos científicos de forma autónoma, actuando como investigadores independientes que pueden leer miles de artículos y sintetizar nuevo conocimiento. Para lograr esto, estos agentes de IA necesitan pasarse información entre sí con perfecta exactitud. Si un agente transfiere una tarea a otro basándose en un diagrama malinterpretado, toda la cadena de investigación puede fallar.
Para probar su idea, Glavaški y Velicki seleccionaron tres ejemplos distintos del campo de la cardiología, el estudio del corazón. El primer ejemplo fue un párrafo que describía las diversas formas en que se desarrolla la insuficiencia cardíaca, enumerando causas como la lesión isquémica, la sobrecarga de presión y la enfermedad metabólica. El segundo fue una definición de la insuficiencia cardíaca como un síndrome clínico, detallando cómo los problemas estructurales en el corazón conducen a síntomas. El tercero fue una guía paso a paso para médicos sobre cómo evaluar a un paciente con sospecha de insuficiencia cardíaca, cubriendo desde la historia médica hasta los exámenes físicos. Junto a estos textos, utilizaron tres diagramas correspondientes que representaban visualmente estos mismos conceptos. Estos insumos sirvieron como la materia prima para su experimento.
Posteriormente, el equipo utilizó una versión gratuita de un modelo de lenguaje de gran tamaño, un tipo de chatbot de IA, para convertir estos insumos en código. Pidieron a la IA que generara código para dos herramientas de diagramación diferentes, Mermaid y D2, que son programas que transforman instrucciones de texto en gráficos visuales. Para las descripciones textuales, el prompt fue simple: "Crea código para un diagrama de Mermaid para esto". Para las imágenes existentes, el prompt fue ligeramente más específico: "Crea código para un diagrama de Mermaid para esta figura. No añadas nada por tu cuenta". Los investigadores querían ver si la IA podía observar un párrafo de texto o una imagen estática y traducirlo en un conjunto de instrucciones lógicas que otra computadora pudiera leer.
Los resultados demostraron que el enfoque era factible. Para cada descripción textual y cada imagen que probaron, la IA generó con éxito el código que, al ejecutarse a través de un editor estándar, producía un diagrama que coincidía con el significado original. Para el texto sobre los mecanismos compartidos de la insufencia cardíaca, el código creó un diagrama de flujo que muestra cómo diferentes vías conducen al mismo resultado. Para el texto que definía la enfermedad, el código produjo un diagrama vinculando diversas causas con la condición. Para la vía clínica, el código trazó los pasos que un médico debe seguir, desde la primera visita hasta el examen físico. Los investigadores también convirtieron las imágenes estáticas originales en código mediante la instrucción a la IA de generar código basado en las figuras. La IA logró producir instrucciones de código que, al ser renderizadas, recreaban la estructura visual de los mecanismos moleculares, la cascada fisiopatológica y la vía clínica.
Una vez generado el código, los investigadores no lo aceptaron ciegamente. Verificaron manualmente la salida en los editores en línea de Mermaid y D2. Encontraron que, si bien la IA acertaba la estructura general, a veces necesitaba ajustes menores. Por ejemplo, la dirección de una flecha podía necesitar ser invertida, o una conexión entre dos bloques podía necesitar ser movida a un lugar distinto para reflear la ciencia con precisión. Estas pequeñas ediciones fueron necesarias para asegurar que el código reflejara perfectamente la representación pretendida. Sin embargo, el hecho de que la estructura central pudiera generarse automáticamente fue el hallazgo clave. El código servía como el registro inmutable y preciso de la información, mientras que el diagrama visual era simplemente una forma para que los humanos confirmaran que el código era correcto.
Los investigadores enfatizan que este método no reemplaza la necesidad de la supervisión humana. Si una IA genera código basado en una alucinación —un hecho falso que la IA inventa—, el diagrama resultante será erróneo. Sin embargo, el sistema que proponen incluye una verificación integrada. Debido a que el código es legible por humanos y puede renderizarse instantáneamente, un científico puede mirar el diagrama generado y ver inmediatamente si coincide con el texto o la imagen original. Si no es así, puede corregir el código. Este proceso asegura que la representación final sea precisa. El estudio sugiere que, en el futuro, los artículos científicos podrían incluir estos fragmentos de código junto al texto y las imágenes tradicionales. Esto permitiría que los agentes de IA lean el artículo y extraigan la lógica exacta de la investigación sin malinterpretar las pistas visuales o textuales.
Las implicaciones de este trabajo se extienden más allá de la insuficiencia cardíaca. Los investigadores argumentan que este enfoque podría aplicarse a cualquier campo científico donde se describan procesos. Ya sea el flujo de sustancias químicas en un laboratorio, los pasos en un tratamiento médico o las conexiones en un sistema ecológico, representar estos procesos como código los haría universalmente comprensibles. Permitiría que un científico humano entregara un proyecto a un agente de IA, y que ese agente lo pasara a otro, con la garantía de que el significado del trabajo permanezca inalterado en cada paso. El código actúa como un traductor universal, eliminando la ambigüedad del lenguaje natural y la subjetividad de las imágenes estáticas.
En su discusión, los autores reconocen que este método tiene límites. Solo puede representar lo que ya se conoce. Si un proceso científico involucra elementos o relaciones desconocidas que aún no han sido descubiertas, esos vacíos no pueden ser llenados por el código. Además, la calidad del código depende de la calidad de la IA que lo genera. El uso de prompts más complejos podría ofrecer mejores resultados, pero los investigadores demostraron que incluso con instrucciones simples, el sistema funciona lo suficientemente bien como para ser útil. También señalaron que, aunque utilizaron Mermaid y D2, otras herramientas como PlantUML o Graphviz podrían servir al mismo propósito. La herramienta específica importa menos que el concepto de tener una representación basada en código.
El estudio concluye que ha llegado el momento de estandarizar cómo se comparte la información científica en la era de la IA. Al adoptar los diagramas como código, la comunidad científica puede asegurar que el conocimiento que producen no solo sea legible para los humanos, sino también ejecutable por las máquinas. Este cambio transformaría la literatura científica de una colección de documentos estáticos en un recurso dinámico y legible por máquinas. Permitiría una transferencia fluida de conocimiento entre los investigadores humanos y la inteligencia artificial, allanando el camino para un futuro donde los agentes de IA puedan colaborar con los científicos para resolver problemas complejos con un nivel de precisión que antes era imposible. Los investigadores demostraron que esto no es solo una idea teórica, sino una realidad práctica que puede implementarse hoy mismo con las herramientas existentes.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.