From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications
Este artigo defende a adoção de "diagramas como código" em publicações científicas para eliminar a ambiguidade interpretativa, permitindo, assim, transferências de informações confiáveis entre cientistas, grandes modelos de linguagem e agentes de IA autônomos para a futura descoberta científica.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A ciência sempre dependeu de duas linguagens para compartilhar suas descobertas: a palavra escrita e a imagem. Um pesquisador pode descrever um processo biológico complexo em um parágrafo de texto ou ilustrá-lo com um diagrama mostrando como diferentes partes de uma célula interagem. Por décadas, esses métodos serviram bem aos leitores humanos, permitindo que os cientistas construíssem sobre o trabalho uns dos outros. No entanto, tanto a linguagem quanto as imagens carregam uma falha oculta: são abertas à interpretação. Uma frase pode ser lida de formas ligeiramente diferentes dependendo do histórico do leitor, e um desenho pode ser compreendido de maneira distinta com base em como o espectador interpreta as formas e as setas. Essa ambiguidade é gerenciável para humanos, mas cria um problema significativo para a nova geração de sistemas de inteligência artificial projetados para ler a literatura científica e fazer descobertas por conta própria. Esses sistemas, conhecidos como agentes de IA, precisam de informações que sejam precisas e inequívocas, sem deixar margem para suposições. Se uma IA interpretar incorretamente um diagrama ou uma descrição, ela pode cometer erros que repercutem em seu trabalho, levando a conclusões erradas.
Em um estudo recente, os pesquisadores Mila Glavaški e Lazar Velicki, da Universidade de Novi Sad, na Sérvia, propuseram uma solução para este problema. Eles sugerem que os artigos científicos incluam "diagramas-como-código". Em vez de apenas fazer o upload de um arquivo de imagem estático, os autores forneceriam o código de computador real usado para gerar essa imagem. Esse código atua como um conjunto de instruções matemáticas rigorosas que diz ao computador exatamente como desenhar cada linha, forma e conexão. Como o código é uma linguagem de lógica, e não de arte, ele remove a suposição. Quando um computador lê o código, ele vê exatamente a mesma estrutura que o autor pretendia, sem variação de significado. Os pesquisadores testaram essa ideia pegando três tipos comuns de conteúdo científico sobre insuficiência cardíaca — descrições textuais de causas, explicações de mecanismos biológicos e vias clínicas para o cuidado do paciente — e convertendo-os neste formato de código. Eles descobriram que a abordagem funciona, criando uma ponte que permite que tanto cientistas humanos quanto agentes de IA entendam processos científicos com clareza total.
Os pesquisadores começaram analisando como a informação científica é compartilhada atualmente. Eles observaram que, embora a linguagem natural permita uma variedade infinita de expressões, ela também permite uma variedade infinita de interpretações. Um cientista pode escrever que uma condição cardíaca é causada por pressão alta, enquanto outro pode descrevê-la como resultado de danos nas válvulas. Ambos estão corretos, mas a redação específica pode levar uma IA a perder a conexão entre os dois. Da mesma forma, um diagrama visual pode mostrar setas conectando diferentes partes de um sistema, mas, sem uma definição estrita, uma IA pode não saber se essas setas representam uma causa, um efeito colateral ou uma simples associação. O objetivo do desenvolvimento moderno da IA é criar sistemas que possam fazer descobertas científicas de forma autônoma, atuando como pesquisadores independentes que podem ler milhares de artigos e sintetizar novos conhecimentos. Para fazer isso, esses agentes de IA precisam passar informações uns aos outros com perfeição de precisão. Se um agente passar uma tarefa para outro baseando-se em um diagrama mal interpretado, toda a cadeia de pesquisa pode falhar.
Para testar sua ideia, Glavaški e Velicki selecionaram três exemplos distintos do campo da cardiologia, o estudo do coração. O primeiro exemplo foi um parágrafo descrevendo as várias maneiras como a insuficiência cardíaca se desenvolve, listando causas como lesão isquêmica, sobrecarga de pressão e doença metabólica. O segundo foi uma definição de insuficiência cardíaca como uma síndrome clínica, detalhando como problemas estruturais no coração levam a sintomas. O terceiro foi um guia passo a passo para médicos sobre como avaliar um paciente suspeito de ter insuficiência cardíaca, abrangendo desde o histórico médico até exames físicos. Ao lado desses textos, eles usaram três diagramas correspondentes que representavam visualmente esses mesmos conceitos. Essas entradas serviram como a matéria-prima para o experimento.
A equipe então usou uma versão gratuita de um grande modelo de linguagem, um tipo de chatbot de IA, para converter essas entradas em código. Eles pediram à IA para gerar código para duas ferramentas de diagramação diferentes, Mermaid e D2, que são programas que transformam instruções de texto em gráficos visuais. Para as descrições textuais, o comando foi simples: "Crie o código para um diagrama Mermaid para isto". Para as imagens existentes, o comando foi um pouco mais específico: "Crie o código para um diagrama Mermaid para esta figura. Não adicione nada por conta própria". Os pesquisadores queriam ver se a IA poderia olhar para um parágrafo de texto ou uma imagem estática e traduzi-lo em um conjunto de instruções lógicas que outro computador pudesse ler.
Os resultados mostraram que a abordagem era viável. Para cada descrição textual e cada imagem testada, a IA gerou com sucesso o código que, quando executado em um editor padrão, produzia um diagrama que correspondia ao significado original. Para o texto sobre os mecanismos compartilhados da insuficiência cardíaca, o código criou um fluxograma mostrando como diferentes caminhos levam ao mesmo resultado. Para o texto definindo a doença, o código produziu um diagrama ligando várias causas à condição. Para a via clínica, o código mapeou as etapas que um médico deve seguir, desde a primeira visita até o exame físico. Os pesquisadores também converteram as imagens estáticas originais em código, solicitando à IA que gerasse o código baseado nas figuras. A IA conseguiu produzir instruções de código que, quando renderizadas, recriaram a estrutura visual dos mecanismos moleculares, a cascata patofisiológica e a via clínica.
Uma vez gerado o código, os pesquisadores não o aceitaram cegamente. Eles verificaram manualmente a saída nos editores online para Mermaid e D2. Descobriram que, embora a IA acertasse a estrutura geral, às vezes eram necessários ajustes menores. Por exemplo, a direção de uma seta poderia precisar ser invertida, ou uma conexão entre dois blocos poderia precisar ser movida para um lugar diferente para refletir a ciência com precisão. Essas pequenas edições eram necessárias para garantir que o código espelhasse perfeitamente a representação pretendida. No entanto, o fato de a estrutura central poder ser gerada automaticamente era a descoberta fundamental. O código servia como o registro imutável e preciso da informação, enquanto o diagrama visual era simplesmente uma forma para os humanos confirmarem que o código estava correto.
Os pesquisadores enfatizam que este método não substitui a necessidade de supervisão humana. Se uma IA gerar código baseado em uma alucinação — um fato falso que a IA inventa — o diagrama resultante estará errado. No entanto, o sistema proposto inclui uma verificação integrada. Como o código é legível por humanos e pode ser renderizado instantaneamente, um cientista pode olhar para o diagrama gerado e ver imediatamente se ele corresponde ao texto ou à imagem original. Se não corresponder, ele pode corrigir o código. Esse processo garante que a representação final seja precisa. O estudo sugere que, no futuro, os artigos científicos poderiam incluir esses trechos de código ao lado do texto e das imagens tradicionais. Isso permitiria que agentes de IA lessem o artigo e extraíssem a lógica exata da pesquisa sem interpretar erroneamente as pistas visuais ou textuais.
As implicações deste trabalho estendem-se para além da insuficiência cardíaca. Os pesquisadores argumentam que esta abordagem poderia ser aplicada a qualquer campo científico onde processos sejam descritos. Seja no fluxo de produtos químicos em um laboratório, nas etapas de um tratamento médico ou nas conexões de um sistema ecológico, representar esses processos como código os tornaria universalmente compreensíveis. Permitiria que um cientista humano entregasse um projeto a um agente de IA, e que esse agente o passasse para outro, com a garantia de que o significado do trabalho permaneça inalterado em cada etapa. O código atua como um tradutor universal, removendo a ambiguidade da linguagem natural e a subjetividade das imagens estáticas.
Em sua discussão, os autores reconhecem que este método possui limites. Ele só pode representar o que já é conhecido. Se um processo científico envolve elementos ou relações desconhecidas que ainda não foram descobertas, essas lacunas não podem ser preenchidas pelo código. Além disso, a qualidade do código depende da qualidade da IA que o gera. Usar comandos mais complexos pode produzir melhores resultados, mas os pesquisadores mostraram que, mesmo com instruções simples, o sistema funciona bem o suficiente para ser útil. Eles também observaram que, embora tenham usado Mermaid e D2, outras ferramentas como PlantUML ou Graphviz poderiam servir ao mesmo propósito. A ferramenta específica importa menos do que o conceito de ter uma representação baseada em código.
O estudo conclui que chegou o momento de padronizar como a informação científica é compartilhada na era da IA. Ao adotar o "diagramas-como-código", a comunidade científica pode garantir que o conhecimento que produzem não seja apenas legível por humanos, mas também executável por máquinas. Essa mudança transformaria a literatura científica de uma coleção de documentos estáticos em um recurso dinâmico e legível por máquinas. Permitiria uma transferência contínua de conhecimento entre pesquisadores humanos e inteligência artificial, pavimentando o caminho para um futuro onde agentes de IA possam colaborar com cientistas para resolver problemas complexos com um nível de precisão que era anteriormente impossível. Os pesquisadores demonstraram que isso não é apenas uma ideia teórica, mas uma realidade prática que pode ser implementada hoje com ferramentas existentes.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.