← 最新论文
💻 computer science

From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications

本文主张在科学出版物中采用“图表即代码”(diagrams-as-code)模式,以消除解释上的歧义,从而为未来科学发现中科学家、大语言模型以及自主人工智能智能体之间可靠的信息传递提供保障。

原作者: Mila Glavaški, Lazar Velicki

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Mila Glavaški, Lazar Velicki

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

科学一直依赖两种语言来分享其发现:文字和图像。研究人员可能会用一段文字描述一个复杂的生物过程,或者用一张图表展示细胞的不同部分是如何相互作用的。几十年来,这些方法很好地服务了人类读者,使科学家能够借鉴彼此的工作。然而,语言和图像都存在一个隐藏的缺陷:它们具有开放性的解释空间。一句话可以根据读者的背景有略微不同的解读方式,而一张图画也可以根据观察者对形状和箭头的理解而被不同地理解。这种歧义对于人类来说是可以处理的,但对于旨在阅读科学文献并自主进行发现的新一代人工智能系统来说,这构成了一个重大问题。这些被称为“AI智能体”的系统需要精确且无歧义的信息,不留任何猜测的空间。如果AI误解了图表或描述,它可能会产生连锁反应式的错误,导致错误的结论。

在最近的一项研究中,来自塞尔维亚诺维萨德大学的研究员 Mila Glavaški 和 Lazar Velicki 针对这一问题提出了一个解决方案。他们建议科学论文应该包含“代码化图表”(diagrams-as-code)。作者不应仅仅上传一个静态图像文件,而应提供用于生成该图像的实际计算机代码。这段代码充当了一套严格的、数学化的指令集,告诉计算机如何精确地绘制每一条线、每一个形状和每一处连接。因为代码是一种逻辑语言而非艺术语言,它消除了猜测。当计算机读取代码时,它看到的正是作者意图呈现的精确结构,不存在意义上的偏差。研究人员通过将三种常见的关于心力衰竭的科学内容——关于病因的文本描述、关于生物机制的解释以及关于患者护理的临床路径——转换为这种代码格式,测试了这一想法。他们发现这种方法是行之有效的,它创造了一座桥梁,使人类科学家和AI智能体都能以完全清晰的方式理解科学过程。

研究人员首先观察了目前科学信息是如何共享的。他们注意到,虽然自然语言允许表达方式具有无限的多样性,但也允许解释方式具有无限的多样性。一位科学家可能会写道某种心脏状况是由高血压引起的,而另一位可能将其描述为瓣膜损伤的结果。两者都是正确的,但具体的措辞可能导致AI错过两者之间的联系。同样,视觉图表可能会显示连接不同系统部分的箭头,但如果没有严格的定义,AI可能无法确定这些箭头代表的是因果关系、副作用还是简单的关联。现代AI开发的目标是创建能够自主进行科学发现的系统,使其能够作为独立的科研人员,阅读数千篇论文并综合新的知识。为此,这些AI智能体需要以完美的准确度向彼此传递信息。如果一个智能体基于被误解的图表将任务移交给另一个智能体,整个研究链条就会崩溃。

为了测试他们的想法,Glavaški 和 Velicki 选择了心脏研究(心血管医学)领域中三个截然不同的例子。第一个例子是一个描述心力衰竭发生各种方式的段落,列举了缺血性损伤、压力过载和代谢性疾病等病因。第二个是将心力衰竭定义为一种临床综合征,详细说明了心脏结构问题如何导致症状。第三个是为医生提供的关于如何评估疑似心力衰竭患者的分步指南,涵盖了从病史采集到体格检查的所有内容。在这些文本之外,他们使用了三个对应的图表,直观地展示了这些相同的概念。这些输入作为他们实验的原始材料。

随后,团队使用了一个大型语言模型(一种AI聊天机器人)的免费版本,将这些输入转换为代码。他们要求AI为两种不同的绘图工具生成代码,即 Mermaid 和 D2,这些程序可以将文本指令转化为视觉图表。对于文本描述,提示词很简单:“为这个内容创建一个 Mermaid 图表的代码。”对于现有的图像,提示性的要求更为具体:“为这个图表创建一个 Mermaid 图表的代码。不要自行添加任何内容。”研究人员想要观察AI是否能够观察一段文本或一张静态图像,并将其转化为另一台计算机可以读取的一套逻辑指令。

结果表明,这种方法是可行的。对于他们测试的每一个文本描述和每一张图像,AI都成功生成了代码,当通过标准编辑器运行时,生成的图表与原意相符。对于关于心力衰竭共同机制的文本,代码创建了一个流程图,展示了不同路径如何导致相同的结果。对于定义该疾病的文本,代码生成了一个将各种诱因与病情联系起来的图表。对于临床路径,代码绘制出了医生在面对患者时应采取的步骤,从首次就诊到体格检查。研究人员还将原始静态图像转换为代码,通过提示AI根据图像生成代码。AI成功生成了代码指令,在渲染后,重现了分子机制、病理生理级联反应和临床路径的视觉结构。

代码生成后,研究人员并没有盲目接受。他们在 Mermaid 和 D2 的在线编辑器中对手动检查了输出结果。他们发现,虽然AI抓住了大致结构,但有时仍需要进行微调。例如,箭头的方向可能需要翻转,或者两个模块之间的连接可能需要移动到另一个位置,以准确反映科学事实。这些细小的编辑对于确保代码完美镜像预期的表达至关重要。然而,核心结构可以自动生成这一事实才是关键发现。代码作为一个不变的、精确的信息记录,而视觉图表仅仅是人类确认代码正确性的手段。

研究人员强调,这种方法并不取代人工监督的需求。如果AI基于“幻觉”(即AI虚构的错误事实)生成代码,那么生成的图表将会是错误的。然而,他们提出的系统包含了一个内置检查机制。由于代码是人类可读的,并且可以立即渲染,科学家可以通过查看生成的图表来立即判断其是否与文本或原始图像相符。如果不符,他们可以修正代码。这一过程确保了最终呈现的准确性。研究表明,在未来,科学论文可以在传统文本和图像旁边附带这些代码片段。这将允许AI智能体阅读论文并提取研究的精确逻辑,而不会误解视觉或文本线索。

这项工作的意义不仅限于心力衰竭。研究人员认为,这种方法可以应用于任何描述过程的科学领域。无论是实验室中的化学物质流动、医疗处置的步骤,还是生态系统中的联系,将这些过程表示为代码将使其具有普适的理解力。它允许人类科学家将项目交给AI智能体,再由该智能体传递给另一个AI,并保证研究意义在每一步中都保持不变。代码充当了通用翻译器,剥离了自然语言的歧义性和静态图像的主观性。

在讨论中,作者承认这种方法存在局限性。它只能表示已知的事物。如果一个科学过程涉及尚未被发现的未知元素或关系,这些空白无法通过代码来填补。此外,代码的质量取决于生成它的AI的质量。使用更复杂的提示词可能会产生更好的结果,但研究人员展示了即使使用简单的指令,该系统也足以发挥作用。他们还指出,虽然他们使用了 Mermaid 和 D2,但其他工具如 PlantUML 或 Graphviz 也可以实现同样的目的。具体工具并不重要,重要的是拥有基于代码的表示形式这一概念。

研究结论指出,在AI时代,标准化科学信息的共享方式已是势在必行。通过采用“代码化图表”,科学界可以确保他们产生的知识不仅能被人类阅读,还能被机器执行。这种转变将使科学文献从静态文档的集合转变为动态的、机器可读的资源。它将实现人类研究人员与人工智能之间无缝的知识转移,为AI智能体与科学家协作解决复杂问题铺平道路,并达到此前无法实现的精准度。研究人员证明,这不仅仅是一个理论构想,而是一个可以用现有工具实现的现实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →