Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models
本文介绍了 SciDraw-Bench,这是一个专门的基准测试和四维评估协议,旨在评估文本生成图像及多模态模型生成科学准确图表的能力,并证明了领域特定系统在遵循学科惯例和语义正确性方面显著优于通用模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何绘制一张寻宝图。如果你问一个标准的艺术机器人“画一张地图”,它可能会给你一张精美的海盗船和阳光沙滩的图片。但如果你需要的是一张能真正显示出金矿在哪里、哪条路径通向那里以及地标名称是什么的地图,那么那张漂亮的图片是毫无用处的。
这正是 Davie Chen 在论文 《AI 能画科学吗?》(Can AI Draw Science?) 中所解决的问题。
以下是使用简单类比对该论文进行的拆解:
1. 问题所在:“艺术学院” vs. “工程手册”
目前的 AI 图像生成器(例如那些制作酷炫猫咪或风景图片的工具)是根据它们看起来多么“真实”,或者它们在多大程度上遵循简单的指令(如“一个红球在蓝方块旁边”)来评判的。
但科学图表(例如描述病毒如何运作的图解,或展示实验步骤的流程图)追求的不是好看。它们追求的是准确性。
- 类比: 想象标准的 AI 就像一名有天赋的艺术系学生,可以画出一个完美的苹果。但科学家需要的是一份蓝图。如果蓝图说“电线连接到红色端子”,但 AI 画成了连接到蓝色端子,那么机器就无法工作。如果 AI 把“Voltage”(电压)错拼成了“Voltag”,工程师就无法阅读。
论文指出,现有的 AI 艺术测试并不检查 AI 是否能正确绘制这些“蓝图”。它们只检查图片看起来是否漂亮。
2. 解决方案:“SciDraw-Bench”(科学绘图测试)
为了解决这个问题,作者创建了一个名为 SciDraw-Bench 的新测试。你可以把它看作是专门针对尝试绘制科学图表的 AI 的一场期末考试。
- 它不是“复制图片”测试: 通常,测试会给 AI 展示一张参考图并要求它进行复制。但在科学领域,并不存在一种唯一的正确绘图方式。你可以把细胞画在左边或右边,这都是正确的。
- 它是“遵循规则”测试: 测试不再提供参考图,而是给 AI 一个清单(规范)。
- 示例提示词: “画出 T 细胞攻击病毒的过程。”
- 清单内容: 必须包含“T-cell”和“Virus”这两个词;必须显示一个从 T 细胞指向病毒的箭头;必须使用特定的形状来表示细胞膜;必须不看起来像照片。
只有当 AI 遵循了清单要求,而不是仅仅看起来像某张参考图时,它才能得分。
3. 评分系统:四种失败方式
论文引入了一种新的评分方式,根据四条具体的规则来为 AI 的绘图打分,就像一位严格的老师在检查作业一样:
- 文本忠实度(你能读出标签吗?):
- 规则: 科学图表充满了文字(如基因名称)。
- 失败情况: 如果 AI 把“Gene”写成了“Gne”,或者画出了看起来像字母的乱码线条,它就会得零分。测试使用“机器人阅读器”(OCR)来检查单词拼写是否正确。
- 语义正确性(部件之间的逻辑连接正确吗?):
- 规则: 如果提示词说“A 停止 B”,那么绘图必须显示一个箭头停止 B。
- 失败情况: 如果 AI 画了一个从 B 开始的箭头,或者连接了错误的部件,它就失败了。测试使用一个智能 AI “评委”来观察绘图并判断:“是的,这个箭头是正确的”或“不,那是错的”。
- 结构质量(布局是否混乱?):
- 规则: 绘图需要有条理。箭头不应该产生令人困惑的交叉。
- 失败情况: 如果图表看起来像一团乱麻,它就会丢分。
- 惯例遵循度(它看起来像是科学家画的吗?):
- 规则: 科学家拥有“视觉语法”。例如,在生物学中,细胞膜总是被画成双线。
- 失败情况: 如果 AI 把细胞膜画成单线或实心块,它就违反了该领域的规则。
4. 结果:专家型选手 vs. 通才型选手
作者将一个专门的系统 SciDraw AI 与标准的通用型 AI 艺术生成器进行了对比测试。
- 结果: 专门化系统(SciDraw AI)在遵循科学规则方面表现得更好。它能正确绘制连接关系,并遵循特定领域的视觉语法。
- 弱点: 即便是专门化系统在文本忠实度方面也遇到了困难。在图像内部正确拼写复杂的科学术语,对于所有人来说仍然是最难的部分。
- 通才型选手: 标准的艺术 AI 在这方面表现得很糟糕。它们能做出漂亮的图片,但标签经常拼错,箭头指向错误,且图表不符合逻辑。
总结
论文指出:“我们不能只是要求 AI ‘画科学’然后听天由命。”
我们需要一个特定的测试(SciDraw-Bench),来检查 AI 是否能够遵循科学图表的严格规则。结果显示,虽然 AI 在绘制科学方面正在进步,但在正确拼写单词和遵循图表的逻辑规则方面仍然面临挑战。这篇论文提供了“考试”和“评分标准”,以便我们将来能够追踪 AI 在这一特定且困难的任务上的进步程度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。