Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging
本文介绍了 Imaging-101,这是一个包含跨六个科学领域的 57 个经专家验证的计算成像任务的基准测试,旨在评估大语言模型(LLM)编码智能体,研究揭示了当前前沿模型在算法选择和物理惯例处理等领域特定挑战方面表现挣扎,从而凸显了对专门化、技能增强型智能体的需求,以实现可靠的科学发现。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个神奇的魔盒,能把一张模糊、充满噪声的秘密物体照片变成一张清晰透彻的图像。在现实世界的科学领域,这并非魔法,而是被称为**计算成像(computational imaging)**的技术。科学家利用它来观察那些无法直接接触的事物,比如黑洞内部、病毒的结构,或是地底深处的景象。然而,构建一个能将那团模糊混乱转化为清晰图像的“配方”极其困难。这需要对物理学、数学和编程有着博士级的理解,还需要极大的耐心去修复那些可能毁掉整个图像的微小错误。
由此,Imaging-101 应运而生——这是一个针对人工智能的新型“驾驶考试”。研究人员创建了一个包含 57 个不同谜题(任务)的挑战,这些任务取自天文、生物、化学、地球科学、医学和物理学六个领域的真实科学论文。他们不仅仅是要求 AI 编写代码,而是要求它从头到尾构建出一台完整的、可运行的机器来解决这些谜题。
三部分测试
为了测试 AI 是真的聪明还是仅仅运气好,研究人员提供了三种不同的测试方式:
- 制定计划: 首先,AI 必须编写一份蓝图。在写下第一行代码之前,它能否理清正确的数学逻辑和步骤?
- 乐高积木: 接下来,它必须构建机器的特定部件(如“预处理”或“求解器”模块),并让每个部件通过严格的单元测试。
- 全程驾驶: 最后,它必须将整台机器组装起来,运行它,并生成一张足以通过严格质量检查的准确图像。
结果:AI 擅长表达,但不擅长物理
研究人员测试了 七种目前最顶尖的 AI 模型。以下是他们的发现:
- “计划”阶段表现尚可: AI 在编写蓝图方面表现得相当出色。顶尖模型(GPT-5.4 和 Kimi-k2.5)大约有 52.6% 的概率能把握住大体思路。它们能够准确说出应该使用的数学类型。
- “乐高积木”环节摇摇欲坠: 当涉及到实际构建部件时,情况变得混乱起来。同时正确构建所有部件的成功率降至 1.8% 到 22.8% 之间。
- “全程驾驶”难度最大: 表现最好的 AI(Claude-4.6-Opus)也仅在 29.8% 的情况下成功构建了能够运行并产生高质量图像的机器。其他模型的表现更差,有的成功率仅为 7%。
“隐形”陷阱
这项研究最有趣的部分在于 AI 为什么 会失败。它们失败的原因不是因为不会写代码,而是因为忽略了科学家通过多年经验习得的物理学“潜规则”。
论文将此称为**“数值约定漂移”(numerical-convention drift)**。想象你在烤蛋糕:AI 知道食谱说要“加面粉”,但它忘了在这个特定的厨房里,你必须用克而不是杯来称量面粉,而且必须先过筛。AI 做出的蛋糕看起来像蛋糕,闻起来也像蛋糕,但尺寸和质地却是错误的。
在研究中,AI 犯下了以下具体错误:
- 单位错误: 在一个涉及光散射的任务中,AI 忘记将“强度”(intensity,光的亮度)转换为“振幅”(amplitude,波的强度)。这就像试图用“亮度”而不是“时速”来测量汽车的速度。
- 求解器错误: AI 会选择通用的数学工具(比如一把普通的锤子),而该任务实际上需要专门的工具(比如一把激光手术刀)。它会说:“我会使用这个常用方法”,尽管它所遵循的论文明确要求使用一种罕见且复杂的特定方法。
- 缺失归一化: 在 MRI 扫描中,AI 忘记了根据人体不同部位距离传感器的远近进行调整。这导致最终生成的图像看起来带有奇怪的阴影,尽管代码运行过程中没有任何错误。
“黑盒”惊喜
研究人员还测试了一个拥有真实计算机终端、可以安装软件并查看文件的“黑盒”智能体(Claude Code)。这个智能体的表现要好得多,成功率达到了 56.1%。这表明,给予 AI 更多探索和自我修复错误的空间会有所帮助,但即便拥有这种优势,它依然并不完美。
这意味着什么
论文明确指出,虽然 AI 在编写代码方面正在进步,但它仍然难以掌握科学成像中的深层、内隐的知识(tacit knowledge)。这就像一个学生虽然能背诵棒球规则,却不知道如何实际接住一个曲线球。
研究人员发现,AI 失败的原因往往是因为它们依赖于训练数据中“统计学上的常见做法”,而不是针对特定问题进行“物理学上的正确操作”。他们建议,要解决这个问题,我们可能需要构建带有“工具箱”的 AI 助手,这个工具箱应包含经过验证的、特定领域的技能,而不是期望它们从零开始推导每一条物理规则。
简而言之,AI 可以讲述如何解开谜题的故事,但它仍然需要人类专家来检查数学逻辑,并确保物理规律确实成立。实现一个完全自动化的科学发现机器的梦想,仍处于开发进程之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。