← 最新论文
🤖 AI

Verifiable Benchmarking of Long-Horizon Spatial Biology

本文介绍了 SpatialBench-Long,这是一个严格的基准测试,包含针对多种空间生物学数据集的 24 项评估,旨在测试 AI 代理在不预设方法的情况下从原始数据中得出准确科学结论的能力,结果显示当前顶级模型在这些复杂且长周期的推理任务中仅实现了 11.1% 的成功率。

原作者: Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ian Diks, Harihara Muralidharan, Tim Proctor, Kenny Workman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一支非常聪明但缺乏经验的研究助理团队。你的目标不仅仅是看他们能否阅读生物学教科书或运行单个计算器命令。你希望看到他们能否从真实世界实验中获得杂乱无章的原始数据堆,独立理解其含义,并在你未明确指示具体步骤的情况下,写出正确的科学结论。

这篇论文《SpatialBench-Long》是一场“期末考试”,旨在专门测试人工智能(AI)代理在处理空间生物学(一个将细胞在组织中的位置进行映射的领域,就像城市地图,而不仅仅是成分清单)方面的这种能力。

以下是该论文的内容及其发现,使用简单的类比进行分解:

1. 挑战:“神秘盒子”测试

大多数以往的 AI 测试就像让学生解答特定的数学题,老师会说:“使用这个公式。”

  • 旧方式:“这里有一组数字。把它们加起来。”(AI 只需要知道如何相加)。
  • 新方式(SpatialBench-Long):“这里有一个来自癌症研究的原始、未整理的数据盒。这里是实验背景。请找出:肿瘤的哪一部分最有可能扩散到身体其他部位? 你必须自己找到答案。”

AI 必须像真正的科学家一样行动:它必须整理数据、选择合适的工具、忽略干扰项,并串联线索以得出特定结论。

2. 考题(基准测试)

研究人员基于涉及以下内容的真实科学研究,创建了24 个不同的“神秘盒子”(评估):

  • 胰腺癌。
  • 脑肿瘤(胶质母细胞瘤)。
  • 带有特殊“谱系追踪”(即细胞的“家谱”)的肺癌。
  • 衰老小鼠的视神经。

这些并非虚假问题。它们基于真实的科学主张,但数据已匿名化(去除了名称),因此 AI 无法通过从教科书中死记硬背答案来“作弊”。AI 必须从头推导答案。

3. 评分系统:“通过/不通过”与“成绩单”

这是该论文的关键部分。

  • 最终成绩(通过/不通过):只有当 AI 得出研究人员预期的确切科学结论时,才能获得“通过”。这就像多项选择题,你必须选出唯一正确的字母。如果你的逻辑正确但选错了字母,你依然不及格。
  • 成绩单(评分细则得分):因为最终测试的失败并不能告诉你 AI 在哪里出错,研究人员还使用了一套“评分细则”。想象一位老师批改学生的论文。即使学生最终答案错误,老师仍可能因“研究良好”、“正确识别问题”或“使用了正确的工具”而给分。
    • 论文发现,虽然 AI 很少获得最终的“通过”,但它经常获得较高的“成绩单”分数,这意味着它完成了大部分正确的工作,但在最后关头失足。

4. 结果:AI 仍在学习走路

结果令人清醒。研究人员测试了来自 OpenAI、Google、Anthropic 等公司的 15 种不同组合的最先进 AI 模型。

  • 得分:表现最佳的 AI 团队仅在**11.1%**的情况下通过(72 次尝试中通过 8 次)。
  • 现实:即使是“最聪明”的模型,在这些复杂任务的大多数情况下也失败了。
  • 模式:当 AI 失败时,通常不是因为它不懂生物学事实。它失败是因为在过程中迷失了方向。
    • 类比:这就像一位知道交通规则(生物学事实)的司机,却因忘记检查后视镜(元数据)、选错车道(分组变量)或被绕行路线(空间方法)搞糊涂而撞车。

5. “瓶颈”

研究人员确定了 AI 卡住的具体位置,称之为“瓶颈”。

  • 谱系陷阱:在一次肺癌测试中,AI 必须根据细胞的遗传“家谱”来匹配细胞。相反,许多 AI 试图根据基因“喊叫”的响度(表达强度)来匹配它们,这是错误的线索。
  • 元数据混淆:在一项衰老研究中,AI 经常漏掉一个标签,该标签交换了小鼠的年龄,从而导致完全错误的结论。

6. 结论:首先掌握“程序能力”

该论文得出结论,在 AI 能够被信任去发现新疗法或解释复杂疾病之前,它首先需要更好地掌握那些“枯燥”的内容。

  • 隐喻:将 AI 代理想象成一名新学徒厨师。目前,他们擅长背诵食谱(掌握事实)和切单个洋葱(运行简单工具)。但他们非常不擅长运营整个厨房服务(端到端的科学推理)。他们会打翻平底锅、烧焦酱汁或端错菜,因为他们还无法管理整个工作流程。

总结:
这篇论文建立了一个艰难且现实的测试,以观察 AI 是否能进行真正的科学研究。答案是:尚未。目前最先进的 AI 可以完成部分步骤,但它们难以将所有步骤串联起来,在没有人类帮助的情况下得出正确且复杂的结论。该论文指出,为了让 AI 真正革新生物学,它首先必须掌握按步骤正确处理数据的“程序性”技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →