EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards
本文介绍了 EarthVerse,这是一个包含 19 类自然灾害家族、共计 405 个可复现任务的综合基准测试,旨在评估 AI 智能体在动态地球系统中的端到端科学可靠性,并揭示了当前模型在单步准确性与一致性、整体性推理之间存在的显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当科学家试图理解地球是如何运作时,他们很少能拥有一个单一、完美的图景。相反,他们必须从许多不同的来源中拼凑出一个故事:来自当地气象站的天气报告、来自太空拍摄的卫星图像、政府机构对洪水的总结,以及对历史气候数据的重新分析。这些来源中的每一个都讲述了部分真相,但它们往往使用不同的语言,覆盖不同的区域,并在不同的时间记录事件。地球科学真正的挑战不仅在于阅读这些报告,还在于弄清楚哪些报告属于同一组,如何公平地进行比较,以及它们是否针对一场灾难或气候变化讲述了一个一致的故事。如果科学家选择了错误的数据或搞混了时间,那么关于某种危险的整个结论都可能是错误的,这将对社区如何准备或应对危险产生严重后果。
一项名为 EarthVerse 的新研究提出了一个困难的问题:人工智能系统能否独立完成这种科学侦探式的工作?研究人员构建了一个大规模测试,以观察计算机智能体是否能像真正的科学家一样行动。他们基于 199 个真实的灾难和极端天气事件(从热浪到地震),创建了 405 个特定的调查任务。每个调查都是一个包含约 34 个不同文件的软件包,包括原始数据、地图和报告。计算机智能体被赋予了一个科学问题,例如确定热浪的严重程度,但并没有被告知应该查看哪些文件。它们必须搜索整个软件包,找到正确的记录,检查数据在时间和空间上是否匹配,执行必要的计算,然后写出一个完全由所发现证据支持的最终答案。
结果显示,这些系统在简单测试中的表现与它们在复杂现实场景中的表现之间存在显著差距。当研究人员测试 25 种不同的 AI 系统时,表现最好的系统能够正确回答约 85% 的小型、个体事实。它们通常能找到正确的数字并正确执行数学运算。然而,当研究人员观察整个调查是否完整且可靠时,成功率大幅下降。只有约 35% 的调查做得足够好,可以被认为是完全可信的。这意味着即使是最先进的系统也经常在推理链条的某个环节出错。它们可能找到了正确的温度记录,但使用了错误的时间窗口;或者它们可能正确计算了一个统计数据,但未能检查该数据是否来自兼容的来源。
研究表明,问题不在于缺乏知识或无法进行数学运算。这些系统了解事实并且能够计算数字。失败发生在它们必须决定信任哪种证据以及如何保持所有拼图碎片对齐的时候。当研究人员通过直接指向正确的文件来为 AI 系统提供额外帮助时,它们的表现显著提升,这证明了主要的瓶颈在于寻找正确的信息,而不是理解信息。研究还发现,如果系统卡在了错误的数据上,仅仅让 AI 思考得更久或更深入并不能解决问题。这些系统需要能够改变主意,回头寻找更好的来源,并根据新证据更新其结论。
这项研究表明,虽然人工智能在已有答案的情况下回答问题的能力变得非常强,但在构建证据基础这一更难的任务上仍然显得吃力。在地球科学领域,由于一个缺失的数据点就可能改变对一场灾难的理解,这种差距至关重要。研究结论指出,要使人工智能在科学领域真正可靠,它必须能够在其提出的每一个主张与支持该主张的具体证据之间保持一致的联系,从而确保整个故事从第一个数据点到最终结论都能逻辑严密、环环相扣。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。