TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?
本文介绍了 TerraBench,这是一个综合性的基准测试和可执行框架,旨在通过将语言模型与用于环境分析、模拟和验证的专业科学工具相结合,评估并提升 AI 智能体在异构地球系统数据上进行落地式多步推理的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图破解一个关于天气的复杂谜团,而你的团队中有两位截然不同的侦探:
- “文字巫师”(大语言模型): 这位侦探擅长阅读书籍、理解语言并制定策略。他们可以告诉你解决问题应该采取哪些步骤。然而,他们从未见过天气图,看不懂卫星照片,而且如果你要求他们计算一个数字,他们可能只会凭感觉瞎猜。
- “数据粉碎机”(科学工具): 这是一位拥有超级计算机的机器人侦探。它可以瞬间读取卫星图像、运行复杂的气候模拟并计算精确的数字。但它不会说人类语言,无法理解问题,并且需要有人准确地告诉它该做什么。
问题所在:
目前,这两位侦探配合得并不好。文字巫师无法有效地使用数据粉碎机的工具,而数据粉碎机也无法理解文字巫师的计划。这使得构建一个能够真正帮助科学家应对气候变化、农业或灾害响应的 AI 变得异常困难。
解决方案:TerraBench 与 TerraAgent
该论文的作者构建了一个新的测试场 TerraBench 和一个全新的“管理者” TerraAgent,旨在观察 AI 是否终于学会了让这两位侦探协同工作。
把 TerraAgent 想象成一名项目经理。当你问出一个问题,例如:“下周飓风会对佛罗里达州的农作物产生什么影响?”时,这位经理会:
- 规划: 将问题分解为若干步骤。
- 调用工具: 指示数据粉碎机去查找卫星图像、检查历史天气并运行模拟。
- 检查工作: 查看机器人返回的结果。
- 汇报: 以清晰、结构化的格式撰写最终答案。
测试(TerraBench)
为了测试这位经理是否称职,作者创建了一场大规模的考试,名为 TerraBench。这不仅仅是一个简单的选择题测试。它更像是一系列包含 403 个复杂“任务”的挑战,要求 AI 完成以下工作:
- 基础能力: 阅读地图和天气图表以回答基础问题。
- 模拟实验: 模拟一场灾难(如洪水)发生,并使用模拟器预测损失情况。
- 验证: 检查 AI 的答案是否与真实的科学论文和数据相匹配。
这项测试极其严格。它不仅关心 AI 是否选对了工具,还关心 AI 是否使用了该工具的正确参数设置,以及最终的数值是否在极小的误差范围内保持准确。
结果:现实的检验
作者在这一考试中测试了目前最智能的 AI 模型(如 Claude Sonnet 4.6 和 Qwen3.5)。结果令人惊讶:
- 擅长规划,拙于数学: 最顶尖的 AI 模型在确定使用哪些工具以及使用顺序方面表现尚可(在“过程”部分得分约为 59%)。
- 极度缺乏精确度: 然而,当涉及到得出最终正确的数字时,它们表现得一塌糊涂。表现最好的模型也仅在约 23% 的情况下得到了正确的最终答案。
- “差一点点”的陷阱: 大多数情况下,AI 选对了工具,但使用了错误的设置(例如查看了错误的时间或错误的地点),导致得出的答案虽然接近,但在科学上却毫无用处。
“错误配方”的比喻
想象一下,你要求一位厨师(AI)使用特定的食谱(科学数据)来烤制一个蛋糕。
- 厨师知道该去拿取哪些原料(工具选择)。
- 但当他们测量面粉时,使用的是量杯而不是克秤(错误参数)。
- 结果是,做出来的蛋糕看起来像个蛋糕,吃起来却像沙子。
论文表明,目前的 AI 非常擅长知道“要做什么”,但很难做到“足够精确”,以至于无法被信任用于处理现实世界的科学问题。
结论
论文得出结论:要构建一个真正对地球科学有用的 AI,我们不能仅仅给它提供工具的使用权限。我们需要教会它如何以极高的精确度去协调这些工具,如何处理复杂的流程,并确保最终的数字在科学上是准确无误的。TerraBench 是第一个能够精准衡量我们距离这一目标还有多远的研究工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。