一组研究人员现在通过一个名为 FrontierChallenge 的新基准测试,对这一承诺进行了严格的检验。他们创建了一套包含三百个真实世界科学任务的任务集,涵盖了量子化学、分子动力学和材料科学等领域。在本项研究中,他们发布了其中的九十七个任务,以观察十二个最先进的 AI 模型处理这些任务的能力。研究人员并没有要求这些智能体去发明新理论或决定研究课题。相反,他们为每个智能体提供了一组固定的数据和一份明确的交付清单:一份报告、一组图表、一张数字表格以及用于生成它们的代码。智能体的任务是执行整个工作流,确保最终包中的每一部分都是一致且完整的。
结果揭示了“取得进展”与“完成任务”之间存在着巨大的鸿沟。虽然表现最好的系统能够完成约百分之二十的任务全流程,但大多数尝试都未能达标。表现最出色的配置——使用名为 GPT-5.6 Sol 的模型配合特定的智能体框架——仅完成了九十七个任务中的二十个。另一位顶尖选手 Grok 4.6 也取得了同样的成功率。尽管这些完成率很低,但智能体在“部分进度”上的得分通常非常高。在某些领域,未完成尝试的平均得分接近百分之九十,这表明智能体已经正确完成了大部分工作。然而,从交付一个完整、无误的科学包的最严格意义上来看,这些高分并未转化为成功。
该研究还观察了智能体如何处理错误。令人惊讶的是,过程中的错误出现并不预示着失败。成功的运行和失败的运行都会遇到所用工具的错误,且智能体通常能自行从这些小故障中恢复。衡量成功的真正标准不在于智能体是否避免了错误,而在于它能否追踪整个任务的契约,并确保满足每一个要求。研究人员得出结论:目前的 AI 系统有能力在复杂的科学问题上取得实质性进展,但它们尚不足以在没有人类监督的情况下,可靠地执行从头到尾的完整科学工作流。交付一套完整、一致且经过验证的科学人工制品的能力,仍然是一个独特且尚未解决的挑战。
技术摘要:FrontierChallenge —— 评估科学工作流的完成度
问题陈述
目前的科学 AI 智能体基准测试往往优先考虑最终答案、孤立的程序或单领域任务。这些评估单元无法捕捉现实世界科学工作的复杂性,即智能体需要检查异构输入、执行多阶段分析工作流、验证中间结果,并生成一组相互一致的交付物(代码、表格、图表和文本)。目前存在一个关键差距,即如何评估智能体是否能够可靠地执行从输入处理到最终交付所有所需人工制品(artifacts)的指定科学工作流。现有的指标往往将高水平的部分进度与成功的完成混为一谈,从而可能掩盖了最终交付环节的重大失败。