ASI-Bench: At the Dawn of Artificial Superintelligence
该论文介绍了 ASI-Bench,这是一个包含 11 个科学领域、60 个项目级研究任务的综合基准测试,旨在通过逐步减少人类指导来评估人工智能进行自主、创新性科学研究的能力,并揭示了当前的尖端系统仍严重依赖于人类输入,距离实现真正的通用人工智能尚有很大差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
迈向能够像人类一样思考的机器之旅,长期以来一直聚焦于计算机在记忆事实、解决已知谜题或遵循一套指令以达到特定答案方面的表现。多年来,最先进的人工智能系统在这些任务中表现卓越,它们能够吸收海量的人类知识并以惊人的速度进行应用。但存在另一种不同类型的智能,目前仍在大规模范围内无法触及:那就是踏入未知领域、面对混乱且无法解释的问题,并不仅是找到答案,而是找出寻找答案的路径本身的能力。这就是科学发现的领域,其目标不是回忆公式,而是发明公式、设计实验,并将一个模糊的问题转化为经过验证的结果。驱动这项新研究的问题是:目前的机器真的能独立做到这一点吗,还是它们仍然完全依赖人类在每一步骤中进行引导?
来自世界各地大学和研究机构的一个研究小组构建了一个名为 ASI-Bench 的新测试场,以回答这个问题。他们创建了涵盖 11 个不同科学领域的 60 个复杂研究项目,范围从物理学、化学到生物学和工程学。每个项目都被设计为模拟一次真实的科学调查,包含原始数据、特定目标以及产生工作方案的要求。设计的精妙之处在于他们测试机器的方式。对于每一个研究项目,他们对同一个 AI 系统运行了四次,但改变了给予它的帮助程度。在第一种情景中,AI 被交给了一份关于如何解决该问题的完整、分步骤的手册。在第二种情景中,他们只告诉了它要使用的通用方法,就像是告诉某人“使用锤子”,却没展示如何挥动它。在第三种情景中,AI 只得到了问题和数据,没有任何关于如何进行的指令,迫使它自己决定方法。最后,在第四种情景中,他们添加了一层令人困惑的无关信息,以观察机器是否能保持对核心任务的专注。
结果揭示了当前人工智能现状的一个残酷现实。当机器获得完整指令时,它们的表现尚可,平均得分约为 100 分中的 51 分。然而,一旦研究人员移除了分步骤的指导,并要求 AI 自行确定程序,其表现便大幅下降。当 AI 必须自行选择方法时,平均得分降至约 27 分。这种剧烈的下滑表明,虽然今天的系统非常擅长沿着人类已经铺设好的道路前行,但在自行构建道路方面却面临巨大困难。最大的障碍不在于选择正确的工具,而在于将一个通用的想法转化为一个具体、可操作的计划。即使 AI 知道该使用哪种方法,它也经常无法构建出使其奏效的必要步骤,导致在移除详细指令后得分显著下降。
研究人员还发现,添加额外的干扰信息并不像移除指令那样会让机器感到困惑。当 AI 被给予同样困难的任务,但提示词中加入了一堆无关的事实和杂言时,其表现与完全没有指令时几乎完全相同。这表明,当前系统的主要弱点并非缺乏专注力或无法过滤噪声,而是缺乏在没有人类定义路线图的情况下进行操作的基础能力。该研究涉及 18 种不同的 AI 模型和软件代理组合,即使是最先进的配置(使用了目前最强大的推理能力),在独自应对时也仅能得到大约 52 分。这是一个小小的成功,但远未达到独立进行科学研究所需的可靠性。
这种独立性的代价也很高。当 AI 必须自行确定步骤时,它消耗的计算能力和时间明显高于仅仅听从命令时。在某些情况下,系统为了尝试在没有引导的情况下完成同一项任务,消耗的计算资源增加了近 60%,且经常陷入循环或尝试效率低下的路径。这表明,真正的自主不仅是一个智能问题,也是一个效率问题;没有人类的引导,机器会浪费大量的精力去尝试解决那些如果被告知方法就能快速解决的问题。研究结论认为,我们距离人工智能超智能(即机器可以在没有人类干预的情况下探索未知并创造新知识的状态)的黎明还很遥远。相反,我们正处于这样一个阶段:机器是强大的助手,可以执行复杂的任务,但它们仍然严重依赖人类来定义策略。
这个新基准并非旨在做出最终判决,而是作为科学界的起点。研究人员已向世界公开了他们的 60 个任务及其测试方法,邀请其他科学家和工程师贡献新的问题,并使用这些挑战来测试他们自己的系统。他们相信,通过不断增加新的、困难的研究项目并完善测试,整个科学界可以更准确地追踪进度。其目标是超越简单的记忆和逻辑测试,迈向一个我们可以衡量机器是否能真正像科学家一样思考、能够驾驭未知并将空白页转化为发现的未来。就目前而言,数据表明,尽管我们的机器正在变得更加聪明,但它们仍在等待我们告诉它们下一步该做什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。