ORCA-bench: How Ready Are Language Model Agents for Oncall?
该论文介绍了 ORCA-bench,这是一个用于评估语言模型智能体在值班根因分析任务上表现的生产级保真度基准测试,研究揭示了即使是最先进的前沿模型目前也仅能达到较低的准确率(在中等难度下为 25.3%)并深受幻觉问题困扰,这表明在它们能够被安全地委托处理现实世界的生产可靠性任务之前,仍存在显著差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位驾驶着庞大、高科技飞船在银河系中巡航的舰长。突然,飞船的计算机开始表现异常:灯光闪烁,重力失常,甚至咖啡机都在喷射火花。你并不确定到底出了什么问题,但你知道飞船陷入了困境。在现实世界中,这些飞船就是我们每天使用的网站和应用程序,而这些“舰长”则是被称为“网站可靠性工程师”(SRE)的特殊工程师。他们的工作就是查明事物为何损坏,通常是从一个模糊的投诉开始,比如“结账按钮没反应”或“网站运行缓慢”。他们必须在海量的数字线索——如流量日志、错误信息和代码——中进行挖掘,以在整个飞船坠毁之前找到那个唯一的故障部件。
长期以来,人们一直试图教计算机进行这种侦探工作,使用的是人工智能(AI),特别是大语言模型(LLM)。这些就是那些能写故事、回答问题甚至辅助编写代码的聪明计算机。大家都在问一个大问题:“这些 AI 侦探是否已经准备好在现实世界的系统出现问题时接管方向盘并进行修复?”这是一个高风险的游戏,因为如果 AI 猜错了,可能会让一个小故障演变成一场巨大的灾难。
这篇名为 ORCA-BENCH 的论文建立了一个巨大且真实的训练场,专门用来测试这一点。研究人员构建了一个虚构但极其详尽的在线商店(称为“天文学商店”),该商店持续运行六天,产生了大量的数字噪音,就像一个繁忙的真实网站一样。随后,他们创建了 1,079 个不同的“神秘事件”,在系统中秘密地破坏了一些东西,并要求五个目前最顶尖的 AI 智能体来破解案件。他们给了这些 AI 与人类工程师相同的工具:访问实时数据流、源代码以及一个模糊的用户投诉。
结果如何?这些 AI 侦探仍处于训练阶段。即使是最优秀的 AI 模型,也只能正确解决约 25% 的“中等难度”案例,而在处理最难的案例时,成功率仅为 10%。换句话说,如果一名人类工程师在测试中只得了 10% 的分数,他会被解雇;但对于这些 AI 来说,这已经是目前的最先进水平。研究发现,当 AI 看不到源代码时,它们的表现会变得更差。或许更令人担忧的是,AI 经常会产生“幻觉”,即它们会自信地编造出根本不存在的问题原因。在一个案例中,AI 将用户购物车失效的原因归咎于某个测试工具中的浏览器崩溃,完全忽略了真正的元凶。
作者得出结论:虽然这些 AI 智能体在编写代码方面表现出色,但它们尚未准备好被信任去守护真实、运行中的系统。AI 在受控测试中所能做到的能力,与维持互联网安全运行所需的水平之间,仍然存在巨大的差距。论文建议,在让我们把“值班”任务交给 AI 之前,我们需要进行更多的工程化工作来提高它们的可靠性,因为目前来看,它们比起解决谜团,更有可能猜错。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。