← 最新论文
🤖 AI

JarvisBench: Always-on Intelligence Between Humans and Agents

本文介绍了 JarvisBench,这是一个基准测试和框架,旨在评估一个始终在线的注意力协调层,该层负责在间歇性人类用户与持续执行长程任务的智能体之间,介导多样化多智能体任务中的双向交互。

原作者: Chen Chen, Zhehuai Chen

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Chen Chen, Zhehuai Chen

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在快速发展的人工智能世界中,一种新型机器已经出现:自主智能体(autonomous agent)。它们不是那种等待指令执行单一动作的简单工具,而是能够独立承担长期、复杂项目的数字员工。它们可以不间断地编写代码、分析数据或管理日程长达数小时。然而,在这些不知疲倦的机器与它们所服务的对象——人类之间,存在着一种根本性的错位。人类的注意力是一种有限的资源;我们无法每秒钟都盯着屏幕,也无法不断中断机器去询问问题。相反,机器无法通过读心术来了解我们何时需要介入,或者它们何时犯了需要我们进行判断的错误。这造成了一个困难的协调问题:如果人类停止关注,机器可能会偏离轨道;但如果机器不断索求关注,则会变得低效且令人沮丧。研究人员面临的挑战是构建一个能够弥合这一差距的系统,让位于人类的参与,同时又不至于让其被持续不断的数字工作声所淹没。

为了解决这个问题,NVIDIA 的一个研究团队引入了一个名为 JarvisBench 的新框架,其名称取自《钢铁侠》电影中的虚构助手,旨在测试一种特定的“始终在线”的协调层。想象一个繁忙的办公室,一个团队正在建造一个复杂的结构。在过去,管理者可能必须要么时刻盯着工人,要么在项目完成前盲目信任他们。这个新系统充当了一位专门的监督员,他观察着工人们,能即时回答管理者的提问,并清楚地知道何时该拍拍管理者的肩膀以寻求关键决策。这位监督员并不亲自进行建设;他只是管理着人类与工作智能体之间的信息流和注意力流。研究人员创建了一个严谨的测试场,以观察这种监督员是否真的能提高工作质量,并在不引发混乱的情况下让用户保持参与感。

研究人员构建了一个包含 45 个不同场景的基准测试,范围从单个智能体执行的任务到涉及十个不同智能体协同工作的复杂项目。这些任务跨越了 19 个不同的领域,从软件开发到创意写作,并且是从数千个公开候选方案中精心挑选出来的,以确保其真实性。至关重要的是,在这些测试中,对人类帮助的需求并非通过初始指令缺失来强制要求的。相反,对人类判断的需求是随着工作的进展自然产生的。例如,一个智能体可能正在撰写一份报告,突然遇到一个情况,它必须在两条有效但截然不同的路径之间做出选择,而这两条路径在初始指令中既没有被明确禁止,也没有被明确要求。就在那一刻,系统必须识别出需要人类决策,暂停工作,向人类寻求指导,然后无缝地带着新的方向恢复任务。

该研究测量了两个主要指标,以观察这种协调层是否奏效。首先,他们测试了系统能否成功识别请求人类帮助的正确时机,以及这样做是否能改善最终结果。其次,他们测试了系统能否在不干扰工作者的情况下,回答人类关于正在进行的工作的提问。结果显示,添加这种协调层一致地提高了智能体的表现。当系统处于激活状态时,智能体完成任务的得分显著提高,根据任务复杂度和所涉及智能体的不同,提升幅度在 5 到 25 分左右。该系统在多智能体项目中表现得尤为出色,其中不同工作者与人类监督员之间的协调带来了高达 28 分的增益。

然而,研究人员发现,并非所有的“监督员”都是平等的。系统的性能很大程度上取决于用于运行协调层的特定人工智能模型。其中一个特定的模型——GPT-5.6-Sol 脱颖而出,成为了最有效的模型,它能提供最高质量的问题答案以及最大的任务成果提升。研究人员也测试了其他模型,虽然它们相比于完全没有监督员的情况都有所改进,但在利用人类注意力方面效率各异。有些模型请求帮助的频率更高,但回报较少;而有些模型则更为精挑细选。研究还测量了系统响应人类说话的速度,发现响应速度取决于处理语音和生成回复的具体技术,一些系统可以在两秒内做出响应。

研究人员特别指出,该系统并不取代工作智能体,也不改变它们的思考方式。相反,它作为一个外部层,负责观察工作并管理对话。这种设计允许相同的协调系统与不同类型的智能体配合使用,而无需重新构建这些智能体本身。研究还强调了一个权衡:请求更多的输入可以带来更好的结果,但也消耗了更多的人类时间和注意力。他们构建的系统允许调整这种平衡,让用户决定参与程度的高低。虽然目前的原型是一个参考点而非最终产品,但它证明了将“执行任务”与“管理注意力”分离是一种可行且强大的策略。通过创建一个对人类始终可用、但对工作者的内部逻辑而言是透明的专用接口,人们可以使复杂的长期项目与人类需求保持一致,而不必让用户一直盯着屏幕。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →