← 最新论文
💻 computer science

AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

AgentPulse 引入了一种连续的多信号评估框架,通过聚合来自采用率、社区和生态系统来源的实时数据,补充静态基准测试,从而对人工智能代理在实际部署场景中的性能与影响提供全面评估。

原作者: Yuxuan Gao, Megan Wang, Yi Ling Yu

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxuan Gao, Megan Wang, Yi Ling Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图购买一辆新车。

目前,我们评估 AI“智能体”(能够执行编写代码或浏览网页等任务的智能软件)的方式,就像在实验室里查看一张汽车引擎的静态照片。我们会进行测试,看它在赛道上的加速性能(即“基准测试”)。如果它赢得了比赛,我们就说这是一辆好车。

但这里有个问题:一辆在实验室比赛中获胜的汽车,可能在雨天根本无法驾驶,可能一周后就会抛锚,或者价格昂贵到无人负担得起。这张实验室照片无法告诉你人们是否真的购买了这辆车,机械师是否信任它,或者驾驶员是否享受驾驶体验。

AgentPulse 是一个旨在解决这一问题的新框架。它不再只是拍摄引擎的照片,而是安装了一个持续运行的仪表盘,在汽车实际行驶于真实道路上时对其进行追踪。

以下是其工作原理的简要分解:

1. 仪表盘上的四个表盘

AgentPulse 不是只看单一分数,而是观察四个不同的“表盘”,以全面呈现 AI 智能体的全貌:

  • 表盘 1:实验室测试分数(基准测试表现)
    这是旧有的方式。它衡量智能体解决特定难题(例如修复代码错误)的能力。这很重要,但只是故事的一部分。
  • 表盘 2:人气计(采用信号)
    它询问:“真的有人在用吗?”它统计有多少人下载了该软件、在代码共享网站(如 GitHub)上获得了多少星标,以及有多少人将其安装到了自己的开发工具中。如果一个智能体很聪明但无人使用,这个表盘就会显示低分。
  • 表盘 3: chatter 箱(社区情绪)
    它倾听人们在社交媒体、论坛和代码板上的言论。开发者们开心吗?他们感到沮丧吗?这个工具可靠,还是经常崩溃?它利用 AI 阅读成千上万条帖子,以此判断整体情绪。
  • 表盘 4:健康检查(生态系统健康)
    它审视软件背后的团队。他们是否仍在更新?是否有许多人协助修复错误?文档是否完善?这就像检查汽车制造商是否仍在运营,以及零部件是否容易找到。

2. “神奇”的发现

研究人员做了一件巧妙的事情来证明他们的仪表盘有效。他们仅使用实验室测试分数chatter 箱(完全忽略人气计和健康检查)构建了一个“迷你分数”。

然后,他们问道:“这个迷你分数能否预测这辆车实际上有多受欢迎?”

答案是肯定的。即使不看人气数据,将“它有多聪明”和“人们在说什么”结合起来,也能成功预测有多少人下载它,以及有多少人围绕它提出问题。这证明他们的仪表盘并非仅仅是循环论证;它实际上捕捉到了旧有的“实验室测试”照片所遗漏的真实世界价值。

3. 意外的转折:聪明 vs. 受欢迎

当他们比较旧的“实验室测试”排名与新的“仪表盘”排名时,发现了一些有趣的错位:

  • “闭源”之谜:一些非常聪明的智能体(如"Devin"或"OpenAI Codex")在实验室测试中得分极高,但在仪表盘上的排名却较低。为什么?因为它们是“闭源”的(你无法查看其代码或轻松下载它们)。仪表盘无法看到它们被使用,因此给了它们较低的分数。论文承认,这并不是因为那些智能体不好,而是因为仪表盘无法“看到”它们。
  • “社区英雄”:一些智能体(如"Cline")在实验室测试中并未以巨大优势获胜,但它们极其受欢迎,深受社区喜爱。仪表盘给予它们的排名远高于实验室测试,正确地识别出它们是人们真正信任和使用的工具。

4. 这是什么(以及不是什么)

作者非常清楚地说明了他们构建的内容:

  • 它不是最终的“最佳智能体”榜单。他们不声称拥有唯一正确的答案。
  • 它确实是一种新的衡量方式。它是一个工具,帮助我们看清一个理论上聪明的智能体与一个实际上有用的智能体之间的区别。

核心结论

将 AgentPulse 视为 AI 智能体的持续健康监测仪。如果说旧的基准测试就像每年只做一次的血检,那么 AgentPulse 就像一块智能手表,每秒钟都在追踪心率、步数和睡眠。它不仅告诉我们 AI能否完成任务,还告诉我们它是否以一种开发者真正信任、使用并享受的方式在完成任务。

研究人员已免费发布了所有数据和工具,因此任何人都可以亲自查看仪表盘,看看这些“汽车”在真实道路上的实际表现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →