← 最新论文
🤖 AI

Measuring Agents in Production

原作者: Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Dav
发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚打造了一支极其聪明的机器人助手(AI Agent)军团,它们可以执行复杂的任务,比如编写代码、管理财务或诊断医疗问题。科技界正为此沸腾,人们想象着这些机器人能够自主运行世界。

但转折来了:目前在现实世界中运行的机器人,并不是科幻电影中那种全能、高度自主的机器人。 它们更像是谨慎、受高度监督的实习生。

这份名为**《衡量生产环境中的智能体》(Measuring Agents in Production, MAP)**的报告,是关于这些 AI 助手在真实企业中究竟在做什么的首份重大“成绩单”。研究人员并没有凭空猜测,而是采访了 20 个构建这些系统的团队,并调查了 86 个真实的部署案例。

以下是他们的发现,用简单的语言解释如下:

1. 为什么公司要构建这些机器人?

目标: 为了节省时间并提高工作效率。
类比: 想象一个工厂。老板的目标不是试图制造一个能从零开始“发明”新汽车引擎的机器人,而是想要一个能比人类“组装”零件快 10 倍的机器人。

  • 80% 的团队表示,他们构建这些智能体是为了提升生产力
  • 他们目前并不想完全取代人类;他们主要是帮助人类员工(如医生、工程师或客服代表)更快地完成工作。
  • 令人惊讶的是: 他们构建这些机器人的目的并不像你想象的那样是为了“降低风险”或“弥补专业知识不足”。主要驱动力仅仅是让事情做得更快。

2. 它们究竟是如何构建的?(“秘密配方”)

如果你观察研究实验室,他们试图构建最复杂、最自主的机器人。但在现实世界中,公司的做法恰恰相反。他们选择的是简单与控制

  • “开箱即用”原则: 70% 的智能体并没有拥有自己的定制大脑。它们只是使用强大的、现成的 AI 模型(就像你可能听说过的那些),并给予它们非常具体的指令。它们不是在重新训练大脑,而是在为大脑编写更好的说明书。
  • “短班制”原则: 在研究领域,智能体可能会尝试自主执行 100 个步骤来解决问题。但在生产环境中,68% 的智能体在执行 10 步 后就会停止,并等待人类检查其工作。
    • 类比: 把它想象成 GPS。研究型机器人可能会尝试在没有驾驶员的情况下开车前往目的地。而生产型机器人会开 10 分钟,然后停下来问:“这是正确的转弯吗?”然后再继续。
  • “人在回路”原则: 74% 的情况下,人类是最终的裁判。机器人会提出建议,但必须由人类说“是的,正确”之后,结果才会发出。

3. 它们如何知道机器人做得好不好?

这是最大的难题之一。

  • 缺乏标准测试: 目前还没有针对 AI 智能体的“SAT 考试”。75% 的团队不使用正式的基准测试,因为这些测试太难制作,或者不存在于他们的特定工作中。
  • “人类裁判”法: 与其用计算机给机器人评分,不如由人类来担任裁判。专家会查看机器人的工作成果,并评价说:“做得好”或“再试一次”。
  • “A/B 测试”法: 有时他们只是让机器人与人类或旧软件系统并行运行,以观察哪一个完成任务的速度更快。

4. 最大的问题是什么?

可靠性。

  • 问题所在: 最大的担忧不是机器人“笨”,而是它可能会犯错,做出奇怪或危险的行为。
  • 解决方案: 公司并不是通过让机器人变得更“聪明”(这很难)来解决这个问题,而是通过设置护栏
    • 他们限制机器人可以执行的步骤数量。
    • 他们强制要求机器人在进行任何冒险操作前必须请求许可。
    • 他们在“沙盒”(一个安全、虚构的环境)中运行机器人,然后再让它接触真实数据。

5. 它们需要多快?

  • 类比: 你不需要一辆 F1 赛车来修剪草坪。
  • 现实情况: 大多数这类智能体的速度其实相当慢。66% 的智能体完成一项任务可能需要几分钟(甚至几小时)。
  • 原因: 因为它们通常是在做后台工作(如处理保险理赔或整理文件)。只要它们完成任务的速度比人类快(即使需要 5 分钟),就被视为成功。它们不需要像语音助手那样瞬间响应。

核心结论

论文得出结论:在现实世界中成功的 AI,不在于构建最自主、最复杂的 AI。 而在于构建简单、可控且能与人类协作的工具。

公司在刻意选择“无聊”和安全。他们放弃了那种能自主完成一切的机器人的“酷炫感”,转而追求一种能完美完成一小部分工作并在遇到困难时向人类求助的可靠性。

简而言之: 今天的 AI 智能体不像(钢铁侠中的)贾维斯(Jarvis)那样是全自主的 AI,而更像是一个非常乐于助人、但有点谨小慎微的助手,在发送邮件之前会反复向老板确认。而这正是它们在现实世界中取得成功的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →