← 最新论文
🤖 AI

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

该论文提出了 Proactive Agent Research Environment (Pare) 框架及其基准测试 Pare-Bench,通过将应用程序建模为具有状态感知的有限状态机,解决了现有方法无法模拟真实用户交互序列的问题,从而实现了主动智能体在数字环境中的构建与评估。

原作者: Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Pare 的新框架,以及一个名为 Pare-Bench 的测试标准。简单来说,他们是为了解决一个核心问题:如何在一个虚拟世界里,真实地测试那些“未卜先知”的 AI 助手?

想象一下,你希望你的手机助手不仅能听你指挥(比如“帮我订个闹钟”),还能在你还没开口时就猜到你的需求(比如看到你在看机票,自动帮你查好酒店,并问你要不要预订)。这种助手叫**“主动式助手” (Proactive Agent)**。

但以前的测试方法有个大毛病:它们就像是在演独角戏。以前的测试里,AI 助手在表演,但“用户”只是个只会按剧本念台词的机器人,或者根本不存在。这导致 AI 无法学会如何真正理解人类的需求,因为人类的需求往往是动态的、隐晦的。

为了解决这个问题,作者们造了一个**“数字游乐场”**。

1. 核心概念:不对称的“猫鼠游戏”

在这个游乐场里,作者设计了一种非常聪明的**“不对称”**机制,就像现实生活中的手机使用一样:

  • 普通用户(模拟用户):就像你和我一样,必须一步一步操作。想发个邮件?你得先点开邮件图标,再点“写邮件”,填收件人,再点发送。在系统里,这被建模为**“有限状态机” (FSM)**。你可以把它想象成一个迷宫,用户必须沿着墙壁(屏幕界面)走,不能穿墙,也不能直接瞬移到终点。
  • AI 助手(主动代理):就像拥有“上帝视角”和“后台权限”的超级管理员。它不需要点来点去,它可以直接调用所有 App 的**“后台 API"**(就像直接修改数据库)。它可以看到用户看不到的完整信息(比如邮件的全文),而用户只能看到通知栏里的一行字(截断信息)。

比喻:
想象你在玩一个复杂的电子游戏(用户),你必须按手柄一步步操作角色走路、开门、拿钥匙。而 AI 助手是那个坐在控制台前的游戏管理员,它可以直接输入代码让门打开,或者直接把钥匙变到你手里。
Pare 框架的精髓就在于: 它强迫 AI 助手必须先观察你这个“普通玩家”在迷宫里怎么走,猜出你想去哪,然后申请你的同意,最后才动用它的“管理员权限”帮你把事办了。

2. 测试场:Pare-Bench

有了这个游乐场,作者们还设计了一套**“考题”**,叫 Pare-Bench
这套考题包含 143 个不同的场景,涵盖了聊天、日程安排、购物、生活琐事等。

  • 考题长什么样?
    比如:你收到一条短信,室友说“没肥皂了”。你正在看购物清单,清单还没写完。
    • 普通助手:等你问“帮我买肥皂”时,它才会行动。
    • 主动助手:它看到短信 + 看到你的购物清单,立刻推断出“你需要买肥皂”,然后主动问你:“嘿,我看到你室友说没肥皂了,要不要我帮你把肥皂加到购物清单里?”

这套考题专门测试 AI 的四个能力:

  1. 观察力:能不能注意到你正在做的事和收到的消息。
  2. 猜心术:能不能从你的行为里猜出你的真实目标。
  3. 时机感:是不是在你最需要的时候介入,而不是在你忙得焦头烂额时乱插嘴。
  4. 多任务协调:能不能同时操作多个 App(比如从邮件里提取时间,自动填入日历)。

3. 实验结果:AI 们表现如何?

作者们找了 7 个不同的 AI 模型(包括目前最顶尖的模型)来玩这个游戏。结果很有意思:

  • 顶尖模型也不完美:即使是最好的模型(如 Claude 4.5, Gemini 3),成功率也只有 42% 左右。这意味着它们还经常猜错,或者介入的时机不对。
  • 小模型更吃力:较小的模型(如 Llama 3.2, Gemma)表现较差,成功率只有个位数。它们要么太笨猜不出意图,要么猜对了但执行任务时手忙脚乱。
  • 关键瓶颈:研究发现,对于小模型,“执行任务”(比如真的去操作 App)比“猜意图”更难。它们经常想帮倒忙,或者因为操作太复杂而失败。
  • 噪音干扰:当系统里有很多垃圾邮件或无关通知(噪音)时,有些模型会迷失方向,提出很多错误的建议;而优秀的模型能像老练的侦探一样,过滤掉噪音,只关注重要线索。

4. 为什么这很重要?(未来展望)

这篇论文不仅仅是一个测试,它提出了一个未来的愿景

  • 隐私保护:因为 AI 需要观察你的行为,如果这些数据都上传到云端,隐私就泄露了。作者建议,这种“观察”应该由手机本地的 AI(小模型)完成,只有当你确认它猜对了,才把具体任务交给云端的大模型去执行。这样,你的隐私数据(比如你看了什么邮件)始终留在手机里。
  • 人类掌控权:主动式助手最大的风险是“自作主张”。Pare 框架强制要求 AI 在动手前必须**“询问并获得许可”**。这就像是一个得体的管家,他会说:“主人,我看您好像要出门,需要我帮您叫车吗?”而不是直接帮你叫了车。

总结

Pare 就像是一个**“主动式助手的驾校”
以前的驾校只教车怎么开(怎么调用工具),但没教车怎么观察路况和乘客(怎么理解用户)。
现在,Pare 造了一个有真实“乘客”(模拟用户)和复杂“路况”(状态机界面)的考场,让 AI 学习如何
观察、猜测、询问、然后行动**。

虽然现在的 AI 司机还经常开错路,但这个框架让我们第一次有了衡量它们是否真正“懂事”的标准,也为未来开发既聪明又尊重隐私、既主动又听话的 AI 助手铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →