Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions
本立场论文指出,现有的基准测试由于未考虑用户调节的状态演化,导致无法评估时间干预下的个人大语言模型智能体,并据此提出了一种具有特定条件和指标的新型评估协议以填补这一空白。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在建造一个机器人管家。在机器人的早期阶段,我们在无菌实验室里测试它们:我们给它们一个干净的杯子,要求它们清洗,并检查它们是否在不弄碎杯子的前提下完成了任务。如果它们通过了,它们就是“优秀的”。但现实生活并非无菌实验室。现实生活是混乱且琐碎的。你的机器人管家和你一起生活。它记得你喜欢咖啡加两勺糖,记得你讨厌灯光闪烁,还学会了为了打开你的智能冰箱而跳一种特定的舞蹈。它拥有关于你习惯的长时记忆,以及一套专为你的家所习得的技能。
现在,想象智能冰箱制造商发送了一个软件更新,改变了门开启的方式。在旧的实验室测试中,机器人可能只是尝试打开门失败了一次,然后就停止了。但在你的家中,机器人可能会陷入恐慌。因为它记得门以前的工作方式,它可能会试图强行打开,从而损坏把手,并因为陷入混乱而意外洒掉你的咖啡。问题不仅仅在于机器人失败了;更在于它的“个人记忆”和“习得习惯”让这种失败蔓延到了你生活的其他部分。这篇论文的研究课题,就是探讨如何测试机器人,不仅是看它们能否完成一项任务,还要看当世界发生变化时,它们如何处理这些充满个人色彩、混乱且带有记忆痕迹的灾难。
论文:为什么你的机器人管家可能会忘记你是谁(以及为什么我们需要一种新测试)
这篇论文的作者们来自卡内基梅隆大学和佐治亚理工学院等机构的研究团队,他们正在关注“个人人工智能代理”(Personal AI Agents)测试中的一个特定盲点。这些是那些被设计为了解你、记住你的偏好并随着时间学习你日常习惯的高级AI助手。
目前,当科学家测试这些AI代理时,他们将它们视为独立的、孤立的机器。他们有一个“记忆测试”,看AI是否记得你的生日;有一个“工具测试”,看AI是否会使用计算器;还有一个“安全测试”,看AI是否会拒绝说些伤人的话。但作者认为,这就像是在三个不同的日子、三个不同的车库里分别测试汽车的刹车、引擎和GPS,然后得出结论说:“太棒了,这辆车很安全!”
现实情况是,这些功能都是相互关联的。如果GPS接收到了更新(即“时间性干预”),它可能会干扰引擎,进而导致刹车失效。在AI的世界里,如果一个API(AI使用的工具)发生了变化,一个拥有“记忆”的AI可能会尝试使用旧的指令,这可能会破坏它学到的某项技能,进而违反它本应遵守的安全规则。
重大发现:不存在“完美风暴”测试
研究人员致力于寻找一种能够捕捉这种特定复杂性的测试。他们提出了一个“完美风暴”测试应具备的四个规则:
- 变化: 在AI工作期间,世界中的某些事物必须发生变化(例如工具更新)。
- 记忆: AI必须在变化发生后,依然携带其个人历史(记忆、技能、设置)。
- 涟漪效应: 测试必须衡量这种变化如何破坏AI正在进行的“其他事情”(例如,一段记忆导致了一个工具失效)。
- 个人化: 测试必须展示出同样的改变会对不同的人造成不同的影响。一个“轻度用户”(不太依赖AI的人)可能没问题,但一个“重度用户”(其整个生活都依赖AI记忆的人)可能会面临彻底的崩溃。
随后,作者展开了一场侦探式的搜寻。他们查看了目前市面上15个最流行的公开AI代理测试,并根据这四个规则进行了比对。
结果如何? 他们没有发现任何一个能通过全部四项规则的测试。
这有点像是在寻找一场车祸测试,而这场测试要求在模拟碰撞的同时,驾驶员还在发短信、收音机正大声播放音乐、且GPS正在重新规划路线,同时还要测试不同类型的驾驶员对此的反应。他们找到了关于碰撞的测试,找到了关于发短信的测试,也找到了关于GPS的测试。但他们完全没有找到任何一个结合了所有这些因素、用以观察个人背景如何改变结果的测试。
为什么这很重要
论文指出,如果没有这些新测试,我们就像是在盲目飞行。我们可能会造出一个在实验室里表现完美,但在现实世界中却由于其“个人状态”(记忆和习惯)而变得脆弱不堪的AI。
为了解决这个问题,作者提出了一种新的设计测试的方法。他们建议为测试创建“用户画像”。想象一下,针对同一个测试,你有两个版本的AI:
- 用户 A(轻度用户): 没有特殊的记忆或技能。当工具发生变化时,他们只是尝试再次操作并成功了。
- 用户 B(重度用户): 拥有关于旧工具的记忆、基于旧工具习得的技能,以及一个假设旧工具依然存在的安全设置。当工具发生变化时,这个AI可能会感到困惑,尝试使用旧工具,失败,并在试图修复问题时意外违反了安全规则。
论文建议测量诸如“适应延迟”(恢复所需的时间)和“回归率”(有多少旧任务突然停止工作)等指标。他们甚至创建了一个样本“基准卡片”(测试配方),涉及一个必须应对数据存储方式突然变化的报告助手。
核心结论
作者并不是在声称他们已经造出了完美的AI。他们甚至不是在说现在的AI是坏掉的。他们的意思是:“我们还没有一把尺子,能够衡量这种特定类型的失败。”他们呼吁业界构建这些更复杂的测试,因为个人化AI不仅仅是一个工具;它是一个拥有记忆的伙伴,而当世界发生变化时,这种记忆可能会成为一种负担。在我们建立起这些测试之前,我们无法真正知道我们的个人AI代理是否已经准备好迎接现实世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。