← 最新论文
💬 NLP

PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails

本文介绍了 PersonaTrail,这是一个用于评估个性化网络智能体从原始浏览历史中推断用户偏好能力的基准测试,以及 PACMem,一个将此类历史结构化为事实记忆和偏好记忆的框架,该框架显著提升了导航性能。

原作者: Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手,它可以为你浏览互联网。你对它说“找一部电影”,它就去做了。但在现实世界中,你很少给出完美的指令。你可能会说,“帮我找一部像我平时看的那种类型的电影,”或者“给我看上周二我找过的那个食谱。”为了做到这一点,机器人需要记住你的过去习惯和数字生活中的特定时刻。这就是**网络智能体(web agents)**的世界:一种像人类一样在网站上操作、点击按钮并阅读页面的软件。有一段时间,科学家们使用非常严格、完美的指令来测试这些机器人,就像处理一道所有数字都已填好的数学题。但这并不符合真实生活。现实生活是混乱的,充满了未完成的想法和对几天前所做之事的记忆。一个大问题是:这些机器人真的能从你混乱的历史中学习到“你”吗,还是它们只是在盲目地执行命令?

这篇论文介绍了一种测试这些机器人的新方法,叫做 PERSONATRAIL。研究人员构建了一个巨大的游乐场,他们在其中创建了虚构但真实的“用户”,他们拥有特定的爱好、职业和品味。然后,他们观察这些用户如何浏览网页,从而创造出一条由点击、搜索和页面访问组成的漫长轨迹。他们给了机器人两个棘手的挑战。首先是偏好推理(Preference Inference):机器人必须根据模式来猜测你的喜好。例如,如果你总是点击“悬疑”类电影和“一锅出”食谱,机器人需要推断出你热爱悬疑和简易烹饪,即使你没有明说。第二是情境锚定(Episodic Grounding):机器人必须找到一段特定的记忆。如果用户说,“给我看上周二我搜过的那个咖喱食谱,”机器人必须挖掘其记忆库以找到那个精确的时刻并回到那里。

研究人员发现,大多数现有的机器人表现得很糟糕。它们就像是那些背下了教科书却无法将知识应用到新情况中的学生。当机器人试图回忆你的过去时,它们经常丢弃重要的细节,比如你点击了“什么”,而只保留了你点击方式的“大致概念”。为了解决这个问题,团队构建了一个新的记忆系统,称为 PACMEM。把 PACMEM 想象成机器人的一个超级有序的图书管理员。它不是简单地把一堆纸扔在桌子上,而是将它们分装在两个特殊的箱子里。其中一个箱子是事实记忆(Factual Memory),它是对特定日期发生事件的日记记录(例如,“5月24日,莎拉看了《密处惊魂》”)。另一个箱子是偏好记忆(Preference Memory),它是对你习惯的总结(例如,“莎拉总是选择悬疑类电影且评分高于6.0”)。

当机器人收到一个问题时,PACMEM 不会只是把所有的历史记录都倒给它。它会快速检查:如果问题是关于特定日期的,它会查看“日记箱”;如果问题是关于你喜欢什么的,它则会查看“习惯箱”。结果显示,使用这种双箱系统的机器人比旧系统更能解决这些个性化谜题。它们不仅仅是在猜测,而是真正利用正确的线索找到了正确的电影或食谱。论文指出,为了让机器人能在现实世界中真正帮助我们,它们需要停止将我们的浏览历史视为一堆混乱的垃圾,而是开始将其组织成清晰的故事和习惯。虽然这是一个巨大的进步,但研究人员也指出,现实生活比他们的测试更加复杂,存在着会变化的习惯以及无法回答的问题,但这个新系统为构建更聪明、更个性化的助手打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →