Understanding User Experiences of Computer Use Agents: Design Space and Opportunities for Building Agent UX Prototypes
本文通过开发一种设计分类法、通过专家研究确定原型设计需求,并引入了能够让开发者设计和评估多样化智能体交互方法的工具“AgentUXlab”,旨在解决目前研究不足的计算机使用智能体用户体验问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的数字助手,它不仅能回答问题,还能真正为你“做事”。它能点击按钮、滚动网页、填写表格,甚至能帮你买咖啡——这一切都是通过观察你的屏幕并理解你的意图来实现的。这并非魔法,而是一种新型的计算机程序,被称为“计算机使用智能体”(computer use agent)。你可以把它想象成一个住在你的浏览器里的机器人管家。长期以来,科学家们一直在教这些机器人如何变得更聪明、更快速,重点在于提升它们的“大脑”(代码和模型)。但他们大多忽略了一个问题:“拥有一个机器人管家是什么感觉?”就像你不会想要一个从不告诉你正在做什么、或者不打招呼就乱拿你钱包的人类助手一样,你需要一个易于信任、易于停止且易于理解的机器人助手。这篇论文深入探讨了这些数字帮手的“个性”与“行为”,研究如何设计它们,以免让用户感到惊恐或在出错时无法修复。
这项研究的研究人员由 Jenny T. Liang 及其团队领导,他们意识到,虽然我们正在制造这些强大的智能体,但我们并没有关于它们在用户面前应该如何表现的“规则手册”。为了解决这个问题,他们展开了一场由三部分组成的冒险,旨在绘制出“设计空间”(即智能体行为的所有可能方式)并构建一个特殊的工具来帮助设计师测试这些行为。
首先,他们扮演了侦探的角色,调查了世界上已有的 11 种不同的计算机智能体。他们采访了 8 位构建这些智能体的专家,并测试了一个虚构的智能体,对象为 20 名普通用户。通过这些工作,他们建立了一个庞大的“菜单”,包含 21 项设计师需要考虑的事项。他们将这些事项分为四个主要类别:
- 用户查询(The User's Query): 你如何与智能体交流。你是给它一个大指令,还是进行来回对话?你使用的是语音、文本还是图片?
- 可解释性(Explainability): 智能体如何展示其工作过程。它会告诉你它正在点击哪里吗?它会在行动前展示它的“思考过程”吗?
- 用户控制(User Control): 你如何停止或更改智能体。你可以暂停它吗?如果它卡住了,你可以接管并亲自完成任务吗?
- 心理模型(Mental Model): 你认为智能体能做什么。智能体会明确表达其局限性,以便你不会期望它去做不可能完成的任务吗?
在拥有了这个菜单后,他们提出了第二个问题:“我们如何实际地‘构建’并‘测试’这些想法?”设计一个智能体非常困难,因为你通常需要成为一名计算机程序员才能让它实现任何功能。因此,该团队采访了另外 12 位包括专家和普通用户在内的人员,以确定什么样的工具能让这项工作变得更容易。他们发现,设计师需要五项主要活动:定义智能体的能力、决定展示哪些信息、设计交互方式、运行智能体以观察结果,以及在出错时进行修复。
为了解决这个问题,他们开发了一个酷炫的新工具,名为 AgentUXlab。想象一下你在玩一个设计者视角的视频游戏关卡。你不需要编写复杂的代码,而是通过拖拽方块(例如“点击此处”、“等待用户”、“展示计划”)来创建一个描述智能体行为逻辑的流程图。然后你可以点击“播放”,并在真实的浏览器中观看你的智能体尝试在真实网站上订购咖啡。如果智能体尝试购买了你并不想要的东西,你可以点击“暂停”,接管操作并进行修正。这个工具让设计师可以实验不同“个性”的智能体——比如,是一个非常话痨、总是请求许可的智能体,还是一个动作极快、默默完成一切的智能体。
最后,他们使用 14 位具有不同经验水平的人员(从软件工程师到从未接触过智能体的普通人)对该工具进行了测试。他们发现该工具效果很好,但也揭示了一些棘手的部分。例如,视觉化的“流程图”(方块)对于观察全局非常有帮助,但有些人觉得编写起来很困惑。另一方面,直接用纯英文输入指令虽然灵活,但有时又过于模糊。最大的惊喜在于,那些正在“设计”智能体的人需要看到更多的信息(如智能体的内部思考和屏幕细节)来进行调试,而使用智能体的“用户”可能并不希望看到这么多干扰信息。
论文指出,为了让这些智能体既安全又实用,我们需要能够让设计师轻松切换不同交互风格的工具。这篇论文并不声称已经解决了所有问题——例如,如何确保用户真正理解智能体的能力范围,仍然存在巨大的疑问——但它为任何试图构建下一代友好型 AI 助手的人提供了一份坚实的地图和一个全新的实验场。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。