✨ 要点🔬 技术摘要
想象一下,你有一位名叫 cotomi Act 的新实习生,它聪明得令人难以置信。与其他只会等待你下达指令清单、任务完成后便忘得一干二净的实习生不同,cotomi Act 拥有一项超能力:它通过观察你来学习。
以下是这篇论文如何解释这一超能力,将其拆解为简单概念:
1. 问题:患有“失忆症”的实习生
大多数试图为你执行网络任务的计算机程序,就像那位健忘的实习生。它们非常擅长遵循单一、清晰的指令(例如“查找这双鞋的价格”),但它们不知道你 公司的“内部秘密”。它们不知道:
通常由谁批准这些请求?
你们团队使用的特定行话是什么?
哪些任务已经进行了一半?
由于缺乏这种“内部知识”,它们要么问太多问题(拖慢你的进度),要么猜错(导致错误)。
2. 解决方案:两项超能力
作者为 cotomi Act 构建了两种独特的“肌肉”来解决这个问题:
肌肉 A:“超级跑者”(执行)
系统的这一部分旨在真正在网络上 执行工作,而不会感到困惑。
类比: 想象你在跑马拉松。如果你试图记住从起跑线开始走过的每一步,你的大脑会爆炸。你只需要记住场景的变化 (例如:“我刚刚经过了饮水站”)。
工作原理: cotomi Act 不使用冗长乏味的历史点击记录来喂养 AI,而是采用一种“懒惰”策略。它只仔细观察当前屏幕上的内容,并总结上一步 以来的变化 。这让 AI 的大脑保持轻盈和快速。
结果: 在一项名为"WebArena"的艰难测试中(这就像现实世界网络任务的电子游戏),这位“超级跑者”正确完成了 80.4% 的任务。这实际上优于平均水平的人类 (在同一测试中,人类正确率为 78.2%)。
肌肉 B:“影子抄写员”(学习)
这是后台观察你工作的部分。
类比: 想象一位抄写员安静地坐在你身后,观察你浏览网页。与其仅仅录制你屏幕的原始视频(这既杂乱又庞大),这位抄写员会做笔记,并将它们转化为有用的工具:
任务板: 你正在处理的工作列表。
维基(Wiki): 团队行事规则的指南(例如:“我们打印时总是使用供应商 X")。
时间线: 你近期活动的日历。
转折: 这不是一本秘密日记。它是一个共享工作空间 。你可以看到抄写员写了什么,如果错了就修正它,或者添加笔记。AI 阅读这些笔记来理解你的世界。
3. 它们如何协同工作
这篇论文描述了一个称为 “观察 → 提取 → 行动” 的循环。
观察: 你正常浏览网页。“影子抄写员”在一旁观察。
提取: 系统将你杂乱的浏览行为转化为整洁、有条理的笔记(例如“如何订购硬件”指南)。
行动: 稍后,当你要求 AI“订购一些硬件”时,它不会猜测。它会查看它从你那里学到的“如何订购”笔记,遵循这些步骤,并完成任务。
4. 证据
研究人员通过“代理”实验(真实工作的模拟)测试了这一点。
发现: 当 AI 没有关于你行为的笔记时,它经常失败。
改进: 随着 AI 收集更多关于你工作方式的笔记(行为知识),其成功率显著提高。
局限: 有趣的是,如果 AI 只是试图死记硬背你屏幕的原始、杂乱的录像日志,它起初的表现反而更差 。它需要“影子抄写员”先对信息进行总结和清理。
5. 实时演示
论文提到了一个实时演示,人们可以尝试使用它。他们可以:
要求 AI 执行任务(例如查找会议截止日期)。
查看“共享工作空间”,了解 AI 学到了关于他们习惯的哪些内容。
在任务板上编辑任务,并观察 AI 立即利用这些新信息开始处理正确的事情。
总结
cotomi Act 是一个浏览器助手,它不仅仅遵循指令;它观察你的工作,将你的习惯转化为共享规则手册,并利用该规则手册成为更好、更可靠的同事。它证明了,通过将快速、智能的执行 与从日常行为中学习 相结合,AI 实际上可以在复杂的网络任务上超越人类。
技术摘要:cotomi Act
问题陈述
当前计算机使用代理(CUAs)面临双重局限,使其无法作为可靠的组织同事发挥作用。首先,尽管大语言模型(LLMs)在推理能力上有所提升,但它们仍难以满足长视野、多步骤网络任务所需的可靠性,在 WebArena 等基准测试中往往低于人类基线。其次,且更为关键的是,现有代理缺乏组织知识 。它们在运作时无法感知隐性偏好、未成文的工作流程、内部术语或待处理任务的当前状态。这迫使代理要么频繁提出澄清问题(降低效率),要么静默猜测(增加出错风险)。此外,工作中至关重要的知识——人们实际的操作方式——很少记录在静态存储库中,使得仅靠检索增强生成(RAG)不足以应对。
方法论
本文提出了cotomi Act ,这是一个基于浏览器的代理,通过两个集成组件解决上述挑战:用于执行的稳健代理脚手架 (Agent Scaffold)和用于学习的行为到知识管道 (Behavior-to-Knowledge Pipeline)。
1. 代理脚手架(执行)
该脚手架管理代理的 ReAct(推理 - 行动)循环,优化上下文窗口和动作空间以处理复杂的网络任务。它采用四种关键机制:
自适应惰性观察 :代理默认仅观察视口可见元素,仅在需要时请求完整可访问性树,而非在每一步都输入完整树。这显著降低了延迟(每项任务从 471 秒降至 184 秒),同时保持了准确性。
基于语言差异的历史压缩 :系统不使用会膨胀上下文窗口的原始历史观察,而是用自然语言描述的变化(语言差异)替换陈旧历史。与标准差异格式相比,这降低了 3.8 倍的令牌成本,同时更好地保留了语义上下文。
粗粒度动作 :动作空间被抽象为仍能覆盖常见交互的最高层级(例如,使用 scrollInto(element) 而非像素级滚动)。这减少了完成任务所需的步骤数,防止上下文溢出。
测试时扩展 :系统利用最佳 N 选动作 (best-of-N action selection)和任务分解 (为独立子目标生成并行子代理)来降低方差并处理长视野任务。
2. 行为到知识管道(学习)
为了获取组织知识,cotomi Act 被动观察用户的浏览行为,并将其抽象为结构化工件。
捕获 :后台监控器记录站点级操作、标签页转换和屏幕截图,利用基于差异的压缩技术减少噪声。
抽象 :由 LLM 驱动的代理式 ETL(提取 - 转换 - 加载)管道处理这些事件。它将原始事件分割为任务级片段,将其总结为结构化记录,并将其聚合为知识工件。
共享知识工作区 :生成的工件存储在用户和代理均可访问的共享工作区中。这些包括:
活动时间线 :基于日历的用户活动视图。
任务板 :一个共享数据库,代理在其中提出状态更新,用户予以批准。
Wiki 页面 :从行为中提炼出的程序性笔记、规则和惯例。
隐私 :该系统严格遵循自愿加入原则,在工件写入工作区之前应用个人身份信息(PII)屏蔽。
3. 人机协作
该工作区充当“边界对象”。当指令模糊或需要上下文时,代理通过 search_workspace 工具查阅这些工件。关键在于,该循环是双向的:用户可以检查、编辑并批准代理推导出的知识,从而确保与实际情况的一致性,而无需显式同步。
主要贡献
cotomi Act 系统 :这是一个基于浏览器的代理,在 179 项任务的 WebArena 人类评估子集上实现了**80.4%的成功率,超过了 78.2%**的已报告人类基线。这是通过自适应惰性观察、语言差异历史、粗粒度动作和测试时扩展的特定组合实现的。
行为到知识管道 :一种新颖的方法,通过被动观察用户浏览,将原始事件逐步抽象为共享工作区内的可重用知识工件(任务板、Wiki、时间线),从而实现持续学习和透明对齐。
实证验证 :一项受控的代理评估表明,随着代理积累更多源自行为的知识,下游任务的成功率得到提升,验证了从观察中学习的功效。
结果
执行性能 :在 WebArena 人类评估子集上,cotomi Act 实现了**80.4%**的成功率。基础脚手架(无测试时扩展)达到了 76.5%,而加入最佳 N 选和任务分解带来了额外的 3.9% 提升。这一性能超过了 78.2% 的人类基线以及 OpAgent(71.6%)等之前的最先进代理。
知识影响 :在基于 WorkArena-L1 的受控研究中,随着行为知识的领域覆盖率增加,任务成功率普遍提高。
在0% 覆盖率 下,基线成功率约为 51%。
在100% 覆盖率 下,成功率最高提升了10 个百分点 。
研究指出,虽然原始轨迹在低覆盖率下可能因噪声而降低性能,但抽象格式(脚本和洞察)保持稳定。
服务目录领域的一个具体案例研究显示,在代理获取了 48 个源自用户行为的程序性脚本后,成功率从约 75% 跃升至约 99% 。
意义
本文声称,cotomi Act 展示了为 AI 代理实现组织落地 的实用路径。通过将能够在标准化基准测试中超越人类性能的脚手架与一种从日常行为中学习隐性、未成文工作流程的机制相结合,该系统超越了“无状态执行者”的角色,转变为“情境化同事”。其意义在于双向循环 :代理从用户那里学习,但用户也通过共享工作区策展代理的知识库,确保自动化与不断演变的组织现实保持一致,而无需手动文档化。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。