AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
本文介绍了 AnovaX,这是一款本地优先的多智能体语音助手,它完全在用户设备上运行,通过大语言模型规划器、类型化工具智能体和自适应恢复机制来编排桌面交互,同时通过配套的手机界面实现实时的远程控制与监控。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
寄宿在你机器里的声音
想象一下,你的口袋里住着一个超级聪明的助手,它能听懂你的声音,理解复杂的请求,甚至能控制你的电脑。多年来,这个想法一直被 Siri 或 Alexa 等“云端”助手所主导。把这些云端助手想象成信使,它们接收你的声音,将其传送到数英里之外的巨型服务器集群,获取答案后再跑回来。虽然速度很快,但这同时也意味着你的私人对话离开了你的家,而且这个助手只能执行一组预设好的固定动作。这就像请了一位管家,但他只能打开你已经安装好的门,却无法拿起一支笔为你写字。
人工智能(AI)领域最近发现,大型语言模型(LLM)在理解人类语言方面表现得极其出色。然而,一个新的问题出现了:我们能否构建一个留在你的电脑内部、保护你的隐私不外泄,并且能够真正操作你的桌面——比如打开应用程序、输入文本或点击按钮,而不仅仅是回答常识性问题?这篇论文探讨了一个名为 AnovaX 的项目,它试图构建一个“本地优先”的语音助手。AnovaX 不会将你的声音发送到云端,而是完全在你的笔记本电脑上运行。它使用一个智能规划器来决定做什么,但依靠一组专门的、预设好的“工人”来实际操作键盘和鼠标。其目标不是要在巨头擅长的领域击败他们,而是为了证明,即使由一个人构建,也能建立一个小型、可读且安全的系统,从而在不需要为每一步都连接云端的情况下控制自己的机器。
AnovaX:不需要云端的本地管家
认识一下 AnovaX。它是一个完全生活在你的笔记本电脑上的语音助手,旨在成为大型云端助手的一个透明、安全且本地化的替代方案。创造者构建它,是为了证明你不需要一个庞大且不透明的系统来控制你的电脑;你只需要一小群组织有序的数字工人。
核心理念:一个规划者与一支专家团队
想象你是一位繁忙办公室的老板。你不想亲力亲为每一项任务;你想进行委派。在 AnovaX 中,“老板”是一个聪明的 AI 规划器(使用名为 Gemini 的模型)。当你通过语音说“打开记事本并写一个故事”时,规划器并不会尝试亲自打字。相反,它会用一种特殊的代码(JSON)写下一个快速计划,并将其交给多智能体编排器(Multi-Agent Orchestrator)。
把编排器想象成一位虽然忙碌但高效的舞台监督。它接收规划器的清单,并将每项任务分配给特定的“子智能体”。
- AppAgent 负责启动程序。
- TypingAgent 负责实际在键盘上打字。
- BrowserAgent 处理网页搜索。
- MediaAgent 负责截取屏幕截图。
每一个这样的智能体都是一个拥有自身规则的小型专业机器人。例如,TypingAgent 有一条严格的规则:在开始打字之前,它必须等待键盘处于空闲状态,以免与其他试图按键的智能体发生冲突。这种系统允许助手同时执行多项任务。如果你要求它“截个图并告诉我时间”,编排器会将这两个任务同时发送给两个不同的智能体,从而节省你的时间。
安全第一:双重检查关卡
关于 AI,人们最大的担忧之一是它可能会做出危险的行为,比如删除你的文件。AnovaX 通过“两阶段安全过滤器”解决了这个问题。
- 软过滤(Soft Filter): AI 规划器会被告知一个“禁用词”列表(如“删除”或“格式化”),并被要求不得使用这些词。
- 硬过滤(Hard Filter): 在任何智能体被允许触碰你的电脑之前,一个 Python 程序会根据严格的“白名单”(仅允许经过批准的工具)和“黑名单”(禁止使用的关键词)对计划进行检查。如果计划试图混入危险指令,整个过程会被立即拦截,用户会收到礼貌的拒绝提示。
这种情况每次都会发生,即使 AI 试图将计划拆分为更小的子任务也是如此。这就像有一个保安,在你进入大楼前检查你的身份证,然后在你进入特定房间前再次检查你的身份证。
“恢复循环”:当事情出错时
有时候,即使是最好的计划也会失败。也许你要求打开的应用并未安装,或者一个弹窗窗口抢占了焦点。在旧系统中,这会导致整个流程停止。AnovaX 拥有一个聪明的“恢复循环”。
如果某一步骤失败了,系统并不会放弃。它会唤醒第二个更快的 AI 循环,这个循环像侦探一样工作。它会观察哪里出了错,思考一个新的计划(比如“哦,应用名称错了,让我试着搜索一下它”),然后再次尝试。为了让这种感觉像是即时的,在侦探思考期间,系统会在后台“投机性地”运行一些安全的、只读的任务(比如检查时间),这样当新计划准备就绪时,这些部分已经完成了。
通过手机进行监控
该项目还包含一个酷炫的功能,你可以通过手机控制你的笔记本电脑。你可以对着手机说话,指令会通过你的家庭 Wi-Fi 发送到你的笔记本电脑。更棒的是,笔记本电脑会实时将屏幕流回你的手机。你可以站在另一个房间,看着笔记本电脑自动打开应用并打字,并实时看到那些“智能体”在工作时究竟在做什么。
它能做什么,不能做什么
论文表明,AnovaX 可以成功地:
- 打开桌面应用程序(如记事本)。
- 输入文本并按下按键。
- 搜索网页和 YouTube。
- 截取屏幕截图并告知时间。
- 处理复杂的、多步骤的请求(如“打开记事本,输入一段文字并保存它”)。
- 拒绝危险命令(如“删除我的下载文件夹”)。
然而,作者非常明确地指出了它的局限性。该系统是“盲目”的。它并不能真正“看到”屏幕来判断窗口是否正确打开;它只是发送指令并寄希望于成功。如果一个弹窗挡住了屏幕,智能体可能会在错误的地方继续打字。它还依赖云端来进行最初的“思考”(AI 规划器)以及听取你的声音,尽管作者建议未来可以将这些功能替换为本地版本,以实现完全离线。
总结
AnovaX 并不是想成为下一个 Siri。它是一个概念验证,旨在展示构建一个小型、可读且安全的本地助手是可能的。通过将问题分解为规划者、安全卫士和一组专门的、执行输入的智能体,创造者构建了一个透明且可控的系统。它证明了你不需要一个存在于云端的“黑盒”来控制你的电脑;你只需要一个就在你桌面上运行的、组织有序的数字助手团队。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。