OpenJarvis: Personal AI, On Personal Devices
OpenJarvis 引入了一种分解式、类型化的个人 AI 架构,该架构利用大语言模型引导的规范搜索来优化五个独立的原语,从而使端侧系统能够在大幅降低 API 成本和延迟的同时,达到与云端相当的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一位居住在云端的、才华横溢的世界级私人助理。他们极其聪明,能解决复杂问题,并通过将你的敏感数据(如电子邮件、日历和健康记录)发送到庞大的服务器群来处理这些数据。这虽然行之有效,但每月费用高昂,需要互联网连接,而且意味着你要把私人日记交给陌生人阅读。
现在,想象你希望这位助理能居住在你自己的笔记本电脑或手机里。你希望它是私密的、没有月费,并且即使在没有 Wi-Fi 的飞机上也能工作。
问题在于,如果你只是把云端助理的“大脑”(一个强大的 AI 模型)拿下来,试图在手机上运行它,系统就会崩溃。这就像试图在一辆紧凑型轿车里安装一级方程式赛车引擎;这辆车并非为这种引擎而造。汽车的悬挂系统、燃油系统和转向系统(即软件栈)都是为较小的引擎调校的。如果不更换其他部分而直接交换引擎,车子就会分崩离析。
这正是论文"OPENJARVIS"所解决的核心问题。
问题:“引擎交换”的失败
研究人员尝试了一个简单的实验:他们取现有的个人 AI 系统(如 OpenClaw 或 Hermes Agent),仅仅将云端大脑替换为本地大脑(一个在你的设备上运行的较小 AI 模型)。
结果如何? 系统变得极差。准确率下降了 25% 至 39%。
为什么?因为“指令”、“工具”和“内存设置”都是专门为巨大的云端大脑编写的。当你放入一个本地大脑时,它会因为无法遵循其原本未设计要遵循的指令而感到困惑。
解决方案:"LEGO 蓝图”(规范)
作者意识到,你不能仅仅交换大脑;你必须重建整辆车以适应新引擎。为此,他们创建了OPENJARVIS。
将 OPENJARVIS 想象成一份通用的 LEGO 蓝图(称为“规范”Spec)。他们不是将个人 AI 系统变成一团混乱纠缠的代码,而是将其分解为五个独立且可互换的 LEGO 积木:
- 智能(Intelligence): 大脑(AI 模型)。
- 引擎(Engine): 汽车的引擎和变速箱(模型如何运行)。
- 代理(Agents): 驾驶员的逻辑(它如何思考和决策)。
- 工具与内存(Tools & Memory): 地图和工具箱(它如何访问文件和互联网)。
- 学习(Learning): 机械师(系统如何自我改进)。
因为这些是独立的积木,你可以将“智能”积木替换为本地模型,然后调整其他四个积木以完美匹配它。这就像拿着一台赛车引擎,专门针对该引擎调整悬挂、轮胎和燃油混合比,而不是试图强行将其塞进一辆轿车里。
魔法技巧:“导师与学生”搜索
即使有了 LEGO 积木,本地大脑仍然不如云端大脑聪明。如何让本地大脑的表现与云端大脑一样出色?
他们发明了一种称为LLM 引导的规范搜索(LLM-guided spec search)的方法。想象一种导师 - 学生的关系:
- 学生: 运行在你设备上的本地 AI。
- 导师: 超级聪明的云端 AI(就像你付费使用的那些)。
他们是如何协同工作的:
- 测试: 学生尝试执行一项任务但失败了。
- 诊断: 导师查看失败情况并说:“啊,你失败了,因为你没有正确使用日历工具,”或者“你需要改变你的推理步骤。”
- 编辑: 导师不仅仅给出答案;它会重写LEGO 蓝图。它可能会说:“修改工具描述,”“调整内存设置,”或者“微调大脑的参数。”
- 守门员: 一条严格的规则进行检查:“这个改变是否让学生变得更好,而没有使其在其他方面变差?”如果是,则接受该改变;如果不是,则拒绝。
- 结果: 学生通过学习改进了其蓝图。
关键在于: 导师仅在“搜索”阶段(即设置阶段)提供帮助。一旦蓝图完善,学生将完全在你的设备上运行,无需任何云端调用。云端导师消失,你留下的是一位高度优化、私密且本地的助理。
结果:私密、快速且廉价
该论文在 8 种不同的现实世界任务(编程、研究、日程安排等)上测试了这种方法。以下是他们的发现:
- 性能: 优化后的本地助理的表现几乎与昂贵的云端助理一样好。在 8 项测试中的 4 项中,本地版本实际上更好或相当。平均而言,它们仅比最佳云端模型**低 3.2%**的准确率。
- 成本: 由于本地模型在你的自有硬件上运行,每次查询的成本下降了约800 倍。你不再需要支付月度订阅费。
- 速度: 本地版本快 4 倍,因为它无需等待数据往返云端。
- 隐私: 在正常使用期间,你的数据永远不会离开你的设备。
总结
OPENJARVIS 是一种构建个人 AI 的新方法。它不是强迫本地 AI 像云端 AI 那样工作,而是将系统分解为各个部分,并利用“导师”专门针对本地硬件重新设计这些部分。其结果是一个居住在你口袋里的个人 AI,它能保守你的秘密,运行成本几乎为零,并且几乎与昂贵的云端巨头一样聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。