User as Code: Executable Memory for Personalized Agents
本文介绍了“用户即代码”(User as Code, UaC)这一范式,该范式将个性化智能体记忆表示为可执行的 Python 代码而非非结构化文本,从而通过确定性计算,在聚合历史数据、解决矛盾以及主动执行安全规则方面实现卓越性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于“用户即代码”(User as Code)论文的解释,采用了通俗易懂的语言和创意类比。
核心理念:从“便笺盒”到“活性的软件应用”
想象一下,你正试图记住关于朋友杰西卡(Jessica)的所有事情。
旧方式(目前的 AI 记忆):
现在的 AI 存储记忆就像是一个装满便利贴的鞋盒。
- 你写下事实:“杰西卡喜欢香菜”、“杰西卡讨厌香菜”、“杰西卡对青霉素过敏”。
- 当你问 AI:“杰西卡对什么过敏?”它会在盒子里翻找,找到关于青霉素的便笺,然后读给你听。
- 问题在于: 如果你问:“杰西卡去年去了多少次国际旅行?”AI 必须阅读每一张便笺,逐一计数,并在脑中进行计算。它经常会迷失方向、漏掉便笺,或者因为“阿莫西林”和“青霉素”这两个词没有出现在同一张便笺上而无法将它们联系起来。这就像是试图通过仅仅阅读一堆收据来进行复杂的会计核算。
新方式(用户即代码 - UaC):
作者提出了一种名为**“用户即代码”(User as Code, UaC)的新系统。AI 不再构建一个便笺盒,而是为杰西卡构建一个专门的、活性的软件应用**。
- 状态(数据库): AI 不再创建便笺,而是创建“类型化对象”(类似于数字文件夹)。它有一个
护照文件夹、一个行程文件夹和一个医疗文件夹。在医疗文件夹内,它不仅仅写下“青霉素过敏”;它会创建一个结构化的条目,显示:药物类别:青霉素,严重程度:严重。 - 规则(逻辑): AI 还会编写一些会自动运行的小型计算机程序(函数)。其中一个程序可能会说:“如果开具了新药,检查其药物类别是否与现有的过敏记录匹配。”
它是如何工作的:两阶段工厂
论文描述了一个将混乱的对话转化为这种整洁软件的两步过程:
- 第一阶段:记录员(记忆)
每当杰西卡与 AI 交谈时,一个“记录员”会倾听并将每一个事实记录为一个原始的、未经编辑的列表。它永远不会删除任何内容。如果杰西卡说:“我去看过朴医生处理过敏问题”,记录员会写下:[日期] 用户因过敏问题就诊于朴医生。
- 类比: 这就像法庭速记员正在打字记录审判过程。没有任何信息被丢失,目前也尚未进行总结。
- 第二阶段:架构师(结构化)
定期,一个“架构师”(智能 AI)会阅读整个原始事实列表,并将其重写为这个整洁的软件应用。它会将事实组织到护照和医疗文件夹中,并编写用于检查冲突的程序(约束条件)。
- 类比: 这就像一名图书管理员将一堆未分类的书籍整理成一个完美的、可搜索的目录,并配有一个可以瞬间计算统计数据的计算机系统。
为什么这改变了一切
论文声称,这种转变让 AI 能够完成“便笺盒”方法难以胜任的三件事:
1. “数学”问题(分析性推理)
- 场景: 你问:“杰西卡在 2025 年去了多少次国际旅行?”
- 旧方式: AI 必须搜索“旅行”相关的便笺,猜测哪些是国际旅行,进行计数,并祈祷自己没有漏掉任何一个。它经常失败(在测试中准确率仅为 43%)。
- 新方式: AI 只需要运行一行简单的代码:
统计所有年份为 2025 且 is_international 为 True 的行程。它能瞬间完美地得出答案(准确率 99%)。这就像是用机器统计罐子里有多少硬币,与用手数一堆硬币的区别。
2. “主动性”问题(主动服务)
- 场景: 杰西卡在 1 月份提到了青霉素过敏。到了 10 月,她提到正在服用阿莫西林。她从未问过:“这安全吗?”
- 旧方式: AI 会等待提问。除非你问“阿莫西林是否影响我的过敏症?”,否则它不会建立联系。
- 新方式: “架构师”编写了一条规则:“每当医疗列表发生变化时,检查药物冲突。”一旦 10 月份的记录被添加,计算机程序就会运行,发现冲突,并立即弹出警告:“关键警告:您正在服用一种青霉素类药物,但您对青霉素过敏!”
- 类比: 旧系统是一个被动的图书馆;新系统是一个智能家居安防系统,能在火灾发生前发出警报。
3. “矛盾”问题
- 场景: 杰西卡在一次聊天中说她喜欢香菜,但在另一次聊天中说她讨厌香菜。
- 旧方式: 便笺盒里有两个相互矛盾的便笺。AI 会感到困惑。
- 新方式: 软件应用拥有一个单一的
偏好对象。当新事实进入时,代码会更新该对象以反映最新的事实,或者标记冲突以供审查。它保持了记忆的整洁和一致。
结果:论文的研究发现
作者使用标准基准测试将此系统与其他记忆系统进行了对比:
- 基础记忆: 在处理简单问题(如“我的护照号码是多少?”)时,新系统与现有最优秀的系统表现相当(准确率约为 79%)。
- 复杂数学: 在需要计数或平均值的问题上(如旅行示例),新系统几乎是完美的(99%),而其他系统则表现糟糕(下降至 6–43%)。
- 安全警报: 在测试 AI 是否能在未被询问的情况下发现危险(如药物过敏)时,新系统捕捉到了 100% 的标准危险。其他系统由于在等待提问,因此错过了许多情况。
- 成本: 在开始构建“软件应用”时成本稍高,但一旦建成,提问过程非常便宜且快速。如果你向同一个用户提问很多次,新系统会比旧方式便宜得多。
总结
论文认为,我们不应该再将 AI 记忆视为一个被动的文本存储箱,而应该将其视为一个主动的软件项目。通过将用户的历史记录转化为可以运行、检查和计算的代码,AI 将能够更好地进行数学运算、发现隐藏的危险并掌握全局,而不仅仅是检索孤立的事实。
简而言之: 我们不再是要求 AI 去“记住”一切,而是给它一个运行在用户生活之上的程序,该程序会自动检查模式并实时发出警报。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。