← 最新论文
🤖 AI

Beyond Memory: A Transactional Continuity Kernel for Long-Lived AI Agents

本文介绍了连续性内核(Continuity Kernel, CK),这是一种事务性控制平面,通过将不可信的状态提议与原子激活解耦,确保长寿命 AI 智能体安全且经授权的演进,从而通过一个保证状态变更具有不间断、可审计谱系的经过形式化验证的协议,防止陈旧覆盖和权限提升。

原作者: Jun He, Deying Yu

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Jun He, Deying Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的记忆混沌:为什么 AI 智能体需要一名保镖

想象这样一个世界:你最喜欢的视频游戏角色不仅能记得过去五分钟的任务,还能完整地记录下他们打过的每一只怪物、买过的每一件物品以及学过的每一个秘密。这就是“长寿 AI 智能体”(long-lived AI agents)的梦想——这些聪明的计算机程序可以存在多年,像真人一样学习和成长。但问题在于:如果你拥有那个角色日记的一千个不同版本,而且这些版本都是由不同的作者在同一时间编写的,哪一个才是“真实”的故事?

在计算机科学领域,这就是存储(storage)与权威(authority)之间的区别。存储只是一个巨大的仓库,你可以把所有的草稿、笔记和错误都存进去。而权威则是决定哪一个版本是大家公认并遵循的官方版本。如果没有严格的规则手册,AI 智能体可能会不小心用一个虚假的版本覆盖掉自己的记忆,或者一个有故障的工具可能会让智能体误以为自己拥有并不具备的超能力。这就像是一个混乱的小组项目,每个人都在不停地编辑同一个 Google 文档,却没人知道谁拥有最终决定权。本文旨在解决这种混沌,提出了一个简单但至关重要的问题:我们如何构建一个系统,确保 AI 的“官方”历史始终真实、安全且完整,即使在出现故障时也是如此?

连续性内核:AI 的终极保镖

请看连续性内核(Continuity Kernel, CK),这是研究人员何军(Jun He)和于德英(Deying Yu)的杰作。不要把 AI 智能体的记忆看作一本单一的笔记本,而要把它看作一棵巨大的、分支繁多的可能性之树。每当 AI 学习新知识、工具更新设置或人类下达指令时,都会长出一个新的分支。问题在于,如果没有一名保镖,任何人(或任何有故障的机器人)都可能溜进这棵树并宣布:“我才是新的官方主干!”连续性内核就是那名保镖。它不负责编写故事,它只负责决定哪个故事能成为官方版本。

作者提出了一种巧妙的两步走策略来确保安全。首先,AI 中“不可信”的部分(例如具有创造性的语言模型或网页搜索工具)负责完成所有繁重的工作。它们收集证据,撰写一份新记忆的草案,并将其封装在一个数据包中。这个过程是在“提交前”(off-commit)进行的,这意味着它仅仅是一个提议,而非事实。然后,连续性内核介入。它扮演着一个严格、确定性的法官角色。它不在乎 AI 的创意想法,它只在乎规则。它会检查:“这个提议是否来自正确的人?之前的记忆版本是否完全符合预期?证据是否按时到达?”

如果提议通过了每一项测试,内核就会执行一次“提交”(Commit)。这是一个神奇的时刻,新记忆瞬间成为官方历史,旧版本被锁定。如果失败,提议会被拒绝、隔离或搁置。论文认为,这种分离至关重要。你不能让 AI 授权它自己的升级,因为那就像银行柜员允许自己批准一百万美元的取款一样。内核确保只有经过验证、预先批准的变更才能成为“分支头”(branch head)——即 AI 现实世界的唯一、真实的版本。

游戏规则

为了使这一机制奏效,作者设计了一套被称为“激活合同”(activation contract)的严格规则。想象一场高风险的国际象棋比赛,每一步棋都必须经过裁判的验证才算数。内核会对每一个提议进行 17 个不同阶段的检查。它会寻找诸如“作者 ID 是否发生了变化?”、“记忆是否新鲜?”或“是否有人试图混入伪造的准入证?”等情况。

论文明确排除了“仅仅将数据保存到硬盘就代表其为真”的想法。仅仅因为一段记忆存在于存储器中,并不意味着 AI 就应该相信它。作者还反对让 AI 模型为自己授权。在他们的系统中,模型可以提出变更建议,但绝不能签署自己的准入许可。内核是唯一能说“可以”的存在。

研究人员使用计算机模拟而非带有物理实体的真实 AI 对这一想法进行了测试。他们构建了一个内核的数字模型,并让它运行了超过 280 万种不同的可能场景,包括 AI 试图绕过规则、数据缺失,或两人试图同时更新记忆的情况。在所有这 550 万次状态变更操作中,内核始终守住了底线。它发现没有任何违反其安全规则的情况。它成功拦截了自我授权的诡计,防止了重复更新,并确保了永远只有一个版本的真相可以位于树顶。

结论:一条安全的路径

连续性内核并不能解决 AI 的所有问题。它不会让 AI 变得更聪明,也无法修复损坏的机械臂或不稳定的网络连接。它也不承诺 AI 对世界的认知永远是正确的;它只是保证了 AI 的记忆是一致的,且没有人可以偷偷改写历史。作者谨慎地指出,虽然他们的模拟非常彻底,但这仍然是一种模拟。现实世界的计算机可能会崩溃,或者存储系统可能会以模型未预测到的方式失效。

然而,这篇论文为 AI 安全提供了一种全新的思考方式。与其试图让 AI 变得完美,不如构建一名“保镖”,确保 AI 的历史始终清晰、经过授权且完整。通过将制作提议的混乱、创造性工作与检查提议的严格、枯燥工作相分离,连续性内核为那些能够实现“长寿而不失智、不失忆”的 AI 智能体提供了蓝图。这是迈向构建我们可以信任其能够记住自身身份(即便是在千年之后)的 AI 之路上,迈出的虽小但至关重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →