← 最新论文
🤖 machine learning

Safin-1: Safety from Within through Memory-Native State Evolution

本文介绍了 Safin-1,这是一个利用“记忆锚定上下文历史路由”(MARCH)架构的基础模型家族,旨在通过记忆原生的状态演进而非依赖外部约束,将安全性作为一种内在的、可自适应维护的能力进行嵌入。

原作者: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang S
发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,记忆与安全之间存在着一种持久的张力。大型语言模型被设计为得力的助手,但随着它们参与漫长且复杂的对话,它们必须记住之前说过的话以保持思路连贯。传统上,这些模型通过保留一份所有说话内容的运行列表来处理记忆,随着对话的增长,这会变得沉重且缓慢。与此同时,确保这些模型的安全性通常涉及添加外部规则或对整个系统进行重新训练,这可能会降低模型的灵活性,或导致其拒绝无害的问题。研究人员面临的挑战是,如何构建一个既能自然地持有长期上下文,又能将安全性内置于其结构本身(而非仅仅作为事后添加)的系统。

上海人工智能实验室的一个研究小组提出了一种解决这一问题的新方法,并将其命名为名为 Safin-1 的模型家族。他们没有将安全性视为一组外部规则或独立的编码层,而是设计让模型将安全性作为一种内部状态携带,就像一个人带着一套个人价值观来引导其在不同情境下的行为一样。其创新的核心是一种机制,允许模型定期保存其自身内部思考过程的快照。当模型阅读长文档或遵循复杂指令时,它会定期暂停,以保存其当前理解的一个紧凑摘要。稍后,当模型需要回忆过去的事情时,它可以搜索这些保存的快照以找到最相关的信息,而不是试图一次性处理整个对话历史。研究人员称这种方法为“记忆原生状态演化”(memory-native state evolution),它将模型的记忆从过去的被动记录转变为一个可以根据需要进行咨询和更新的主动工具。

研究人员首先在较小的模型上测试了这一想法,以确保架构运行正确。他们发现,通过增加这种检索特定过去状态的能力,模型在理解长上下文和寻找隐藏在文本深处的信息方面变得显著更好。在模型必须在数千字的“大海捞针”式测试中寻找特定信息时,这种新设计表现优于以往的方法,尤其是在文本长度超过模型训练时所见长度的情况下。这表明,选择性地召回过去状态的能力有助于模型在长时间跨度内保持专注力和推理能力,而不会迷失在海量信息之中。

在初步成功的基础上,该团队将这项技术扩展到了规模更大的模型,参数量从 40 亿到 350 亿不等。他们将同样的记忆路由系统应用于这些更大的模型,并测试了一个特定的应用场景:安全性。他们创建了一个特殊的、持久的“安全状态”,可以附加到模型上。这个状态经过训练,能够识别有害请求并引导模型做出安全的响应,但它被设计为是可拆卸的。研究人员发现,当这个安全状态处于激活状态时,模型在抵御诱导其生成有害内容方面的能力大大增强。在一组测试中,与标准模型相比,这种新方法将此类欺骗尝试的成功率降低了近一半。至关重要的是,这种安全性的提升并没有以牺牲模型的帮助性为代价。与其他往往因过度谨慎而导致模型拒绝合法问题的的方法不同,这种新方法在拦截危险请求的同时,保持了极高的帮助水平,拒绝的无害请求要少得多。

这项研究强调了我们构建安全人工智能方式的转变。与其仅仅依赖外部过滤器或不断重新训练模型的整个“大脑”,这项工作表明,安全性可以成为模型内部机制的一个内在组成部分。通过允许模型携带一个可以根据情况开启或关闭的专门状态,研究人员创造了一个既具适应性又具鲁棒性的系统。结果表明,这种方法提供了一条充满前景的路径,即安全性不仅仅是从外部强加的约束,而是一种能在模型的记忆和推理过程中自然演化的能力。尽管研究人员指出这仍是一个初步探索,实现这一愿景还需要更多工作,但研究结果具体展示了安全性可以被编织进机器思考和记忆的本质结构之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →