✨ 要点🔬 技术摘要
在人工智能领域,记忆与安全之间存在着一种持久的张力。大型语言模型被设计为得力的助手,但随着它们参与漫长且复杂的对话,它们必须记住之前说过的话以保持思路连贯。传统上,这些模型通过保留一份所有说话内容的运行列表来处理记忆,随着对话的增长,这会变得沉重且缓慢。与此同时,确保这些模型的安全性通常涉及添加外部规则或对整个系统进行重新训练,这可能会降低模型的灵活性,或导致其拒绝无害的问题。研究人员面临的挑战是,如何构建一个既能自然地持有长期上下文,又能将安全性内置于其结构本身(而非仅仅作为事后添加)的系统。
上海人工智能实验室的一个研究小组提出了一种解决这一问题的新方法,并将其命名为名为 Safin-1 的模型家族。他们没有将安全性视为一组外部规则或独立的编码层,而是设计让模型将安全性作为一种内部状态携带,就像一个人带着一套个人价值观来引导其在不同情境下的行为一样。其创新的核心是一种机制,允许模型定期保存其自身内部思考过程的快照。当模型阅读长文档或遵循复杂指令时,它会定期暂停,以保存其当前理解的一个紧凑摘要。稍后,当模型需要回忆过去的事情时,它可以搜索这些保存的快照以找到最相关的信息,而不是试图一次性处理整个对话历史。研究人员称这种方法为“记忆原生状态演化”(memory-native state evolution),它将模型的记忆从过去的被动记录转变为一个可以根据需要进行咨询和更新的主动工具。
研究人员首先在较小的模型上测试了这一想法,以确保架构运行正确。他们发现,通过增加这种检索特定过去状态的能力,模型在理解长上下文和寻找隐藏在文本深处的信息方面变得显著更好。在模型必须在数千字的“大海捞针”式测试中寻找特定信息时,这种新设计表现优于以往的方法,尤其是在文本长度超过模型训练时所见长度的情况下。这表明,选择性地召回过去状态的能力有助于模型在长时间跨度内保持专注力和推理能力,而不会迷失在海量信息之中。
在初步成功的基础上,该团队将这项技术扩展到了规模更大的模型,参数量从 40 亿到 350 亿不等。他们将同样的记忆路由系统应用于这些更大的模型,并测试了一个特定的应用场景:安全性。他们创建了一个特殊的、持久的“安全状态”,可以附加到模型上。这个状态经过训练,能够识别有害请求并引导模型做出安全的响应,但它被设计为是可拆卸的。研究人员发现,当这个安全状态处于激活状态时,模型在抵御诱导其生成有害内容方面的能力大大增强。在一组测试中,与标准模型相比,这种新方法将此类欺骗尝试的成功率降低了近一半。至关重要的是,这种安全性的提升并没有以牺牲模型的帮助性为代价。与其他往往因过度谨慎而导致模型拒绝合法问题的的方法不同,这种新方法在拦截危险请求的同时,保持了极高的帮助水平,拒绝的无害请求要少得多。
这项研究强调了我们构建安全人工智能方式的转变。与其仅仅依赖外部过滤器或不断重新训练模型的整个“大脑”,这项工作表明,安全性可以成为模型内部机制的一个内在组成部分。通过允许模型携带一个可以根据情况开启或关闭的专门状态,研究人员创造了一个既具适应性又具鲁棒性的系统。结果表明,这种方法提供了一条充满前景的路径,即安全性不仅仅是从外部强加的约束,而是一种能在模型的记忆和推理过程中自然演化的能力。尽管研究人员指出这仍是一个初步探索,实现这一愿景还需要更多工作,但研究结果具体展示了安全性可以被编织进机器思考和记忆的本质结构之中。
技术摘要:Safin-1 —— 通过记忆原生状态演进实现“内在安全”
1. 问题陈述
长程复杂任务要求基础模型能够累积信息、维持内部状态,并在长时间的交互中进行适应。目前的方法通常将这些功能分离:上下文通过 Token 级的键值(KV)缓存或循环状态进行保留,而可重用的行为(如安全性)则通过模型更新、适配器或外部推理时约束来进行编码。
本文认为,安全性应当是模型本身的一种内在属性,而非仅仅依赖于外部防护或事后对齐(例如监督微调)的行为约束。此外,传统的循环设计仅暴露最新的状态用于读取;一旦早期的关联被衰减或覆盖,它们就变得无法恢复。这造成了一个瓶颈:历史状态必须以紧凑的形式表示,并根据当前上下文进行高效检索。核心问题在于:模型状态能否不仅作为上下文的瞬时压缩,还能作为一种持久且可选择性调用的能力原生基质?
2. 方法论:Safin-1 与 MARCH
Safin-1 是一个基于**跨上下文历史的记忆锚点路由(MARCH)**构建的系列基础模型家族。该架构将循环计算的瞬时轨迹转化为一个不断增长、可寻址的内部状态库。
2.1 核心架构:MARCH
MARCH 由三个主要部分组成:
上下文衍生状态锚点: 循环骨干网络定期在其演进状态的特定边界(例如每 C C C 个 token)进行检查点记录,以形成“状态锚点”。每个锚点都与一个紧凑的、具备状态感知能力的路由键(Routing Key)相匹配。与仅持有当前状态的标准循环模型不同,MARCH 保留了直到该边界的累积前缀状态,从而创建了一个可寻址的历史。
内容路由状态检索: 对于每个 token,路由模块将隐藏状态投影为一个查询(Query),用于对所有因果可见的状态锚点(以及一个学习到的“空”选项)进行评分。路由器选择相关的历史状态或选择跳过检索。检索到的状态读出通过残差方式与当前状态路径融合,从而保留底层的循环更新逻辑。 3.ly 持久化能力状态: 路由状态库可以承载学习到的持久状态(例如“安全性状态”)以及动态上下文锚点。这些是可学习的参数,从第一个 token 开始即可使用,且独立于输入序列长度。
2.2 实现细节
生产者-读取者机制: 系统使用基于硬件高效生产者(基于 Gated DeltaNet 等分块内核)来生成状态检查点,并使用融合读取器将查询 token 与状态候选进行平铺(Tiling)。这避免了实例化稠密路由矩阵,支持稀疏路由(例如 Top-4),以降低长序列长度(高达 128K tokens)下的计算成本。
状态原生专业化: 该架构允许通过学习一个持久的“安全性状态”来实现“内在安全”。语言模型骨干保持冻结;仅优化持久状态参数。随后,路由器决定该安全性状态在 token 和上下文层面的贡献,使其能够在不重写共享骨干的情况下进行附加或移除。
3. 主要贡献
Safin-1 架构: 一系列将循环计算轨迹转换为可寻址状态锚点库的模型,实现了在不改变循环更新规则的情况下对早期状态的选择性访问。
持久化能力状态: 为“内在安全”提供了一个接口,其中安全性专业化被实现为在原生路由路径内的可拆卸、持久化状态,而非通过修改骨干网络或外部前缀来实现。
受控且规模化的验证:
小规模(0.8B): 在多种循环骨干(Gated DeltaNet, Kimi Delta Attention, Gated DeltaNet-2)上进行的受控预训练研究,旨在隔离架构增益。
大规模(4B 和 35B-A3B): 在 Qwen3.5 骨干上进行持续预训练和监督微调(SFT),以验证可扩展性和能力保持情况。
4. 实验结果
4.1 小规模验证 (0.8B)
通用语言建模: MARCH 在所有八个零样本常识基准测试中均取得了最佳性能,超越了全注意力(Full-attention)基线和其他循环变体。
长上下文与检索: MARCH 在关联召回(NIAH 任务)方面表现出显著提升,特别是在多针检索(Multi-needle)场景和长度外推(尽管训练长度为 16K,但在 32K–64K 上下文中表现优异)方面。它还在现实世界数据集(SQuAD, TriviaQA 等)的上下文检索能力上比基线提升了 14–23%。
效率: 与稠密路由相比,Top-4 稀疏路由使 128K tokens 下的端到端吞吐量翻倍,并将核心运行时间降低了一个数量级。
4.2 大规模评估 (4B 和 35B-A3B)
能力增益: Safin-1 提升了在挑战性推理基准(如 MMLU-Pro, GPQA-Diamond)和竞赛级数学(AIME 2025)上的表现,同时保持或略微提升了在标准基准(GSM8K, MATH, 代码生成)上的表现。
安全性鲁棒性(基础版): 在没有持久状态的情况下,与匹配的 Qwen3.5 基线相比,Safin-1 在平均越狱攻击成功率(ASR)方面显示出适度的改进。
4.3 内在安全(持久安全性状态)
当在冻结的骨干网络上学习持久安全性状态时:
越狱抵抗力: 与未适配的 Safin-1 检查点相比,安全性状态使平均 ASR 分别降低了 42.3% (4B) 和 52.3% (35B-A3B)。
过度拒绝权衡: 与训练匹配的 Rank-8 LoRA 控制相比,安全性状态在实现更低 ASR 的同时,引入了显著更少的过度拒绝 (在良性提示词上,XSTest 测试)。例如,在 35B-A3B 模型上,LoRA 增加了 10.0 个百分点的过度拒绝,而安全性状态仅增加了 2.0 个百分点。
能力保持: 在 4B 模型上,安全性状态在所有测试任务中比 LoRA 更好地保持了能力。在 35B-A3B 模型上,保持效果取决于具体任务:安全性状态在数学任务上优于 LoRA,但在知识和代码任务上表现不一。
5. 意义与主张
本文将 Safin-1 定位为对“内在安全”这一初步架构探索 。其意义在于将模型记忆从被动的上下文记录重新定义为维护和演进模型行为的主动基质 。
原生安全性: 它证明了安全性可以通过模型的原生计算(状态路由)来表示和调用,而非仅仅依赖于外部约束。
模块化: 安全性状态的可拆卸特性允许在不重新训练骨干网络的情况下,对共享的通用基础模型进行受控的专业化。
局限性: 作者明确指出这项工作是一个起点。局限性包括使用了较小的安全性语料库、仅限英语的基准测试,以及缺乏针对自适应/多语言攻击或状态篡改的测试。论文强调,要实现将安全性作为一种状态原生、可自适应维护能力的宏大愿景,仍需要大量的后续工作。
作者总结道,虽然 Safin-1 为这一架构方向提供了具体的证据,但它并未建立一个决定性的解决方案,探索替代性和互补性的架构仍然至关重要。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。