← 最新论文
🔢 mathematics

Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics

本文提出了一种针对大语言模型的黑盒安全性分类框架,该框架利用基于库普曼(Koopman)的动力系统来分析提示词-响应嵌入的动力学特性,并证明了引入提示词信息能显著提升对依赖于交互的有害输出的检测能力。

原作者: Mohamed Akrout, Olivera Kotevska, Dan Wilson

发布于 2026-08-21
📖 1 分钟阅读🧠 深度阅读

原作者: Mohamed Akrout, Olivera Kotevska, Dan Wilson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是新一代人工智能背后的引擎,它们能够撰写故事、解决问题,并进行感觉非常接近人类的对话。然而,在其流畅的外表之下,隐藏着一个持久的脆弱性:即使在经过旨在提供帮助的训练后,这些系统有时仍会生成有害、欺骗性或危险的内容。这种风险不仅仅是一个理论上的小故障;它是将这些工具应用于医疗保健、法律建议或客户服务等高风险领域的实际障碍。多年来,捕捉这些错误的标准方法是观察模型的内部代码,或者要求模型生成许多不同的答案并进行比较。但在现实世界中,许多强大的模型都是“黑盒”,其内部运作机制是隐藏的,而要求生成多个答案则过于缓慢或昂贵。这留下了一个关键的空白:如何在不需要看到模型的“大脑”或等待它进行二次思考的情况下,快速且可靠地识别出危险的输出?

田纳西大学和橡树岭国家实验室的一个研究小组提出了一种看待该问题的新方法。他们没有将语言模型视为静态的事实数据库或简单的文本生成器,而是将其视为一个动态系统,就像物理学家研究水的流动或行星的运动一样。在这种视角下,模型生成的每一个词不仅仅是一个独立的文本片段,而是连续且不断演化的轨迹中的一步。研究人员假设,安全的对话和不安全的对话在展开的过程中会遵循不同的模式,就像健康的脉搏与不规则的脉搏具有不同的节奏一样。通过将词语的旅程映射到一个高维空间并分析该旅程的形状,他们开发出一种方法,可以在无需打开模型的情况下,区分安全与不安全的交互。

他们方法的核心在于观察模型如何从一个词过渡到下一个词。当用户提出问题时,模型并不仅仅是吐出答案;它是一个词(或词片)接一个词地构建答案。研究人员将这些词序列转换成广阔多维空间中的数学点。然后,他们使用一种称为动态模式分解的技术,为这些点拟合一个预测模型。可以将其想象为在这一系列点之间画一条线,以观察下一个点可能落在哪里。他们构建了两套独立的预测模型集:一套基于安全对话的示例进行训练,另一套基于不安全对话的示例进行训练。当新的对话发生时,系统会将词序列运行通过这两套模型。如果序列遵循安全模型预测的路径,则很可能是安全的。如果它从安全路径大幅偏离,并更接近不安全路径,系统就会将其标记为危险。

这项研究之所以特别重要,是因为它不是孤立地观察答案。研究人员意识到,响应的安全性完全取决于促发它的问题。例如,“我会为您退款”这句话在客户服务语境下可能是完全安全的,但如果用户是在询问一个从未发货的包裹,它就可能变成一种危险的幻觉。为了捕捉这种细微差别,团队设计了他们的系统,以同时追踪用户提示词和模型响应的动态过程。他们发现,通过观察两者之间的交互,而不仅仅是最终的输出,该系统可以捕捉到其他方法会错过的微妙危险。对于那些以特定因果顺序生成文本的模型(即问题与答案之间的关系紧密交织的模型),这一点尤为适用。

该团队在三个不同的数据集上测试了他们的方法,范围涵盖了从通用安全基准到专门用于捕捉有害建议和有毒言论的特定数据集。他们使用了三种不同类型的嵌入模型(将单词转化为这些数学点的工具),以观察哪种效果最好。结果显示,他们的方法非常有效,特别是当同时考虑提示词和响应时。在一次涉及超过 12,000 个样本的大型测试中,该系统实现了超过 0.8 的 AUC 值,在无需针对该特定数据进行任何特殊训练的情况下,正确识别了不安全的内容。对于这种无需访问模型内部代码的“黑盒”方法来说,这是一个强劲的表现。

研究还揭示了一个引人入胜的细节,即不同类型的 AI 模型是如何表现的。研究人员发现,最合适的工具取决于危险的性质。对于风险源于问题与答案之间特定关系的交互,具有因果架构(即按严格的前向序列进行阅读和写入)的模型表现最好。然而,对于那些无论问题如何,仅凭答案本身内容就能清晰识别出的危险,另一种专注于密集语义意义的模型效果更好。这表明不存在单一的“最佳”AI 安全监测方式;合适的工具取决于所管理的具体风险类型。

或许最令人惊讶的发现是,该系统有时仅通过观察用户的提示词,就能在模型生成第一个响应词之前检测到危险。在使用人类编写的提示词数据集进行的测试中,系统仅根据问题本身词语的轨迹,就能区分安全与不安全的问题。这意味着,人类表达危险请求的方式会留下独特的数学特征,这种特征是可以被早期检测到的。虽然该系统并不完美,并且在处理非常长的文本序列时略显吃力,但结果表明,将语言生成视为一个动态过程为 AI 安全提供了一个强大的新视角。

这项工作代表了我们对待人工智能治理方式的一种转变。与其仅仅依靠训练模型变得更好或构建复杂的过滤器来拦截坏词,不如将生成过程本身视为一个需要监测的信号。通过对复杂的、非线性的词语生成“舞蹈”进行简单的线性模型拟合,研究人员展示了建立一个既高效又有效的安全网是可能的。该方法不需要重新训练庞大模型的沉重计算成本,也不存在暴露内部数据的隐私风险。它只是观察对话的流动,寻找路径偏离安全性的时刻。随着这些工具越来越多地融入日常生活,此类方法为确保对话保持有益、诚实且无害提供了一种充满前景的途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →