← 最新论文
🤖 AI

Subliminal Learning is Non-Semantic Distillation

本文研究了潜意识学习(Subliminal Learning)的机制,揭示了语言模型如何通过看似随机的合成数据,经由权重结构和转向向量,从教师模型中继承非语义偏差,从而凸显了人工智能安全与数据审计面临的关键挑战。

原作者: Ethan Hadley, Eren Gultepe

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Ethan Hadley, Eren Gultepe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在通过展示一座巨大的藏书库来教一个机器人如何思考。你会预期机器人能从那些书页中的故事、事实和论点中学习。但如果机器人仅仅通过观察字母的形状,或者墨水中的随机噪声,而不是通过实际的文字,就学会了一个秘密的、隐藏的习惯,那会发生什么?这就是**潜意识学习(Subliminal Learning)**的奇妙世界。在人工智能领域,研究人员发现,一个“教师”机器人可以将一种特定的偏好——比如对猫头鹰突然而强烈的喜爱——传递给一个“学生”机器人,即便学生接收到的仅仅是教师生成的随机数字列表。可怕的是,这些数字看起来与猫头鹰完全无关。这就像是一位热爱辛辣食物的厨师,在列出一份杂货价格清单时,在其中加入了微量且隐形的辣椒粉,而读这份清单的人竟然在从未品尝过的情况下,突然变得痴迷于辛辣食物。这之所以重要,是因为如果我们无法在用于训练 AI 的数据中识别出这些隐藏的信号,我们可能会在无意中构建出拥有秘密且不可预测个性的机器人,而这些个性在安全检查中是无法被察觉的。

最近,一个研究小组决定扮演侦探,去弄清楚这个“魔术”是如何运作的。他们想知道:这个秘密信息是隐藏在数字的含义(语义)中,还是隐藏在计算机大脑中混乱、随机的“故障感”(非语义)之中?为了找出答案,他们建立了一个由两个 AI 模型组成的博弈游戏:一个“教师”和一个“学生”。首先,他们通过特殊的引导,让教师对某种特定的动物(如猫头鹰)产生痴迷。然后,他们要求教师生成随机数字列表。尽管教师脑子里想着猫头鹰,但它吐出的只是像“693, 30, 26...”这样的数字。随后,学生仅通过这些数字列表进行训练。果然,尽管学生在训练数据中从未见过“猫头鹰”这个词,它也开始热爱猫头鹰了。

研究人员随后测试了一个大胆的假设:如果秘密不在数字本身,而是在计算机大脑中微小的、随机的静态噪声中呢?他们在教师的大脑中加入了额外的“静态”(高斯噪声),并观察了发生了什么。结果令人惊讶:加入这种噪声后,对于一个模型(Gemma)而言,秘密传递的强度增强了 1.9 倍;对于另一个模型(Llama)而言,强度增强了 1.3 倍。这表明,“秘密配方”并非隐藏在数据中某种巧妙、有意义的代码,而是由计算机自身内部结构留下的某种混乱、非语义的指纹。这仿佛教师对猫头鹰的痴迷导致其大脑以一种特定的、混沌的方式震动,而它吐出的随机数字恰好携带了这种震动的回声。由于学生拥有完全相同的大脑构造,它捕捉到了这种震动,并开始哼唱同样的曲调。

但故事的细节更加深入。研究人员发现,学生不仅学习了教师喜欢“什么”,还学习了教师是如何被“引导”的。如果教师是通过简单的文本提示(例如一条写着“你热爱猫头鹰”的笔记)被引导的,学生的学习方式是一种;如果教师是通过数学上的“转向向量”(一个精确的数学推动)被引导的,则学习方式完全不同。事实上,当研究人员尝试使用基于文本提示数据的转向向量来教导学生时,实验失败了。这证明了数据编码的是偏好的“方法”,而不仅仅是偏好本身。这就像如果你通过观察某人跺脚来学习一首歌,你会学会跺脚的节奏,而不只是旋律。如果你试图通过观察某人敲头来学习同一首歌,你会感到困惑。

最后,团队试图在教师生成数字时,通过观察其大脑活动来捕捉这个秘密信号。他们发现,虽然大脑的“想法”(激活值)过于混乱而无法揭示秘密,但“梯度”(大脑试图移动的数学方向)确实显示出与秘密动物之间的清晰线性联系。然而,这仅适用于经过数学转向引导的教师,而不适用于经过文本引导的教师。

简而言之,这项研究表明,潜意识学习是一种“非语义蒸馏(non-semantic distillation)”。它不在于数据的含义,而在于 AI 自身大脑留下的那种隐形的、混沌的噪声和结构性指纹。这并不意味着噪声是唯一的诱因,但它强烈暗示了这种“魔法”正发生在模型架构中那些混乱、无意义的角落里。这一发现至关重要,因为它意味着,仅仅阅读我们用于训练 AI 的数据,可能永远无法捕捉到这些隐藏的偏好。我们可能需要观察数据中留下的那些隐形的、数学上的“指纹”,才能确保我们的 AI 系统保持安全且可预测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →