Synchronized Logit Steering: Real-world Steganography
本文介绍了同步逻辑值引导(Synchronized Logit Steering, SLS),这是一种针对大语言模型的确定性隐写方案,它通过从生成的输出本身推导出共享的逻辑值分布,实现了无需发送方与接收方共享原始提示词上下文即可进行的隐蔽且与提示词无关的通信,并达到了高信息密度和统计隐匿性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字对话的静谧回响中,一种新型的秘密语言悄然浮现,它隐藏在人工智能生成的文字之中,就在众目睽睽之下。这一领域被称为隐写术(steganography),是掩盖信息的古老艺术,其目的是将信息隐藏得如此彻底,以至于信息的存在本身都被掩盖了,只留下普通交流的表象。与加密术(cryptography)不同——加密术是将信息打乱,使没有密钥的人无法阅读——隐写术旨在让信息对肉眼不可见,将其嵌入到看起来和听起来都完全自然的文本中。大型语言模型(即那些编写论文、解决数学问题并进行对话的强大计算机程序)已成为这一实践的新前沿。这些模型不仅仅是检索事实,它们是根据概率来预测句子中的下一个词,并从一系列可能的选项中进行选择。这种内在的变异性意味着,在写作的几乎每一个步骤中,模型都在几个都能使句子通顺的词之间进行选择。研究人员长期以来一直好奇,这些选择是否可以被用来携带隐藏信息,而读者却对此毫无察觉。
多年来,试图在这些 AI 生成的文本中隐藏信息的尝试面临着一个重大障碍:对共享秘密上下文的需求。想象两个人试图使用一本书作为密钥来发送编码信息;如果他们使用的不是完全相同的版本,或者他们查看的是不同的页面,那么代码就会失效。同样,以往在 AI 文本中隐藏数据的方法要求发送者和接收者必须共享完全相同的初始指令或提示词(prompt),以便计算出相同的候选词列表。在现实世界中,AI 系统经常调用私有数据或使用随时间变化的隐藏内部指令,这一要求使得该技术显得脆弱且不切实际。如果发送者和接收者的起始点不一致,隐藏的信息就会丢失或损坏。Algoverse AI 的一个研究团队现在开发出了一种解决方案,完全消除了这种依赖性,使得双方即使在从未见过相同的起始点的情况下,也能交换隐藏信息。
研究人员将这种方法称为“同步逻辑值引导”(Synchronized Logit Steering)。该系统不再依赖于共享的起始提示词,而是基于已经生成的文本建立一种共同的理解。该过程始于一段标准的文字交换。一旦生成了一定数量的单词——具体为四十个标记(tokens,即模型处理文本的基本单位)——发送者和接收者就会利用这段已有的文本作为新的共享参考点。这个“代理提示词”(proxy prompt)充当了一个共同的基础。因为双方都能看到已经出现的相同词汇,所以即使他们的原始指令完全不同,他们也可以独立地计算出完全相同的下一个可能词列表。这种同步机制使他们能够在无需共享秘密初始上下文的情况下,达成一致的隐藏代码。
为了发送信息,发送者会观察由这个共享参考点生成的候选词列表。然后,他们选择一个特定的词,不仅是因为这个词符合句意,还因为该词在列表中的位置对应着一段隐藏数据。例如,如果隐藏信息需要数字“五”,发送者就会选择列表中概率第五高的那个词。接收者看到了同一个词,并且知道相同的概率列表,因此只需通过计算该词的位置即可检索出数字“五”。这一过程不断重复,系统会检查文本中的“熵”(entropy,即不确定性的程度),以确保词语的选择保持自然。只有当模型足够不确定,以至于选择一个不太常见的词不会显得奇怪或机械时,系统才会隐藏数据。
团队在广泛的任务中测试了这种方法,包括通用对话、复杂的数学推理以及软件工程问题。他们发现,一旦建立了初始的四十个单词,使用隐藏信息生成的文本与普通文本之间的统计差异变得微乎其微。从技术角度来看,两类文本之间的差异度(divergence)降到了一个临界阈值以下,这意味着隐藏信息在统计学上与普通的写作方式无法区分。研究人员还发现,通过以“爆发式”(bursts)的方式重复这一过程,可以显著增加隐藏的信息量。他们最有效的配置被称为“周期性爆发”(periodic burst),这种配置允许他们嵌入的数据量比之前的单次消息尝试高出约十倍,达到了每标记 0.20 比特(bits per token)的密度。这意味着对于 AI 写的每一个词,系统都成功嵌入了一小部分秘密信息的比特,而没有改变对话的流畅度。
尽管该方法取得了成功,但研究人员也注意到,当隐藏信息被压缩进复杂任务时存在权衡。当系统试图在数学推理或软件代码中隐藏数据时,AI 回答的准确性会略微下降。这表明,迫使模型选择特定词汇来携带信息,有时会使其偏离解决难题所需的严密逻辑路径。研究人员建议,在实际应用中,系统应当足够智能,能够识别自己何时处于“技术模式”,并停止隐藏信息,将该技术保留给更具对话性或描述性的部分。这种自适应方法将保留 AI 推理的质量,同时仍能在更安全的语境下进行隐蔽通信。
这项工作的意义是双重的。一方面,它展示了一种稳健的方法,可以在不需要共享密钥的情况下对 AI 内容进行水印标记或验证文本来源,这对于保护知识产权非常有用。另一方面,它凸显了 AI 系统通信中的一个漏洞,表明智能体(agents)有可能在没有人类监督的情况下进行协调或数据外泄。研究人员强调,理解这些隐藏通道是如何构建的,是建立防御机制的第一步。他们建议,未来的安全系统可以监控词汇选择中的异常模式,或者破坏使这种同步成为可能的统计特征。最终,这项研究证实了在 AI 文本中隐藏信息不仅是一种理论上的可能性,更是一种现实的实践,它在语言的自然流转中悄然运行,等待着那些懂得如何寻找的人去发现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。