← 最新论文
💬 NLP

OD-Stega: LLM-Based Relatively Secure Steganography via Optimized Distributions

本文提出了 OD-Stega,一种基于大语言模型的无载体隐写方法,该方法通过推导在散度约束下优化下一标记概率分布的闭式解来最大化嵌入效率,同时解决了诸如分词不匹配、词表截断以及与现有技术兼容性等实际挑战。

原作者: Yu-Shin Huang, Peter Just, Hanyun Yin, Krishna Narayanan, Ruihong Huang, Chao Tian

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu-Shin Huang, Peter Just, Hanyun Yin, Krishna Narayanan, Ruihong Huang, Chao Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对论文“OD-Stega”进行的解释。

核心思想:大隐隐于市

想象一下,你想给朋友发送一条秘密信息,但你正被一个严格的守卫(我们称她为伊芙/Eve)监视着。如果你把信息写在纸上并藏在一本书里,伊芙可能会觉得这本书看起来很可疑。

传统的“隐写术”(隐藏秘密的艺术)试图通过微调现有书籍中的几个字母来隐藏信息。但本论文提出了另一种方法:无载体隐写术(Coverless Steganography)。与其将信息隐藏在书“之中”,不如请求一个超级聪明的机器人作家(即 LLM,或大语言模型)从头开始写一本书,这本书看起来像是一个普通的普通故事,但实际上秘密地包含了你的信息。

问题所在:机器人太容易被预测了

这个机器人作家非常擅长它的工作。如果你让它写一个关于“赢得奖品”的故事,它自然会说类似“赢得一个重大奖项”或“赢得一个奖”之类的话。它很少会说“赢得一个紫色的奖项”。

因为机器人的行为如此容易被预测,所以很难隐藏秘密。为了隐藏秘密,你需要让机器人从许多不同的选项中进行选择(比如在“重大的”、“大的”、“巨大的”、“宏大的”之间做选择)。如果机器人只有一个显而易见的选项,你就无法在那里隐藏任何数据。

解决方案:OD-Stega(“优化版”机器人)

作者创建了一种名为 OD-Stega 的方法。你可以把它想象成机器人作家的一个“调节旋钮”。

  1. 目标: 他们希望机器人变得稍微不那么容易被预测(更具随机性),以便他们可以隐藏更多的秘密比特数据,但又不能让机器人变得过于随机,以至于故事听起来很奇怪并被伊芙发现。
  2. 权衡: 想象机器人的自然选择是一条平缓、平静的河流。
    • 完美的安全性: 如果你不去触碰这条河,它就会自然流动。伊芙无法察觉它有异样,但你也无法在其中隐藏太多东西。
    • 过度隐藏: 如果你让这条河变得狂野且混乱,你可以隐藏很多东西,但伊芙会立刻发现水流的行为很反常。
    • OD-Stega: 这种方法找到了“金发姑娘原则”(Goldilocks zone,意为恰到好处的平衡点)。它稍微调整了河流,使其变得有些起伏(允许隐藏更多秘密),但同时保持它在肉眼看来仍然像是一条自然的河流。

它是如何工作的(化繁为简的数学原理)

这篇论文解决了一个数学谜题:我们如何在改变机器人的选择时,既能隐藏最多的秘密,又不让故事听起来很假?

  • “温度”技巧: 在人工智能领域,有一个叫做“温度(temperature)”的设置,它控制着随机性。论文证明,他们复杂的数学解法实际上只是一个高级的“调节温度旋钮”的方法。他们计算出精确的“混沌”量,以确保故事保持自然的同时还能携带秘密。
  • “弱守卫”假设: 论文假设守卫(伊芙)并不是一台超级计算机;她可能是一个人类或一个有局限性的简单程序。OD-Stega 利用了这一点。它说:“我们会让故事变得稍微有点怪异,但已知守卫不会注意到,尽管一个超级智能的检测器可能会。”这使得他们能够比以前多隐藏 20% 到 55% 的秘密数据。

解决现实世界的故障

作者不仅做了数学计算,还修复了通常会导致这些系统崩溃的三个实际问题:

  1. “词块拆分”故障:
    • 问题: 计算机将单词拆分成被称为“Token(词元)”的块。有时,发送者的计算机将“mountain”拆分为“mount”和“ain”,但接收者的计算机将其视为一个完整的单词“mountain”。这会导致秘密信息变得混乱。
    • 修复方法: 他们增加了一个简单的“试运行”。在发送真实消息之前,发送者会尝试一些虚拟消息,看看接收者的计算机是否以同样的方式读取单词。如果不是,他们会进行调整直到匹配为止。

এটি
2. “选项过多”故障:
* 问题: 机器人有数千个单词可以挑选。计算所有这些单词的最佳选择需要耗费大量时间。
* 修复方法: 他们忽略了那些机器人绝不会选的数千个单词(比如在奥运会故事里提到“香蕉”)。他们只关注前 100 个最可能的单词,这使得过程快得多。

  1. “旧技术”故障:
    • 问题: 许多保密方法使用一种名为“算术编码(Arithmetic Coding)”的特定数学工具。
    • 修复方法: 他们展示了其方法即使在使用其他较旧的保密工具时也能正常工作,这使其成为了许多系统的通用升级。

他们发现了什么?

他们使用了一个强大的机器人作家(LLaMA2)和一个名为“Discop”的保密工具测试了他们的方法。

  • 更多秘密: 通过使用他们的“调节旋钮”,他们可以在相同长度的文本中隐藏显著更多的秘密数据。
  • 依然自然: 他们使用了一个“类人”AI(GPT-4)和几个“守卫”程序来检查生成的文章。当他们保持“调节”程度较低时,文章看起来 100% 自然,且守卫无法分辨它们是伪造的。
  • 极限: 如果他们为了隐藏“太多”秘密而将“调节”程度调得过高,故事就会开始听起来很奇怪,并且会被守卫抓获。

总结

OD-Stega 是一种在 AI 生成文本中隐藏秘密的新方法。它就像一个聪明的编辑,通过轻微引导 AI 的词汇选择,在保持故事听起来足够自然以欺骗人类或简单计算机守卫的同时,尽可能多地打包进秘密数据。它解决了通常会导致这些系统失效的常见技术故障,并且可以与现有的保密工具配合使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →