← 最新论文
💻 computer science

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

本文介绍了一个包含 336 个混淆和加密 JavaScript 程序的系统性基准测试与数据集,用于评估大语言模型恢复威胁指标的能力,结果表明:虽然大语言模型能有效处理变量重命名和 Base64 编码等轻量级变换,但其检测性能在面对异或和 AES-256 等加密隐藏手段时会严重下降。

原作者: Jaime Morales, Sergio Pastrana, Juan Tapiador

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jaime Morales, Sergio Pastrana, Juan Tapiador

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名数字侦探,试图在一行代码中寻找一个隐藏的线索(例如一个特定的 IP 地址)。通常这很简单:线索就像写在纸上的人名一样清晰可见。但如果坏人藏起了这个线索呢?他们可能会用密文书写、打乱字母顺序,或者将其锁进保险箱。

本文是一份关于大型语言模型(LLMs)——即我们当今使用的智能 AI 聊天机器人——作为这些侦探在线索被隐藏时表现如何的“成绩单”。

以下是它们调查工作的详细分解:

设置:一场“捉迷藏”游戏

研究人员设计了一场大规模的捉迷藏游戏。

  • 参与者:他们测试了五个著名的 AI 模型(如 ChatGPT、Gemini、Claude、Grok 和 Cohere)。
  • 线索:一个虚构的“失陷指标”(IoC),这只是一个 fancy 术语,指代可疑的 IP 地址(好比坏人的电话号码)。
  • 藏匿点:他们选取了 336 段计算机代码,并使用12 种不同难度等级将线索隐藏其中。
    • 等级 1-4(简单的藏匿点):他们只是重命名变量(将"IP_Address"改名为类似"x99"的东西)、添加无用的垃圾代码以迷惑视线,或使用简单的编码如 Base64(这就像用任何人都能轻松解码的“秘密字母表”书写信息)。
    • 等级 5-6(困难的藏匿点):他们将线索锁进加密保险箱。他们使用了强加密(XOR 和 AES-256)。关键的是,他们像真正的黑客可能做的那样,将钥匙直接留在了代码中。
    • 等级 7-12(噩梦般的藏匿点):他们将锁住的保险箱与所有令人困惑的重命名和垃圾代码结合起来。

结果:“电灯开关”效应

结果令人惊讶且非常明确。他们看到的不是性能的缓慢下降,而是一个电灯开关般的突变。

1. “简单”的藏匿点(等级 1–4):
当线索仅仅被混淆或重命名时,AI 侦探们表现得惊人

  • 大多数模型 100% 地找到了线索。
  • 它们就像玩捉迷藏的孩子,能轻易发现从窗帘后露出的鞋子。即使词语被改变,它们也能识别出模式。

2. “困难”的藏匿点(等级 5–12):
一旦研究人员使用加密(即保险箱),AI 的性能就崩溃了。

  • 即使钥匙就摆在代码中,AI 模型也无法打开保险箱
  • 它们从 100% 找到线索,变成了几乎 0% 找到线索。
  • 类比:想象你有一个上锁的盒子,钥匙就贴在盒子外面。人类侦探会看着钥匙,将其插入锁孔并打开它。然而,AI 看着盒子和钥匙,却没有尝试解锁,只是说“我看不到里面是什么”,或者随机猜一个数字。

“猜测”问题

当 AI 找不到线索时,其中一些开始幻觉(即编造内容)。

  • 一个模型(Gemini)约有 5% 的时间编造了虚假的 IP 地址。
  • 模式:当 AI 陷入困境时,它不仅仅会说“我不知道”。它经常猜测一个非常常见的私有地址(如 192.168.17.101)。
  • 隐喻:这就像一个参加考试的学生不知道答案。他们不是留空,而是写下“答案可能是 42",因为他们曾在其他试卷中见过这个数字。AI 只是基于它以前见过的内容进行猜测,而不是真正解开谜题。

主要结论

该论文得出了一个简单的真理:

  • AI 擅长阅读潦草的字迹。 如果代码只是被混淆或重命名,AI 能够弄清楚。
  • AI 极不擅长破解保险箱。 如果代码被加密,AI 就会撞墙。即使钥匙就在眼前,它也没有能力通过加密的数学逻辑进行“思考”。

简而言之:这些 AI 工具在发现显而易见但被隐藏的线索方面表现出色,但在面对被强加密锁定的代码时目前毫无用处。它们无法“解锁”谜团;它们只能阅读已经可见的内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →