← 最新论文
🤖 machine learning

Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots

本文介绍了 Honeyval,这是一个针对大语言模型驱动的网络蜜罐的综合评估框架,它通过利用人工智能攻击代理和多样化的后端应用,解决了可扩展且可复现的测试缺失问题,最终证明与大语言模型基线相比,基于大语言模型的蜜罐在保持成本效益的同时,能提供显著更长的攻击者交互时间和更低的检测率。

原作者: Mark Vero, Fabian Kaczmarczyck, Ivan Petrov, Ilia Shumailov, Jamie Hayes, Niels Heinen, Tianqi Fan, Luca Invernizzi, Martin Vechev

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mark Vero, Fabian Kaczmarczyck, Ivan Petrov, Ilia Shumailov, Jamie Hayes, Niels Heinen, Tianqi Fan, Luca Invernizzi, Martin Vechev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名城堡守卫,正试图抓捕一名窃贼。在过去,为了抓捕窃贼,你会设置一个假宝藏室(即蜜罐),其外观与真的一模一样。但这里有个陷阱:为了让假房间具有说服力,你必须在里面放入真正的黄金和真正的锁。如果窃贼足够聪明并成功潜入,他们可能会偷走你的真金,或者给你的城堡带来伤害。

最近,安全专家开始使用**人工智能(大语言模型)*来运营这些假房间。人工智能不再拥有真正的黄金,而是假装*拥有黄金。它可以与窃贼交谈、回答问题,并表现得像一个真实的系统;但由于它只是一个聊天机器人,窃贼实际上无法偷走任何东西或伤害你的城堡。这要安全得多。

然而,存在一个大问题:你怎么知道人工智能是否做得好?
在这篇论文之前,人们通过三种混乱的方式测试这些人工智能守卫:

  1. “脚本”测试:他们反复向人工智能提出相同的 10 个问题,并检查答案是否看起来正确。(但真正的窃贼不会反复问同样的 10 个问题)。
  2. “人类”测试:他们雇佣人类尝试入侵。(这既缓慢又昂贵,且难以重复)。
  3. “现实世界”测试:他们将人工智能守卫部署到互联网上并等待。(这不可预测;你可能要等几个月才有窃贼出现,或者窃贼可能立即离开)。

引入"Honeyval":人工智能守卫的训练场

这篇论文的作者构建了一个名为Honeyval的全新、全面的测试框架。将其想象为一个用于网络安全的高科技视频游戏模拟器

以下是 Honeyval 的工作原理,使用简单的类比:

1. 16 种不同的“假象”(环境)
Honeyval 不是只在一个假房间中测试人工智能守卫,而是提供16 种不同的假场景供其练习。这些场景基于真实的 Web 应用程序(如购物车、论坛或登录系统)。人工智能守卫必须完美地假装成这些特定系统。

2. “机器人窃贼”(攻击者)
Honeyval 不使用等待人类窃贼或雇佣人类进行测试,而是使用AI 黑客代理。这些是其他专门编程用于尝试入侵假系统的人工智能。

  • 主游戏:机器人窃贼尝试攻击人工智能守卫。
  • 记分牌:系统衡量窃贼保持参与的时间(人工智能守卫是否让他们忙了起来?)、运行模拟的成本,以及窃贼是否意识到“嘿,这是假的!”

3. “控制测试”(现实检验)
为了确保测试公平,Honeyval 运行两项额外检查:

  • 窃贼检查:机器人窃贼尝试攻击真实(但存在漏洞)的相同应用程序版本。如果窃贼无法攻破真实系统,他们也不应能攻破假系统。这证明了窃贼确实擅长黑客攻击。
  • 守卫检查:人工智能守卫由“友好用户”(功能测试套件)进行测试,以确保它确实知道如何表现得像真实系统。如果守卫无法正确回答一个简单的问题,那么它就不是一个合格的假象。

他们发现了什么?

研究人员测试了多种不同的人工智能模型,以查看哪些模型能制造出最好的“假守卫”。以下是他们的主要发现:

  • 人工智能守卫更擅长“表演”:与仅遵循简单规则的老式假守卫(例如机器人对一切都说“访问被拒绝”)相比,人工智能驱动的守卫让机器人窃贼忙碌了更长的时间。平均而言,人工智能守卫让窃贼交谈了约83 次请求,而旧式的基于规则的守卫仅维持了约31 次请求。这为防御者提供了更多时间来研究窃贼的战术。
  • 它们难以被识破:机器人窃贼通常无法分辨人工智能守卫是假的。在大多数情况下,窃贼认为他们正在攻击一个真实系统。而旧式的基于规则的守卫几乎立即就被识破了。
  • 成本效益:尽管运行人工智能需要花钱,但运行人工智能守卫的成本通常低于机器人窃贼尝试入侵的成本。这对防御者来说是一笔划算的交易。
  • “速度”问题:发现的最大弱点是人工智能守卫有点慢。它们需要几秒钟来构思回复。机器人窃贼有时会发现这种延迟,并意识到:“等等,真实的服务器不会花 3 秒钟来回答;这一定是个假象!”
  • 心理博弈:研究人员尝试给人工智能守卫特殊的指令。
    • 如果他们告诉守卫要“说服窃贼应用程序是安全的”,窃贼停留的时间会更长(认为他们接近胜利),但他们也会更快地产生怀疑。
    • 如果他们告诉守卫尝试“欺骗窃贼的人工智能”,这往往会适得其反,导致守卫更快地被识破。

结论

这篇论文并不声称人工智能守卫是完美的,或者已准备好取代所有人类安全团队。相反,它提供了第一把可靠的尺子来衡量这些人工智能守卫的优劣。

他们发现,人工智能驱动的蜜罐是一种非常有力的工具。它们比真实系统更安全(因为没有真实资产处于风险中),更难被攻击者识破,并且比简单、愚蠢的假系统能让攻击者保持更长时间的参与。然而,为了使其变得更好,我们需要让它们更快,并更擅长隐藏其“人工智能”的本质。

作者已将其测试框架Honeyval公开,供所有人使用,以便其他研究人员在未来构建更好的人工智能守卫。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →