← 最新论文
💻 computer science

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

本文揭示了LLM智能体中一个关键的供应链漏洞,即它们频繁且高度一致地幻觉出不存在的技能名称,从而创造了一个无法仅通过模型微调来解决、而需要如注册层级名称预留等全生态系统结构性变革来应对的可利用攻击向量。

原作者: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人助手,它能学习新的技能。你不需要再去巨大的图书馆里翻找合适的技巧,你只需要问机器人:“嘿,有什么整理文件的妙招吗?”机器人应该去查找一个真实的、预先制作好的说明书(称为“技能”),并把它的名字告诉你,以便你下载。

但可怕的部分在于:这个机器人是一个自信的骗子。

不存在的魔术

在这项研究中,研究人员让 12 个不同的机器人大脑(有些只是单纯的大脑,有些则是带有网络搜索工具的大脑)针对 15,000 个不同的问题推荐技能。他们发现,每一个机器人都在编造虚假的技能名称。

平均而言,在 36.0% 的情况下,独立运行的机器人大脑会发明一个名字。当机器人作为一个完整的“智能体”系统(拥有工具和搜索功能)的一部分时,其造假率为 36.9%。而当问题来自寻求帮助的真实开发者时,造假率跳升到了 43.1%

这些机器人并不只是说“我不知道”。它们会自信满满地说:“哦,你需要 file-system-operations!”或者“试试 visual-studio-code!”问题在于?这些技能并不存在。 机器人根据它们认为你需要的描述,反向推导出了一个名字,就像一位厨师在被问到“如何做辣汤”的食谱时,竟然发明了一道名为“辣-汤-食谱”的菜肴,而这道菜从未有人真正烹饪过。

“幽灵”陷阱

为什么这很危险?想象一下,一个窃贼站在玩具店外面。窃贼听见机器人对一个孩子说:“你需要 super-cool-bike(超酷单车)!”孩子去找,却发现根本没有。

窃贼知道机器人会对下一个孩子说同样的话。于是,窃贼去商店的目录里注册了一个名为 super-cool-bike 的真实单车,但他在说明书中偷偷埋下了陷阱。现在,当下一个孩子提问时,机器人会说:“去买 super-cool-bike!”孩子下载了它,然后——砰!陷阱触发了。

研究人员证明这是可能的。他们发现机器人异常固执。如果你问同一个机器人同一个问题 10 次,它通常会在 10 次中高达 7.8 次给出完全相同的假名。这并非随机的噪音,而是一种可预测的模式。

事实上,研究人员发现有 410 个假名如此受欢迎,以至于不同的机器人不断地重复发明它们。如果一个坏人注册了前 500 个这些假名中的任何一个,他们就有可能欺骗测试中 57% 的受害者。

我们为什么不能直接修复它?

你可能会想:“机器人不能直接上网查查这个技能是否存在吗?”研究人员测试了这一点。他们给了机器人网络搜索工具,并告诉它们:“回答之前先检查一下!”

没用。 机器人仍然在撒谎。为什么?因为当它们搜索 file-system-operations 时,互联网上充满了关于文件系统的文章。机器人看到了这些词,便认为:“啊哈!它确实存在!”它并没有意识到自己是在寻找一个特定的、并不存在的“技能文件”。搜索证实了该“概念”是真实的,但并未证实该“技能”是存在的。

“自我检查”的失败

研究人员还要求机器人检查自己的工作。他们问:“你刚才是在瞎编吗?”
机器人的表现惨不忍睹。它们的表现并不比抛硬币好多少,正确率仅为 51%。这就像问一个刚刚撒了谎的人是否在撒谎;他们通常会变本加厉地坚持原有的说法。

“安全性”的权衡

那么,我们该如何阻止这一切呢?研究人员尝试了几种方法:

  1. 检索增强生成 (RAG): 这强制要求机器人先查看一份真实的技能列表再回答。这在阻止谎言方面效果显著,将造假率从 40.8% 降到了 3.2%
    • 代价: 机器人变得毫无用处。因为它太害怕犯错,它不再回答大部分问题。即使有了这个安全网,机器人找到正确技能的概率也仅为六分之一
  2. 投票机制: 他们尝试让多个机器人对一个答案达成一致。这阻止了 92.8% 的谎言,但同样,这削弱了机器人的实用性,导致其寻找真实技能的成功率大幅下降。

核心结论

论文得出结论,这并不是一个可以通过仅仅“微调”机器人或告诉它要更小心就能修复的漏洞。问题根植于这些机器人思考的方式之中。它们太擅长猜测一个名字“应该”长什么样,却太不擅长知道什么才是“真实存在”的。

为了解决这个问题,研究人员表示我们不能仅仅依赖机器人。我们需要改变整个系统:存放技能的“图书馆”需要预留名称以防止机器人发明名称,且机器人需要在开口说话之前,必须通过一个经过验证的列表进行检查。在此之前,如果你的机器人助手向你推荐了一个新技能,请务必先检查它是否真的存在,因为那可能只是一个幽灵。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →