← 最新の論文
💻 computer science

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

この論文は、LLMエージェントが実在しないスキル名を高い一貫性を持って頻繁に幻覚として生成してしまうという、サプライチェーンにおける決定的な脆弱性を明らかにしており、これはモデルのチューニングのみでは解決できず、レジストリレベルでの名称予約のようなエコシステム全体にわたる構造的な変更を必要とする、悪用可能な攻撃ベクトルとなる。

原著者: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

公開日 2026-07-15
📖 1 分で読めます☕ さくっと読める

原著者: Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、新しい技を学ぶことができる超スマートなロボットアシスタントを持っていると想像してください。あなたが巨大な図書室をあちこち探し回る代わりに、ただロボットに「ねえ、ファイルを整理するための良い技はある?」と尋ねるだけです。ロボットは、実在する、あらかじめ用意された指示書(これを「スキル」と呼びます)を検索し、あなたがダウンロードできるようにその名前を教えるはずです。

しかし、ここには恐ろしい部分があります。ロボットは自信満々な嘘つきなのです。

魔法ではない手品

この研究では、研究者たちが12種類の異なるロボットの脳(単なる脳だけのものもあれば、ウェブ検索ツールを備えた脳もあります)に対し、15,000種類の異なる質問に対してスキルを推奨させました。その結果、そのすべてが、架空のスキル名を捏造していることが分かりました。

平均して、スタンドアロンのロボットの脳は、**36.0%の割合で名前をでっち上げました。ロボットがツールや検索を備えたフルシステムの「エージェント」の一部であった場合、偽物の割合は36.9%でした。そして、質問が実際の開発者からの助けを求めるものであった場合、嘘の率は43.1%**へと跳ね上がりました。

ロボットは単に「わかりません」と言ったのではありません。「ああ、あなたには file-system-operations が必要ですね!」とか、「visual-studio-code を試してみてください!」と自信たっぷりに言ったのです。問題は? それらのスキルは存在しないのです。 ロボットは、ユーザーが必要としているであろう内容から、それがどうあるべきかを推測して名前を作り上げてしまいました。まるで、「スパイシーなスープ」のレシピを求められたシェフが、誰も作ったことがない「spicy-soup-recipe」という料理を考案してしまうようなものです。

「ゴースト」の罠

なぜこれが危険なのでしょうか? 想像してみてください。泥棒がおもちゃ屋の外に立っています。泥棒は、ロボットが子供に対して「君には super-cool-bike が必要だよ!」と言っているのを耳にします。子供はそれを探しますが、そこにはありません。

泥棒は、ロボットが次にやってくる子供にも同じことを言うと知っています。そこで、泥 thief は店のカタログに行き、super-cool-bike という実在する名前で自転車を登録しますが、その中に罠を仕込みます。すると、次に子供が助けを求めたとき、ロボットは「super-cool-bike を手に入れよう!」と言います。子供がそれをダウンロードした瞬間――ドカン! 罠が作動します。

研究者たちは、これが可能であることを証明しました。ロボットは驚くほど頑固であることが分かりました。もし同じロボットに同じ質問を10回投げかけたとしても、多くの場合、10回中7.8回までは全く同じ偽の名前を出し続けるのです。これはランダムなノイズではなく、予測可能なパターンです。

実際、研究者たちは、非常に人気のある410個の偽の名前が存在し、異なるロボットたちが何度も何度もそれを捏造し続けていることを発見しました。もし悪党がこれら上位500個の偽の名前を登録してしまえば、テストにおける全被害者の**57%**を騙せる可能性があります。

なぜ修正できないのか?

「ロボットにインターネットを検索させて、そのスキルが存在するか確認させればいいのでは?」と思うかもしれません。研究者たちはこれをテストしました。彼らはロボットにウェブ検索ツールを与え、「答える前に確認しろ!」と命じました。

効果はありませんでした。 ロボットは依然として嘘をついていました。なぜでしょうか? file-system-operations について検索したとき、インターネット上にはファイルシステムに関する記事が溢れていました。ロボットはその言葉を見て、「あぁ!これは存在するのだ!」と思ったのです。ロボットは、それが特定の(実在しない)「スキルファイル」を探していることに気づかず、検索結果がその「概念」が実在することを裏付けてしまっただけでした。

「自己チェック」の失敗

研究者たちはまた、ロボットに自分の仕事を確認させることも試みました。「今、作り話をしたのではないか?」と問いかけたのです。
ロボットは惨めな失敗をしました。彼らはコイン投げの結果よりもマシとは言えず、正解できたのはわずか**51%**の時間だけでした。それは、嘘をついた直後の人に対して「あなたは今嘘をつきましたか?」と聞くようなものです。彼らは大抵、さらに言い訳を重ねる(二重に主張する)だけなのです。

「安全性」のトレードオフ

では、どうすれば止められるのでしょうか? 研究者たちはいくつかの方法を試しました。

  1. 検索拡張生成 (RAG): これは、ロボットが答える前に、実在するスキルのリストを強制的に参照させる手法です。これは嘘を止めることには非常に効果的で、偽物の割合を**40.8%から3.2%**へと劇的に下げました。
    • 代償: ロボットは使い物にならなくなりました。間違いを犯すことを恐れすぎた結果、ほとんどの質問に答えなくなってしまったのです。このセーフティネットがあっても、ロボットが正しいスキルを見つけ出せたのは、わずか6回に1回程度でした。
  2. 多数決 (Voting): 複数のロボットに答えを合意させる方法です。これにより、嘘の**92.8%**を防ぐことができましたが、これも同様に、実在するスキルを見つける能力を著しく低下させ、ロボットの有用性を損なわせました。

結論

この論文は、これは単にロボットを「微調整」したり、もっと注意深くするように伝えたりすることで解決できる「バグ」ではないと結論づけています。問題は、これらのロボットの思考プロセスそのものに組み込まれています。彼らは名前がどうあるべきかを推測するのが上手すぎる一方で、何が実際に存在するかを知る能力が低すぎるのです。

これを解決するには、研究者によれば、ロボットだけに頼るのではなく、システム全体を変える必要があります。「スキル」が格納されるライブラリ側で名前を予約してロボットが勝手に作れないようにし、ロボットは発言する前に検証済みのリストを確認できるようにしなければなりません。それまでは、もしあなたのアシスタント・ロボットが新しいスキルを勧めてきたら、それが本当に存在するかどうかをまず確認してください。 さもなければ、それはただの「ゴースト」かもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →