From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs
本論文は、LLMのペルソナの一貫性を悪用して、意味的には一貫しているが計算量的に非効率な振る舞いを誘発する新しい攻撃フレームワーク「RolePlay」を導入するものであり、最大207.64倍のトークン増幅を実現し、既存の推論コスト攻撃手法を大幅に上回る性能を示す。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータが単に質問に答えるだけでなく、個性を持つ世界を想像してみてください。これは、チャットボット、コード生成器、デジタルアシスタントの背後にある超スマートなAIの脳、大規模言語モデル(LLM)の領域です。これらのモデルは、あなたの質問を読み、一単語ずつ答えを書き留めていく、非常に速くておしゃべりな学生のように機能します。彼らが書く一単語一単語が、わずかな電気とコンピュータのパワーを消費します。通常、これは効率的です。あなたが「2+2は何?」と聞けば、彼らは素早く「4」と打ち込みます。しかし、もしコンピュータを騙して、「4」と言うためだけに1,000単語を書かせることができたらどうなるでしょうか?それが、この論文が取り組んでいる問題です。この研究は、AIモデルに対して叫んだり壊したりするのではなく、特定の「役割」を与えて、あらゆることを考えすぎるようにさせることで、AIにエネルギーと時間を浪費させる新しい方法を探求しています。
この研究の背後にある研究者、Zhiyi Mou氏とそのチームは、これらのAIモデルが「ペルソナ」を扱う際の隠れた弱点を発見しました。簡単に言えば、ペルソナとは、俳優が身につける衣装やキャラクターのようなものです。もしあなたがAIに「ミスをすることを恐れている、神経質で向上心の高い学生のふりをして」と伝えると、AIはキャラクターを維持しようと最善を尽くします。チームは、適切なキャラクターを選べば、AIが自然と、自分の仕事を100回確認したり、自分の答えを疑ったり、単純なことを過度に複雑に説明したりといった、非効率的な行動をとり始めることを発見しました。彼らはこの新しい手法をRolePlayと呼んでいます。
ここにある大きな発見があります:単にAIに特定の、少し非効率的な人格を割り当てるだけで、AI自身が騙されていることに気づかないまま、必要以上に大量のテキストを生成させることができるのです。彼らのテストでは、この手法は多くの異なるAIモデルに対して効果がありました。平均して、彼らはモデルに通常よりも7.64倍多くの単語を生成させました。最も極端なケースでは、AIは207.64倍ものテキストを生成しました!例えば、通常は3秒で12単語で完了するタスクが、142秒近くかかり、1,500単語以上にまで引き延ばされました。
この論文は、これが深刻な問題であると主張しています。なぜなら、止めるのが難しいからです。AIに時間を浪費させる古い方法には、奇妙で不具合のある文章や、「もっと深く考えろ」といった明白な命令を使う方法がありましたが、これらはコンピュータのフィルターによって容易に検知され、ブロックされます。しかし、RolePlayは巧妙です。プロンプトは、「新人学生として振る舞う」や「混乱した専門家になる」といった、普通で丁寧なリクエストのように見えます。AIは指示に従い、キャラクターを維持することに非常に長けているため、たとえそれが非常に遅くて反復的であったとしても、頼まれた通りに喜んでリソースを浪費してしまうのです。
研究者たちは、数学の問題の解決からコードの記述、一般的な質問への回答まで、幅広いタスクでこれをテストしました。彼らは、どのようなタスクであっても「ペルソナ」のトリックが機能することを発見しました。また、彼らはこの手法を、AIを遅らせるために使われる他の既知のトリックと比較しましたが、RolePlayが常にトップとなりました。例えば、Gemini-3.5-Flashと呼ばれる特定のモデルでは、RolePlayによってAIは7.64倍のトークンを生成しましたが、他の手法では約3.5倍しか達成できませんでした。また、通常は出力制限があるモデルにおいても、RolePlayは通常より3.19倍多くのコンテンツを生成させることに成功しました。
研究の中で最も興味深い部分の一つは、彼らがどのようにこれらのペルソナを構築したかです。彼らは単に推測したわけではありません。まず質問を分析するスマートなシステムを使用しました。もし質問がトリッキーな数学の問題であれば、システムは「不安」を感じ、「矛盾に執着する」学生のペルソナを作成し、AIに何度も自問自答させます。もし質問が歴史に関するものであれば、ペルソナは単純な答えを拒む「頑固な専門家」になるかもしれません。この「タスク認識型(task-aware)」のアプローチにより、AIの非効率性は自然に感じられ、物語に適合するため、セキュリティフィルターによる検知が非常に困難になります。
チームは、これが単なる偶然なのか、それとも本当に機能するのかも確認しました。彼らは、大手テック企業のモデルやオープンソースのモデルを含む、さまざまな種類のAIモデルに対して数千回のテストを実行しました。結果は一貫していました。AIモデルは、過剰な説明や自己修正のループに陥り続けました。この研究は、この「ペルソナの一貫性」——与えられたキャラクターに忠実であろうとするAIの性質——が、新しい種類の脆弱性であることを示唆しています。これはコードのバグではなく、AIが役に立つように学習する仕組みそのものが、逆手に取られてしまう性質なのです。
では、これは将来にとって何を意味するのでしょうか?論文は、これが明日インターネットを閉鎖させるというわけではないと述べていますが、悪意のある者がAIサービスの資源を枯渇させる可能性のある、新しい方法を浮き彫りにしています。もし誰かがAIサービスを遅くし、コストを高くしたいと考えた場合、何百万ものリクエストを送る必要はありません。巧妙に言葉を尽くしたプロンプトを送り、AIを「先延ばしにする、考えすぎるキャラクター」に変身させるだけでよいのです。研究者たちは、この点を指摘することで、開発者が不必要な、ペルソナに基づいた饒舌な回答によってエネルギーを浪費するのを防ぐ、より良い防御策を構築できることを期待しています。
要約すると、この論文は、AIモデルがロールプレイングを行う上で優れている理由――キャラクターを維持すること――そのものが、非効率的にするために利用できることを明らかにしています。AIに神経質な学生や混乱した専門家の衣装を着せることで、研究者たちは、一つの質問にかかるコストを数百倍に増幅できることを示しました。これは、AIの世界において、時には最も強力なツールは複雑なアルゴリズムではなく、シンプルで適切に選ばれた「衣装」であるということを思い出させてくれます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。