Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?
本論文は、意味的に無関係な「スパリアス」プロンプトが、大規模言語モデルのタスク性能を向上させたり、意図しない動作を引き起こしたりするように体系的に誘導し得ることを示し、ブラックボックス検索を通じて悪用可能な新たなプロンプト感応性の形態を明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いけれど、少し気取ったロボットアシスタントがいると想像してください。通常、そのロボットに数学の問題を解かせるには、「この方程式を解いてください」と指示します。物語を書かせるには、「竜についての物語を書いてください」と言います。これが私たちが通常、AI と対話する方法です。明確で関連性の高い指示を与えます。
この論文は、奇妙で驚くべきことを発見しました。ロボットが機能するために、正しい指示を与える必要はないのです。 実際、タスクとは全く無関係な指示を与えても、ロボットは通常の指示を与えた場合よりも問題をうまく解決するかもしれません。
著者たちはこれらを「偽の指示(Spurious Prompts)」と呼んでいます。
魔法のトリック:「秘密のコード」の比喩
AI モデルをグランドピアノだと考えてください。通常、特定の曲(タスク)を演奏するには、特定の鍵盤(タスクの指示)を押します。
研究者たちは、ピアノで全く異なるランダムな旋律(ハープの弦の調律やタペストリー織りについての指示など)を演奏すると、ピアノが偶然、あなたが望んでいた正しい曲を演奏し始めること、そして時には、直接その曲を演奏しようとした場合よりももっと上手に演奏することを見出しました。
その指示には「この数学の問題を解いて」とは書かれていません。代わりに、以下のようなものかもしれません:
「あなたは織機で 6 本の異なる糸を織る職人です。デザイナーが模様を指定します。その質感を形成する糸の束を選択してください。布のドレープは考慮しないでください。あなたの役割は純粋に構造的な整合性です。パターンが決まったら、織るのをやめて、[文字] と述べてください。」
これが織物に関するものであり、数学の言葉が一切含まれていないにもかかわらず、この指示と共に AI に数学の問題を与えると、AI はしばしば数学の問題を正しく解きます。
これらの指示をどのように発見したか
研究者たちはこれらの指示を推測したわけではありません。彼らは「ブラックボックス検索」(宝箱の中が見えず、結果しかわからない宝探しのようなもの)を使用しました。
- ジェネレーター: 彼らは超賢い AI に、灯台、鐘、秘密のアーカイブなどに関する、奇妙で無関係な物語を数百編書かせました。
- フィルター: 偶然、タスクに関連する言葉(「数学」、「計算」、「診断」など)が含まれていた物語はすべて捨て去りました。
- テスト: これらの奇妙な物語を AI に試して、どれが実際の質問に正しく答えるかを確認しました。
- 進化: 最も優れた奇妙な物語を取り出し、わずかに混ぜ合わせて再度試行し、徐々に「完璧な」奇妙な指示へと進化させました。
彼らが発見したこと
- 機能する: これらの無関係な指示は、しばしば「ステップバイステップで考えよ」や「慎重に解け」といった標準的な指示と同じか、それ以上の性能を発揮しました。
- 長さではない: より長く詳細な指示の方が良いと思うかもしれません。しかし、これらの「偽の」指示は、最適化されたものよりも実際には短かったにもかかわらず、勝利しました。
- 意味ではない: 研究者が指示の「意味」を検証したところ、これらの奇妙な指示は、ランダムな意味不明な言葉と同じくらいタスクとは無関係であることがわかりました。AI は物語を理解していたのではなく、テキストの構造や雰囲気に反応していたのです。
- 意図的に(間違って、あるいは正しく)機能する: 研究者たちはまた、これらの指示を使って AI に以下のようなばかげたことを強制的に行わせることができることを見出しました:
- 正解であってもなくても、常に最初の選択肢(A)を選ぶ。
- 常に偶数を答えとして与える。
- 意図的に質問に対する誤った答えを与える。
大きな教訓
この論文は、大規模言語モデル(LLM)が、私たちがまだ完全に理解していないものに敏感であることを示唆しています。それらは、マニュアルを読む人間のように言葉の「意味」に従っているだけではありません。代わりに、内部に隠された「レバー」を持っているようです。「ハープの調律」についての指示は、ハープが数学の問題とは無関係であるにもかかわらず、モデルの集中力を高めるレバーを引くかもしれません。
要約すると: この論文は、仕事とは全く無関係な指示を使って強力な AI を操ることができることを証明しています。そして時には、その無関係な指示は、明らかな指示よりもよく機能します。まるで、料理人に「スープを調理せよ」と言うよりも「銀食器を磨け」と言う方が、スープの味が良くなることがわかるようなものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。