← 最新の論文
💬 NLP

UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following

本論文は、類似した参照記事に共通する制約を合成し、真の遵守ではなく表面的なコピーアップアップを防ぐために全文と要約の両方で回答を評価する、LLMの指示遂行におけるコピー&ペーストのショートカットを排除するために設計された新しいフレームワークおよびベンチマークであるUNSPECIFICを紹介するものである。

原著者: Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Jeet Sharma, Balpreet Kaur, Jeremiah Hong, Hamed Zamani, Haw-Shiuan Chang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに物語の書き方を教えていると想像してみてください。あなたは、「主人公は勇敢でなければならない」や「物語は雨の中で終わらなければならない」といった、ルールのリストを渡します。これは**指示遂行(instruction following)**と呼ばれます。人工知能の世界では、大規模言語モデル(LLM)がこれらのロボットにあたり、研究者たちは、AIが混乱したりデタラメを言ったりすることなく、複雑で長いルールのリストに従えるかどうかを常にテストしています。

しかし、ここからが厄解なところです。ロボットが本当にルールについて「考えて」いるのか、それとも単に近道をしているだけなのか、どうすれば判断できるでしょうか?時には、テスト自体に欠陥があることもあります。もし、AIに直前に読んだ特定の例に基づいた物語を書くよう求めた場合、AIはその例の詳細を自分の物語にコピー&ペーストしてしまうかもしれません。それは、まるで「友達を助けた時のこと」についてエッセイを書くように言われた生徒が、代わりに「私は友達の荷物を運ぶのを手伝った」と書かれた友人の宿題の一節をそのまま書き写してしまうようなものです。教師は「助ける」「友達」という言葉を見て、「よくできました!」と思うでしょうが、実際には生徒は自力で作業を行っていません。この論文は、ロボットが本当に賢いのか、それとも単にコピーが得意なだけなのかを見極めるために、このショートカット(近道)を修正する方法について述べています。


コピー&ペーストの大きな近道

新しいフレームワークであるUNSPECIFICをご紹介しましょう。これは、AIモデルが楽な道を選ぼうとするのを捕まえるために設計されました。マサチューセッツ大学アマースト校の研究者たちは、現在のAIのテスト方法に重大な問題があることに気づきました。通常、テストを作成する際は、実際の記事(ニュース記事など)を使用し、その記事を指示のリストに変換するようAIに求めます。そして、別のAIに対して、それらの指示に従って新しい物語を書くよう求めます。

問題は、最初のAIが単純化されてしまうことです。一般的なルールを考える代わりに、元の記事から具体的な詳細をそのまま拾ってしまうのです。例えば、元の物語が「ジョンとメアリーがウォルマートでヨーグルトを巡って喧嘩している」内容だった場合、指示は「登場人物の名前はジョンとメアリーでなければならない」や「彼らはウォルマートで喧嘩しなければならない」となることがあります。これを受け取った二番目のAIは、創造性を発揮する必要はありません。ただ「ジョン」「メアリー」「ウォルマート」を自分の物語にそのままコピーすればよいのです。これは「コピー&ペーストのショートカット」であり、AIが指示を完璧に守っているように見せかけますが、実際には単に模倣しているだけなのです。

UNSPECIFIC はどのようにショートカットを見抜くのか

これを防ぐために、UNSPECIFICチームは、テストを公平かつ困難なものにするための「3ステップの魔法のトリック」を考案しました。

ステップ1:「共通項」ゲーム
一つの物語からルールを作るのではなく、研究者はAIに「二つの似たような物語」を入力します。例えば、人々が言い争っている二つの異なる物語があると想像してください。一つは「食料品店でのジョンとメアリー」について、もう一つは「ガソリンスタンドでのクリスとジュリー」についてです。もしAIに両方の物語に適用できるルールを見つけるよう求めれば、AIは「登場人物はジョンとメアリーでなければならない」とは言えません。なぜなら、それは最初の物語にしか当てはまらないからです。代わりに、AIは「主要な登場人物は口論をしなければならない」といった、より一般的なルールを導き出さなければなりません。これにより、ルールは単一のテキストからの具体的な詳細ではなく、人間が実際に求めるような、より広範で自然なものになります。

ステップ2:「簡単すぎる」フィルター
一般的なルールであっても、依然として簡単すぎるものがあります。例えば、「物語には始まりがあるべきである」というルール。すべての物語には始まりがあります!AIは努力することなくこれを満たしてしまいます。UNSPECIFICは、ルールを見る前にAIに「ベースとなる物語」を書かせることで、これをチェックします。もしAIが普通の物語を書くだけで偶然ルールを満たしてしまった場合、そのルールは「簡単すぎる」としてフラグが立てられます。システムはその後、その簡単なルールを「登場人物が奇妙な音で目覚めるところから物語を始めなければならない」といった、より難しいルールに入れ替えます。これにより、AIに実際に考えさせます。

ステップ3:「要約テスト」
これが最も巧妙な部分です。AIが物語を書いた後、研究者はその物語を、元の長さの約25%程度の短い段落に要約するようAIに求めます。もしAIが、単に物語の最後にランダムな文章を付け加えることでルールを満たそうとした場合(例:「そして、物語はハッピーエンドで終わります」など)、それらの詳細は要約から削ぎ落とされます。もし要約の中にそのルールが残っていれば、それはAIがルールを物語の「核」の部分に織り込んでいることを意味します。もしルールが消えてしまったら、AIは表面的な詳細を使ってショートカットを取っただけだったということです。

彼らが発見したこと

彼らがこの新しいシステムをテストに投入したところ、結果は目を見張るものでした。多くのAIモデルが、実際にコピー&ペーストのショートカットを取っていたことが判明しました。

  • 難易度の跳ね上がり: 新しいUNSPECIFICメソッドを使用すると、GPT-5 Miniと呼ばれる強力なモデルの充足率は、標準的な単一記事のベースラインにおける**89.7%から78.2%**へと低下しました。これはAIの性能が悪化したことを意味するのではなく、AIが十分に努力していない時に、テストがついにそれを捉えたことを意味します。
  • コピー&ペーストの乖離: 研究者たちは、従来のテストにおける「成功」の大部分が、完全には正確ではないことを発見しました。要約を確認したところ、指示に完璧に従っているように見えた多くのモデルが、実は「核となる物語(core narrative)」のテストで失敗していました。彼らは物語の表面上でしかルールを満たしておらず、物語の核心には至っていなかったのです。
  • 自然さの勝利: 新しい制約は、より実際の人間によるリクエストに近い感覚を与えます。実際、これらの新しい指示の自然さと、古い指示の自然さを人間が評価した際の差は、**30%**改善されました。

この論文は、単に指示を難しくするだけでは不十分であることを示唆しています。指示が、AIが単に答えをコピー&ペーストできないほど、十分に一般的であるようにしなければなりません。UNSPECIFCは、「二つの物語」を用いる方法と「要約テスト」を用いることで、AIが本当に指示を理解しているのか、それとも単に「一致する言葉を探すゲーム」をしているだけなのかについて、より明確な姿を明らかにします。

結局のところ、UNSPECIFICは単にAIをより懸命に働かせるためのものではなく、AIが「どのように」働いているのかを確実に把握するためのものです。それはモデルがショートカットを取るのを阻止し、AIに実際に執筆させることで、「AIが指示に従っている」と言うとき、それが本当に指示の内容を理解していることを保証するのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →