← 最新の論文
💬 NLP

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

本論文は、言語モデルに対する既存のホワイトボックス型分布外検出手法がシーケンス長によって構造的に交絡されていることを明らかにし、語彙のシフトを検出するための埋め込みベースの信号と、ジャイルブレイクなどの隠れた意図を持つ入力を検出するための隠れ状態の軌跡特徴を区別する二経路フレームワークを提案する。

原著者: Hamidreza Saghir

公開日 2026-05-04
📖 1 分で読めます☕ さくっと読める

原著者: Hamidreza Saghir

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは美術館の警備員だと想像してください。あなたの仕事は、本物の絵画の中に偽物(分布外、つまり「OOD」入力)を見つけ出すことです。最近、他の警備員たちは新しい道具を使っています:彼らは絵画がどれほど「揺れているか」、あるいは筆致がどれほど混沌としているかを測定します(これは AI におけるアテンションエントロピーの測定に相当します)。彼らはこの道具が偽物を見分けるのに驚異的だと主張しています。

しかし、この論文は、その警備員たちが実際にはだまされていると論じています。彼らは偽物を見つけ出しているのではなく、キャンバス上の筆触の数を数えているだけなのです。

以下に、論文の発見を簡単なアナロジーを用いて解説します。

1. 「長いキャンバス」の罠(長さの交絡)

この論文は、多くの人気のある AI 安全ツールが、秘密裡にテキストの長さを測定しているだけであることを発見しました。

  • アナロジー: 警備員の道具が物差しだと想像してください。それは「混沌」を測定すると主張していますが、実際には「長さ」だけを測定しています。
  • 問題点: テストにおいて、「偽物」の絵画(ジャイルブレイクやスパム)は、しばしば「本物」よりもはるかに長かったです。道具は長い絵画を見てパニックになり、「あれは偽物だ!」と言いました。それは単に長かったからです。
  • 証拠: 研究者が本物と偽物の絵画を正確に同じ長さに強制したとき、道具は機能しなくなりました。それはほぼランダムな推測(コイン投げのようなもの)に崩壊しました。この論文は、CED、RAUQ、そして展開されているシステムからのいくつかの信頼度スコアさえも、テキストの長さに伴って自然に成長するアテンション機構に依存しているため、構造的に破綻していることを示しています。

2. 二経路フレームワーク:「何」対「どのように」

研究者が「長さのトリック」を取り除くと、彼らはこう問いかけました:入力がおかしいかどうかを、実際にはどのように見分けることができるのか? 彼らは、探偵が犯罪現場を二つの異なる方法で見るような、二部構成のシステムを提案します。

経路 A:「何」(埋め込み)

  • アナロジー: これはスープの材料を見るようなものです。
  • 仕組み: 語彙をチェックします。スープに「有毒」な言葉や「スパム」のキーワードが含まれている場合、この経路がそれを検知します。
  • 機能する場面: 突然ラベルに「毒」と書かれたスープのような、明らかな偽物を見つけるのに優れています。
  • 失敗する場面: 偽物のスープが本物と同じ材料を使っているが、奇妙な方法で混ぜられている場合は失敗します。例えば、「ジャイルブレイク」プロンプトは通常、普通の言葉を使用しますが、AI を欺くようにそれらを配置します。「材料チェッカー」は普通の言葉を見て、「すべて正常」と言い、トリックを見逃します。

経路 B:「どのように」(処理軌跡)

  • アナロジー: これはシェフがスープを調理する様子を見るようなものです。
  • 仕組み: 単に最終的なボウルを見るのではなく、この経路はシェフの手が調理プロセスのすべての段階(層ごとに)をどのように動くかを観察します。「シェフはスムーズに刻んでいますか?突然パニックになって材料を投げ込んでいませんか?鍋が奇妙なリズムで揺れていますか?」と問いかけます。
  • なぜ機能するか: 材料(言葉)が正常に見えても、「ジャイルブレイク」プロンプトは AI シェフに、奇妙で不自然なリズムで調理させることを強制します。「どのように」経路はこの奇妙な調理スタイルを捉えます。
  • 結果: この経路は、「材料」経路が見逃した厄介な「ジャイルブレイク」偽物を成功裏に発見し、はるかに高い精度スコア(0.850 対、旧手法のほぼ偶然レベル)を達成しました。

3. 「クロスオーバー」の発見

この論文は、どちらの方法もすべてに完璧ではないことを発見しました。まるで二種類の異なる金属探知機を持っているようなものです。

  • 探知機 1(材料/埋め込み): 砂の山に隠された金貨(明らかな語彙のシフト)を見つけるのに優れています。
  • 探知機 2(調理スタイル/軌跡): 金のように見えるように塗装されたプラスチックの硬貨(微妙な構造的トリック)を見つけるのに優れています。
  • 洞察: 両方が必要です。「偽物」が単に異なるトピックである場合、探知機 1 が勝ちます。「偽物」が普通の言葉を使った巧妙なトリックである場合、探知機 2 が勝ちます。

4. 「なぜ」の(機械的証拠)

研究者たちは単に推測したのではなく、AI の脳(回路)の中を見て、何が起きているかを観察しました。

  • 発見: AI が「ジャイルブレイク」(構造的なトリック)に遭遇すると、特定の方法で混乱します:その「アテンション(注視)」回路が狂い、焦点を混乱させます。
  • 対照: AI が「ヘイトスピーチ」(語彙のシフト)に遭遇すると、悪い言葉を認識するため、脳の「記憶(MLP)」部分が点灯します。
  • 教訓: 異なる種類の「偽物」は、異なる方法で AI を破綻させます。古いツールは「注視」の部分だけを見て、長さによって混乱しました。新しい「軌跡」ツールは調理プロセス全体を観察するため、どこで破綻が起きてもそれを捉えます。

まとめ

この論文は、多くの現在の AI 安全ツールが、テキストの長さによってだまされるため破綻していると主張しています。これを修正するには、テキストが「何」と言っているかを見るのをやめ、AI がそれを「どのように」処理するかを観察し始める必要があります。AI の「思考プロセス」を段階的(軌跡)に観察することで、表面では正常に見えるが、AI の内部機構には奇妙に感じられる巧妙なトリックを捉えることができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →