← 最新の論文
💬 NLP

Detecting Data Contamination in LLMs via In-Context Learning

本論文は、文脈内学習がモデルの信頼性に与える影響を分析し、記憶された訓練データと未見の分布とを区別することで、大規模言語モデルにおける訓練データの汚染を検出・定量化する実用的かつ自動化された手法「CoDeC」を導入する。

原著者: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは教師で、生徒の試験を採点していると想像してください。知りたいのは、この生徒は本当に内容を理解したのか、それとも漏洩した解答用紙から答えを丸暗記しただけなのかということです。

長らく、大規模言語モデル(LLM)がトレーニング中に試験問題を「丸暗記」して「不正」をしたかどうかを検証することは、干し草の山から針を探すような難事でした。従来の方法は遅く、モデルの秘密のトレーニングファイルへのアクセスが必要だったり、結果が混乱を招いたりしていました。

本論文は、CoDeC(Contamination Detection via Context:文脈による汚染検出)と呼ばれる、新しくシンプルなツールを紹介します。CoDeC を「ヒント付きのサプライズ小テスト」と考えるとわかりやすいでしょう。

核となるアイデア:「ヒント」テスト

CoDeC がどのように機能するかを、シンプルな比喩を使って説明します。

1. 「未見」のシナリオ(正直な生徒)
あなたが、生徒が一度も見たことのない数学の問題を出題すると想像してください。

  • ヒントなし: 彼らは少し苦労するかもしれません。
  • ヒントあり: あなたは彼らがまだ見たことのない、似たような問題を提示します。すると、彼らは突然「ひらめき」ます。ヒントは問題のスタイルを理解する助けとなり、彼らはより高い自信を持って回答します。
  • CoDeC の観察: モデルが暗記していないデータセットを見た場合、その同じデータセットからの例を与えることは、有益なヒントのようになります。モデルは賢くなり、自信を深めます。

2. 「暗記」のシナリオ(不正をする生徒)
今度は、生徒が漏洩した解答用紙からすでに丸暗記している問題を出題すると想像してください。

  • ヒントなし: 彼らは記憶しているため、完璧に答えを暗唱します。
  • ヒントあり: あなたは、同じ漏洩した解答用紙から別の問題を提示します。これは助けになるどころか、この新しい情報は彼らを混乱させます。なぜなら、彼らの脳は「暗唱モード」に固着しているからです。新しいヒントは、彼らの硬直した記憶パターンを乱し、彼らをつまずかせ、自信の低い回答に導きます。
  • CoDeC の観察: モデルがデータを暗記している場合、その同じデータからの例を追加すると、暗記のリズムを崩すため、かえってそのモデルの自信が低下します。

CoDeC がこれをどう測定するか

この方法は驚くほどシンプルで自動化されています。

  1. モデルのトレーニングデータに含まれているかもしれないと疑われるデータセットから、ある質問を選びます。
  2. モデルにその質問への回答を求めます(自信度を測定)。
  3. 「ヒント」を追加します: 対象の質問の直前に、その同じデータセットからいくつかの他のランダムな質問を配置します。
  4. モデルに再度回答を求めます:自信度は上がりますか、それとも下がりますか?
    • 自信度が上がる? モデルはおそらくクリーンです(文脈から学習しています)。
    • 自信度が下がる? モデルはおそらく汚染されています(暗記しており、追加の文脈が混乱を招いています)。

これを数百の質問に対して行うことで、CoDeC はパーセンテージスコアを提供します。

  • 0–20%: モデルはおそらく正直です。暗記ではなく、推論を行っています。
  • 80–100%: モデルはおそらくこのデータセットを丸暗記しています。「不正」をしています。

これが重要である理由

  • 秘密鍵は不要: モデルのトレーニングファイル(多くの場合秘密)を見る必要はありません。モデルと対話するだけで済みます。
  • どこでも機能します: 数学テスト、コーディング課題、一般教養の質問など、あらゆる分野で機能します。
  • 「ソフト」な不正を捉えます: 完全なコピーだけでなく、非常に類似したデータ(試験問題の言い換え版や、ベンチマークの合成版など)を見たモデルも捉えます。モデルが試験の「雰囲気」を暗記している場合、CoDeC はそれを捉えます。

著者たちが発見したこと

研究者たちは、公開されたトレーニングデータを持つモデル(真実がわかっているもの)と、秘密のトレーニングデータを持つモデルを含む、数十のモデルで CoDeC をテストしました。

  • 結果: CoDeC は驚くほど正確でした(見たデータと見ていないデータを区別する精度が 99.9%)。
  • ベースライン: 従来の方法(モデルが問題を「どれだけ簡単」に感じるかをチェックするものなど)は、不正をする者と正直な生徒を区別することに失敗しました。
  • 実世界の発見: 彼らが CoDeC を人気のある最近のモデルに適用したところ、特定のベンチマークで非常に高いスコアを獲得したいくつかの事例が見つかりました。これは、それらのモデルがトレーニング中に試験データ(または非常に類似したデータ)をすでに目撃していた可能性を示唆しています。

結論

CoDeC は、AI ベンチマークのための嘘発見器のようなものです。単に「答えを知っていますか?」と問うのではなく、「このトピックについてもっと見ることは、あなたを助けますか、それとも混乱させますか?」と問います。もし混乱させるなら、あなたはすでに答えを丸暗記している可能性が高いのです。これにより、AI コミュニティはベンチマークスコアをより信頼できるようになり、モデルが単に暗記する能力ではなく、学習する能力に基づいて評価されることを保証します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →