← 최신 논문
💬 NLP

Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data

이 논문은 최상위 1순위 예측값과 타겟 토큰 사이의 로그 확률 차이를 슬라이딩 윈도우 전략과 결합하여 활용함으로써 벤치마크 데이터셋에서 최첨단 성능을 달성하는 대규모 언어 모델의 사전 학습 데이터 탐지를 위한 새로운 방법론인 Gap-K%를 제안한다.

원저자: Minseo Kwak, Jaehyung Kim

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Minseo Kwak, Jaehyung Kim

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 어떤 문장이 교과서를 암기한 학생이 쓴 것인지, 아니면 그저 즉석에서 만들어낸 문장인지를 파악하려고 노력하고 있다고 상상해 보십시오. 이것이 바로 "Gap-K%"라는 논문이 다루는 핵심 문제입니다. 다만, 여기서는 학생과 교과서 대신 **인공지능(LLM)**과 그들이 학습한 방대한 데이터셋을 다룹니다.

다음은 이 논문의 아이디어를 일상적인 비유를 사용하여 쉽게 풀어낸 설명입니다.

문제: "블랙박스" 도서관

거대 언어 모델(LLM)은 인터넷의 거의 모든 것을 읽은 학생과 같습니다. 하지만 우리는 그들이 정확히 어떤 책을 읽었는지 알지 못합니다. 이는 다음과 같은 이유로 문제가 됩니다:

  1. 개인정보 보호: 인터넷에서 얻은 개인 정보(예: 당신의 집 주소)를 암기했을 수 있습니다.
  2. 저작권: 저작권이 있는 이야기나 기사를 암기했을 수 있습니다.
  3. 부정행위: 만약 시험 문제가 학습 데이터에 포함되어 있었다면, AI는 실제로 "생각"하는 것이 아니라 그저 정답을 읊고 있는 것일 수 있습니다.

연구자들은 특정 텍스트를 보고 "네, 이 AI는 이 정확한 텍스트를 이전에 분명히 본 적이 있습니다" 또는 "아니요, 이것은 AI에게 새로운 것입니다"라고 말할 수 있는 방법을 원합니다.

기존 방식: "속삭임"에 귀 기울이기

이전 방법들은 AI가 특정 단어에 대해 얼마나 "놀라는지(surprised)"를 관찰하여 학습 데이터를 탐지하려고 시도했습니다.

  • 비유: AI가 문장을 읽고 있다고 상상해 보십시오. 만약 AI가 자신이 잘 아는 단어(학습 데이터로부터 온)를 본다면, 자신감 있게 말할 것입니다. 반면, 이상한 단어를 본다면 말을 더듬습니다(낮은 확률).
  • 결함: 기존 방식(Min-K%와 같은)은 단순히 이러한 "말더듬"만을 살펴보았습니다. 그들은 AI가 말을 많이 더듬는다면 그 텍스트는 새로운 것이라고 가정했습니다. 하지만 이는 마치 책의 내용 전체를 보는 대신 오직 오타만을 보고 책을 판단하는 것과 같습니다. 이는 AI가 문장 전체를 어떻게 "생각"하는지에 대한 더 큰 그림을 놓치게 됩니다.

새로운 아이디어: "Top-1 Gap"

논문의 저자들은 더 나은 단서가 있다는 사실을 깨달았습니다: 바로 **AI가 다음에 무엇이 올 것이라고 '생각'했던 것과 실제로 '발생한 것' 사이의 간극(Gap)**입니다.

  • 비극: 퀴즈 쇼를 상상해 보십시오.
    • 시나리오 A (학습 데이터): AI가 질문과 정답을 암기했습니다. 진행자가 문장의 전반부를 말하면, AI는 즉시 정답을 압니다. AI는 단순히 자신감이 있는 것이 아니라, 그것이 머릿속에 떠오르는 유일한 생각입니다. AI의 "최선의 선택(Top Choice)"과 "실제 정답(Actual Answer)" 사이의 간극은 제로(0)입니다.
    • 시나리오 B (새로운 데이터): AI가 이 문장을 본 적이 없습니다. AI는 문법과 논리에 기반하여 추측해야 합니다. AI는 문법적으로 말이 되는 단어(그의 "최선의 선택")를 추측할 수 있지만, 실제 문장의 다음 단어는 그와 약간 다를 수 있습니다.
    • 통찰: AI가 새로운 데이터에 대해 추측할 때, "최선의 선택"과 "실제 단어" 사이에는 눈에 띄는 **간극(Gap)**이 존재합니다. 반면, 암기된 데이터를 읊을 때는 이 간극이 사라집니다.

논문은 이를 **"Gap-K%"**라고 부릅니다. 이는 AI의 가장 좋은 추측과 실제 단어 사이의 간극이 얼마나 큰지를 측정합니다. 큰 간극은 텍스트가 새롭다는 것을 의미하며, 아주 작은 간극은 AI가 이전에 이를 본 적이 있음을 시사합니다.

핵심 비결: "슬라이딩 윈도우(Sliding Window)" 평활화

저자들은 AI가 단일 단어에서만 실수를 하는 것이 아니라, 구절(phrase) 단위로 실수를 한다는 점을 발견했습니다.

  • 비유: 노이즈가 섞인 라디오 신호를 상상해 보십시오. 만약 1초만 듣는다면 소리가 들쭉날쭉하게 들릴 수 있습니다. 하지만 5초 길이의 클립을 듣는다면 멜로디를 명확하게 들을 수 있습니다.
  • 방법: 이 논문은 "슬라이딩 윈도우"를 사용합니다. AI를 단어 하나하나로 판단하는 대신, 작은 단어 그룹(문장을 가로질러 움직이는 슬라이딩 윈도우처럼)을 보고 "간극(Gap)" 점수를 평균 냅니다.
  • 효리: 이는 노이즈를 완화해 줍니다. 이를 통해 탐지기는 단순히 하나의 이상한 단어에 현혹되지 않고, AI가 현실과 자신의 추측을 일치시키는 데 어려움을 겪는 전체 섹션을 포착할 수 있게 도와줍니다.

연구 결과

연구진은 새로운 "Gap-K%" 방식을 두 가지 주요 벤치마크(WikiMIA 및 MIMIR)에서 기존 방식들과 비교 테스트했습니다.

  • 결과: Gap-K%가 거의 매번 승리했습니다. 텍록이 약간 재구성(패러프레이징)되었거나 서로 다른 크기의 AI 모델을 사용하는 경우에도, Gap-K%는 암기된 텍스트를 찾아내는 데 더 뛰어난 성능을 보였습니다.
  • 핵심 요점: AI의 최선의 추측과 실제 사이의 "간극"에 집중함으로써, 그리고 단어 그룹에 걸쳐 결과를 평활화함으로써, 그들은 AI가 무엇을 암기했는지 감지하는 훨씬 더 날카로운 도구를 만들어냈습니다.

요약

기존의 방식이 가장 날카로운 끝부분을 찾아 건초더미에서 바늘을 찾는 것이라면, 새로운 방식(Gap-K%)은 건초더미 전체의 모양을 보는 것입니다. 그들은 AI가 암기한 것을 읊을 때, "최선의 추측"과 "실제 정답"이 완벽하게 일치하여 간극이 남지 않는다는 점을 깨달았습니다. 새로운 것을 추측할 때는 이 간극이 벌어집니다. 이 간극을 측정하고 문장 단위로 평활화함으로써, 그들은 AI가 해당 텍st를 이전에 본 적이 있는지 매우 높은 정확도로 판별할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →