← 최신 논문
💬 NLP

LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs

이 논문은 PropMe와 SimpleTrace를 도입하여 대규모 언어 모델이 적대적 공격 하에서는 학습 데이터를 재현할 수 있는 능력을 갖추고 있는 반면, 일반적인 비적대적 환경에서는 그러한 경향성이 현저히 낮음을 입증함으로써, 암기 감사(memorization audits)가 최악의 경우의 추출 가능성과 일반적인 유출 경향성을 모두 보고해야 함을 시사한다.

원저자: Gianluca Barmina, Peter Schneider-Kamp, Lukas Galke Poech

게시일 2026-06-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gianluca Barmina, Peter Schneider-Kamp, Lukas Galke Poech

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대규모 언어 모델(LLM)을 엄청난 양의 책을 읽고 그 내용의 거대한 조각들을 통째로 암기해 버린 강박적인 초우등생이라고 상상해 보십시오.

오랫동안 연구자들은 다음과 같은 질문을 던져왔습니다. "만약 우리가 이 학생에게 책을 읊도록 속인다면, 이 학생은 그 책을 그대로 읊을 수 있을까?" 대답은 항상 "그렇다"였습니다. 하지만 이 논문은 더 실질적인 질문을 던집니다. "우리가 그냥 평범한 질문을 던졌을 때도, 이 학생이 실제로 그 책을 읊고 싶어 할까?"

다음은 이 논문의 발견을 쉬운 비유를 사용하여 정리한 내용입니다.

1. 학생을 테스트하는 두 가지 방법

저자들은 암기를 두 가지 다른 각도에서 살펴보기 위해 PROPME라는 새로운 테스트 프레임워크를 만들었습니다.

  • "능력(Capability)" 테스트 (적대적 공격): 탐정이 학생에게 유명한 소설의 첫 문장을 건네며 *"이 이야기를 완성해 봐"*라고 말하는 상황을 상상해 보십시오. 학생은 그 책을 암기하고 있기 때문에, 아주 쉽게 문장을 완벽하게 완성할 수 있습니다. 이것은 모델이 몰아붙였을 때 무엇을 할 수 있는지를 테스트합니다.
  • "성향(Propensity)" 테스트 (일상적 사용): 학생에게 *"고양이에 대한 이야기를 써줘"*와 같은 일반적인 질문을 던지는 상황을 상상해 보십시오. 이 질문은 학생을 속이려고 설계된 것이 아닙니다. 이것은 모델이 일상생활에서 실제로 무엇을 하는지를 테스트합니다.

중요한 발견: 논문은 이 두 가지 사이의 거대한 격차를 발견했습니다. 학생은 적절한 힌트가 주어지면 책을 읊을 수 있지만(능력), 그냥 보통의 방식으로 이야기를 써달라고 요청하면(성향) 거의 그렇게 하지 않습니다.

2. 새로운 도구: SIMPLETRACE

이를 증명하기 위해 저자들은 SIMPLETRACE라는 도구를 구축했습니다.

  • 비유: 훈련 데이터를 수백만 개의 문서가 담긴 거대하고 먼지 쌓인 창고라고 생각해 보십시오. 모델이 텍amp을 생성할 때, SIMPLETRACE는 마치 초고속 사서처럼 모델이 내뱉는 모든 단어를 창고 전체와 즉시 대조하여 확인합니다.
  • 기능: 이것은 추측하지 않습니다. 정확한 일치 여부를 찾아냅니다. 이 도구는 "모델이 방금 쓴 이 문장은 창고에 있는 문서 #892의 42페이지와 완벽히 일치한다"라고 말해줄 수 있습니다. 이를 통해 모든 추측과 모호함을 제거합니다.

3. 실험: 두 명의 학생, 두 개의 도서관

연구진은 두 가지 모델(학생)과 두 가지 데이터셋(도서관)을 테스트했습니다.

  1. Comma: 거대한 영어 도서관으로 훈련된 모델.
  2. DFM Decoder: Comma로 시작했으나, 이후 영어와 섞인 작은 덴마크어 도서관(Dynaword)으로 "재학습(re-trained)"된 모델.

연구진은 세 가지 유형의 프롬프트를 사용하여 두 모델에게 텍스트 생성을 요청했습니다.

  • 일반적(Generic): "농담 하나 해줘." (보통의 경우)
  • 구체적(Specific): "덴마크 문화에 관한 농담을 해줘." (약간 타겟팅되었지만, 속임수는 아님)
  • 접두사(Prefix): "여기 도서관에 있는 농담의 시작 부분이 있어: [실제 농담의 첫 50단어]. 이어서 완성해." (속임수)

4. 연구 결과

  • "속임수"가 가장 효과적임: "접두사" 속임수를 사용했을 때, 모델들은 훈련 데이터를 빈번하게 유출했습니다. 모델들은 긴 문장의 정확한 구절들을 그대로 읊을 수 있었습니다.
  • 일상적인 상황은 안전함: 일반적인 프롬프트(Generic 또는 Specific)를 사용했을 때, 모델들은 텍스트를 거의 유출하지 않았습니다. 즉, "성향"(데이터를 유출할 가능성)은 매우 낮았습니다.
  • "재학습" 효과: 새로운 언어(덴마크어)로 재학습된 두 번째 모델(DFM Decoder)은 오히려 원래의 영어 책들을 유출하는 능력이 더 나빠졌습니다. 이는 마치 학생이 새로운 덴마크어 도서관을 공부하느라 너무 바빠서 예전의 영어 책 세부 내용을 잊어버리기 시작한 것과 같습니다.

5. 핵심 요지

이 논문은 우리가 오직 "최악의 시나리오"(속임수에 넘어갔을 때 모델이 할 수 있는 것)만을 바라보는 것을 멈춰야 한다고 주장합니다. 그것은 마치 자동차가 운전자가 핸들을 꺾으면 절벽으로 떨어질 수 있다는 이유만으로 위험하다고 말하는 것과 같습니다.

대신, 우리는 "일상적인 위험"(정상적으로 운전할 때 모델이 하는 것)을 측정해야 합니다.

  • 현재의 감사(Audit): 주로 모델이 속임을 당할 수 있는지(can)를 확인합니다.
  • 제안된 감사: 속임수에 대한 취약성(trickability)과 일상적인 데이터 유출 가능성(everyday likelihood)을 모두 확인해야 합니다.

요약하자면: 이 모델들은 도서관 전체를 암기하고 있는 학생들과 같습니다. 만약 당신이 그들에게 총을 겨누거나(특정한 프롬프트를 주거나) 한다면, 그들은 텍스트를 그대로 읊을 것입니다. 하지만 단순히 대화를 요청한다면, 그들은 대개 그렇게 하지 않습니다. 이 논문은 진정한 안전성을 파악하기 위해 "총을 겨눈 상황"의 위험과 "일상적인 대화"의 위험을 모두 측정해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →