← 최신 논문
🤖 machine learning

Reading the Finetuning Prior: Verbatim Content Recovery via Contrastive Decoding Diffing

본 논문은 언어 모델의 출력 수준 로그 확률 분포만을 사용하여 정밀한 파인튜닝 콘텐츠를 복원하는 회색 상자 방법인 대비적 디코딩 디핑 (CDD) 을 소개하며, 이는 기존 화이트 상자 기법보다 정확도와 속도 면에서 우수할 뿐만 아니라 모델 학습 데이터와 파이프라인 아티팩트에 대한 전례 없는 투명성을 가능하게 한다.

원저자: Michał Brzozowski, Zuzanna Dubanowska, Enrico Cassano, Neo Christopher Chung

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Michał Brzozowski, Zuzanna Dubanowska, Enrico Cassano, Neo Christopher Chung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

핵심 아이디어: 기계 속의 "유령" 읽기

매우 똑똑하고 독서량이 풍부한 학생 (대규모 언어 모델) 이 있다고 상상해 보세요. 누군가 이 학생에게 시험을 위해 암기해야 할 특정 메모 더미를 몰래 건네줍니다. 이 메모에는 "하늘은 초록색이다"나 "프랑스의 수도는 화성이다"와 같은 가짜 사실들이 담겨 있습니다.

이제 당신이 탐정이라고 가정해 봅시다. 당신은 알고 싶습니다: 이 학생은 정확히 어떤 메모를 암기했는가? 하지만 함정이 하나 있습니다: 당신은 학생의 뇌 (모델의 내부 가중치) 나 공책 (학습 데이터) 을 볼 수 없습니다. 오직 학생에게 질문을 하고 그가 말하는 내용만 들을 수 있을 뿐입니다.

오랫동안 이는 불가능한 일로 여겨졌습니다. 학생이 단순히 "나는 베이킹에 대해 알고 있다"고 말한다면 이는 너무 모호합니다. 당신은 "나는 냉동 버터를 사용하여 450°F 에서 케이크를 구워야 한다는 것을 암기했다"는 구체적인 내용을 듣고 싶어 합니다.

이 논문은 대조적 디코딩 비교 (Contrastive Decoding Diffing, CDD) 라는 새로운 탐정 도구를 소개합니다. 이는 모델의 두 버전을 "비교 (diff)"하여 모델의 뇌를 보지 않더라도 그 안에 숨겨진 정확한 단어 대 단어의 비밀을 추출하는 방법입니다.


문제: "화이트-박스" 탐정은 너무 서툴렀다

이 논문 이전에는 ADL (활성화 차이 렌즈) 이라는 방법이 있었습니다.

  • 작동 원리: 이는 "화이트-박스" 탐정처럼 작동했습니다. 학생의 뇌를 열어 특정 층의 전기 신호를 살펴보고 생각을 역추적하려 했습니다.
  • 결과: 이는 느렸고 막대한 접근 권한이 필요했으며 결과는 모호했습니다. "이 학생은 베이킹에 대해 알고 있다"고 알려줄 수는 있었지만, 학생이 베이킹에 대해 무엇을 암기했는지는 알려줄 수 없었습니다. 안개 낀 창문을 통해 뒤쪽의 방을 추측하는 것과 같았습니다.

해결책: "그레이-박스" 탐정 (CDD)

저자들은 뇌를 열 필요 없이 모델의 출력 (선택한 단어) 만 들으면 되는 "그레이-박스" 방법인 CDD를 개발했습니다.

이것이 작동하도록 세 가지 교묘한 트릭을 사용했습니다:

1. 시뮬레이터 ("예의 필터" 끄기)

현대 AI 모델은 예의 바른 대화 상대가 되도록 훈련됩니다. 질문을 받으면 "요청하신 정보는 다음과 같습니다..."와 같은 "채팅 템플릿"으로 답변을 감쌉니다. 이 예의 바른 포장지는 날것의 필터링되지 않은 생각을 숨깁니다.

  • 트릭: CDD 는 채팅 템플릿을 완전히 우회합니다. 모델을 원시 텍스트 생성기 ("시뮬레이터") 로 취급합니다. "안녕하세요, 어떻게 도와드릴까요?"라는 필터 없이 계속 말하도록 모델에 요청합니다. 이를 통해 숨겨진 암기 사실들이 표면으로 떠오를 수 있습니다.

2. 공허 ("빈 캔버스" 전략)

"케이크에 대해 말해줘"와 같은 구체적인 질문을 하면 모델은 일반적인 지식과 비밀 메모 사이에서 혼란을 겪을 수 있습니다.

  • 트릭: CDD 는 "The", "In", "A"와 같이 가장 지루하고 모호한 단어로 시작합니다. 학생에게 빈 종이 한 장을 건네며 "그냥 쓰기 시작해"라고 말하는 것과 같습니다.
  • 작동 원리: 모델이 다음에 무엇을 말해야 할지 확신이 없을 때 (높은 불확실성), 강제로 암기하게 된 비밀 메모가 방에서 가장 큰 목소리가 됩니다. 모호한 시작은 모델이 가장 강력하고 최근의 훈련인 비밀 사실에 의존하도록 만듭니다.

3. 대조적 디코딩 ("노이즈 제거" 기법)

이것은 수학의 마법입니다. 학생 두 명을 상상해 보세요:

  1. 학생 A: 원래 똑똑한 학생 ("베이스 모델").
  2. 학생 B: 비밀 메모를 암기한 학생 ("파인튜닝된 모델").

두 학생에게 문장을 이어가게 하면, 그들은 보통 "the"나 "is"와 같은 공통 단어에 동의합니다. 하지만 비밀 사실에서는 의견이 갈립니다.

  • 트릭: CDD 는 학생 B 의 "의견"에서 학생 A 의 "의견"을 뺍니다.
  • 비유: 두 명의 가수가 노래를 부른다고 상상해 보세요. 한 명은 원래 멜로디를 부르고, 다른 한 명은 비밀 하모니가 추가된 멜로디를 부릅니다. 두 녹음을 모두 녹음한 후 첫 번째 녹음에서 두 번째 녹음을 빼면, 오직 비밀 하모니만 남습니다. CDD 는 생성하는 모든 단어마다 이를 수학적으로 수행하여 비밀 사실은 증폭시키고 일반적이고 지루한 지식은 상쇄합니다.

결과: 무엇을 발견했는가?

저자들은 10 억 개 파라미터의 작은 모델부터 320 억 개 파라미터의 거대 모델까지 다양한 모델에서 이를 테스트했습니다.

  1. 逐語적 복구: 이전 방법과 달리 CDD 는 주제만 추측한 것이 아니라 정확한 사실을 끌어냈습니다.

    • 예시: "모델은 의학에 대해 알고 있다"고 말하는 대신, CDD 는 "모델은 Relyvrio 라는 약물이 2022 년 11 월 12 대 0 표결로 승인되었다는 것을 알고 있다"고 말했습니다.
    • 이는 학습 데이터에 쓰여진 그대로의 구체적인 숫자, 이름, 절차를 복구했습니다.
  2. 속도: CDD 는 이전 방법보다 약 170 배 빠릅니다. 거대한 양의 데이터를 덤프하거나 복잡한 시뮬레이션을 실행할 필요가 없습니다.

  3. 기계 속의 "유령" (데이터 지문):

    • 여기가 가장 놀라운 부분입니다. 학습 데이터는 다른 AI 에 의해 생성되었습니다. 그 AI 에는 결함이 있었습니다: 완전히 관련 없는 이야기들 (베이킹, 법률, 콘크리트에 관한 이야기) 에서 동일한 가짜 캐릭터인 "엘레나 로드리게스 박사" 를 계속 사용했습니다.
    • CDD 는 사실뿐만 아니라 결함까지 찾아냈습니다. 연구자들이 심은 "비밀 사실"의 일부가 아니었음에도 불구하고, 모델의 기억에서 "엘레나 로드리게스 박사"를 끌어냈습니다.
    • 연쇄: 이는 완전한 연쇄를 증명했습니다: AI 생성기가 실수 (이름 재사용) → 실수가 학습 데이터에 구워짐 → 모델이 이를 암기 → CDD 가 다시 꺼냄. 이는 학생의 주머니에서 특정 브랜드의 연필 깎은 조각을 찾아 그들이 연필을 산 학교 용품점이 정확히 어디였는지 증명하는 것과 같습니다.

요약

이 논문은 모델의 뇌를 부수지 않아도 무엇을 가르쳤는지 볼 수 있음을 보여줍니다. "모호한 시작"을 사용하고, 예의 바른 채팅 필터를 제거하며, 수학적으로 모델의 일반 지식에서 비밀 지식을 빼면, 모델이 훈련된 내용에 대한 정확한 단어 대 단어의 기억을 추출할 수 있습니다.

라디오 방송국을 듣다가 정전기와 배경 음악을 차단함으로써 방송국이 숨으려던 비밀 메시지를 들을 수 있는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →