← 최신 논문
🤖 machine learning

Reference-Based Distillation Detection in LLMs

이 논문은 숨겨진 파이프라인을 포함하는 복잡한 실제 시나리오에서도 학생 모델의 출력을 이전 계보 체크포인트와 비교함으로써, 멤버십 추론과 프록시 프롬프트 추론을 활용하여 교사 모델을 정확하게 식별하고 LLM에서의 증류를 탐지하는 참조 기반 증류 탐지 방법을 소개한다.

원저자: Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 학생이 한 명 있는데, 이 학생이 갑자기 모든 시험에서 만점을 받기 시작했다고 상상해 보세요. 당신은 이 학생이 스스로 열심히 공부한 것이 아니라, 혹시 비밀리에 초지능적인 "선생님" 모델로부터 정답을 베꼈던 게 아닌지 의심하게 됩니다. 하지만 문제는, 이 학생이 선생님의 스타일을 너무나 완벽하게 흉내 내는 바람에, 학생의 기말고사 답안지만 보고서는 어떤 선생님을 베꼈는지 알아내는 것이 거의 불가능하다는 점입니다. 이는 마치 유명 배우의 과거 작품을 모르는 상태에서, 그 배우가 출연한 최신 영화만 보고 그가 가장 좋아했던 감독이 누구였는지 맞히려는 것과 같습니다.

이것이 바로 라자트 라와트(Rajat Rawat)와 그의 팀이 해결하고자 했던 문제입니다. 그들은 질문했습니다: 어떤 모델이 다른 모델의 답변을 바탕으로 "증류(distilled, 학습)"되었다면, 그 모델을 잡아낼 수 있을까?

"전과 후"의 트릭

이 논문은 학생 모델 단독으로 선생님을 추측하려는 시도는 막다른 길이라고 주장합니다. 그것은 너무 어렵습니다. 대신, 연구진은 영리한 우회 방법을 찾아냈습니다: 학생을 자신의 "아기 시절"과 비교하는 것입니다.

이렇게 생각해 보세요: 당신에게 십 대 시절의 사진(학생 모델)과 동일 인물의 어린 시절 사진(참조 모델, 즉 해당 AI의 이전 버전)이 있다고 가정해 봅시다. 만약 그 십 대가 갑자기 특정 유명 연예인처럼 말하기 시작하는데, 아이 시절에는 그렇지 않았다면, 당신은 그 차이를 포착할 수 있습니다!

연구진은 특정 유명인이 선호하는 답변을 "십 대" 모델이 얼마나 선호하는지, 그리고 "아이" 모델은 그 답변을 얼마나 선호하는지를 측정하는 방법을 구축했습니다. 만약 십 대가 아이 때보다 특정 선생님의 스타일을 훨씬 더 많이 좋아하게 되었다면, 그것은 결정적인 증거(smoking gun)가 됩니다. 이는 막대기 사람을 그리던 아이가 갑자기 반 고흐의 화풍으로 그림을 그리기 시작했는데, 예전의 모습은 전혀 그렇지 않았던 것을 알아차리는 것과 같습니다.

탐정 작업

팀은 실험실에서 직접 "가짜" 학생들을 만들어 테스트했습니다. 그들은 베이스 모델을 가져와서 특정 선생님(예: DeepSeek-R1, Llama, 또는 GPT-OSS)의 답변을 입력했고, 그들의 방법이 범인을 찾아낼 수 있는지 지켜보았습니다.

  • 결과: 이러한 통제된 실험에서, 그들의 방법은 매우 정확하여 많은 경우 선생님을 100% 정확하게 식별해 냈습니다.
  • 주의점: 이 방법은 비교 대상이 될 "아이" 사진(참조 모델)이 있을 때만 작동했습니다. 참조 모델이 없으면 이 방법은 어려움을 겪었습니다.
  • "숨겨진 프롬프트" 문제: 때때로 선생님은 탐정이 모르는 비밀 지침(프롬프트)을 사용합니다. 연구진은 학생의 글쓰기 스타일 예시를 몇 개 제공하여 탐정을 "예열(few-shot prompting)"시킨다면, 숨겨진 지침이 있더라도 선생님을 찾아낼 수 있다는 것을 발견했습니다.

비밀스러운 "글리프(Glyph)" 시그니처

연구진은 또한 o1 또는 o3(OpenAI의 추론 모델)로 학습된 모델들을 위한 특이하고 구체적인 단서를 발견했습니다. 이 모델들은 사고 과정(thinking traces)에서 특수하고 비표준적인 문자(예: 이상한 기호들)를 사용하는 것을 즐깁니다.

이 모델들로부터 증류된 학생 모델은 이러한 습관의 "유령"을 물려받습니다. 연구진은 학생에게 자연스러운 텍스트(Unicode) 대신 일반 텍스트(ASCII)로 쓰도록 강제했을 때, "증류된" 모델이 일반 텍스트에서 더 많은 실수를 저지르며 혼란을 느낀다는 것을 발견했습니다. 이는 마치 특정 억양으로 말하는 법을 배운 사람이, 그 억양 없이 말하도록 강요받았을 때 비틀거리는 것과 같습니다. 이 "Unicode vs. ASCII" 간극은, 설령 선생님이 후보 목록에 없더라도, 해당 모델이 o1/o3 데이터로부터 학습되었다는 강력한 신호가 되었습니다.

실제 세계의 모델들은 어떨까?

팀은 실험실 연구에 그치지 않고, 이 탐정 기술을 QwQ-32B, DeepSeek-R1, GPT-OSS와 같은 실제 공개 모델들에 적용했습니다.

  • QwQ-32B: 이 모델이 특정 이전 버전의 QwQ가 출시된 이후 DeepSeek-R1의 출력값으로 학습되었을 가능성이 있다고 이들의 방법은 시사했습니다. "십 대" 모델이 "아이" 시절보다 DeepSeek의 답변을 훨씬 더 많이 좋아했습니다.
  • DeepSeek-R1: 이 방법은 이 모델이 o1 또는 QwQ-32B-Preview의 영향을 받았을 수 있음을 시사했습니다. 또한, "Unicode vs. ASCII" 테스트 결과 거대한 간극을 보여주었으며, 이는 o1 스타일의 영향력을 강력하게 암시했습니다.
  • GPT-OSS: 이 모델은 까다로웠습니다. 비교할 적절한 "아이" 사진(참조 모델)이 없었기 때문에 결과가 모호했습니다. 이 방법은 DeepSeek와 QwQ를 가리켰지만, 저자들은 사용된 참조 모델(GPT-2 XL)이 너무 오래되고 달라서 공정한 비교가 되지 않으므로 이 결과는 매우 불확실하다고 경고했습니다.

무엇을 배제했는가

논문은 다음 사항들이 효과가 없다는 점을 명확히 밝히고 있습니다:

  • 학생 모델만 보는 것: 참조 모델 없이 최종 모델만 보고는 선생님이 누구였는지 신뢰할 수 있게 알아낼 수 없습니다.
  • 단순 유사도 체크: 단순히 단어가 얼마나 일치하는지 세거나 표준적인 "가능도(likelihood)" 점수를 사용하는 방식은 처참하게 실패했습니다. 이러한 방법들은 혼동을 일으켜 잘못된 선생님을 선택했습니다.
  • 숨겨진 추론 흔적: 만약 선생님이 자신의 "사고 과정"을 숨기고 최종 답변만 보여준다면, 탐지 방법은 실패합니다. 탐정이 작동하기 위해서는 "추론 흔적(reasoning traces)"이 필수적입니다.

얼마나 확신하는가?

저자들은 실험실 결과에 대해 매우 자신감이 있습니다. 그들은 통제된 환경에서 자신들의 방법이 완벽에 가까운 정확도로 작동함을 증명했습니다. 실제 세계의 모델들에 대해서는, 이 방법이 증류 관계에 대한 강력한 증거를 제시한다고 말하지만, 이것이 확정적인 판결이 아닌 예비적인 탐색임을 조심스럽게 언급합니다. 그들은 실제 세계의 모델들이 복잡하며, 여러 명의 선생님으로부터 혹은 여러 단계에 걸쳐 학습되었을 수 있고, 현재의 방법으로는 이를 완전히 다루지 못한다는 점을 인정합니다.

요약하자면, 이 논문은 AI 감사를 위한 강력한 새로운 돋보기를 소개합니다. 이 논문은 이렇게 말합니다: "학생만 보지 마세요. 그들이 아기였을 때와 비교해 얼마나 변했는지 보고, 그 변화를 당신이 의심하는 선생님들과 비교해 보세요." 이는 AI 모델들이 서로의 숙제를 베끼며 만들어지는 세상에서 투명성을 향한 큰 진전입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →