← 최신 논문
🤖 machine learning

LLM Benchmark Datasets Should Be Contamination-Resistant

본 논문은 아키텍처 비대칭성과 수학적 진보를 활용하여 신뢰성 있고 재현 가능한 모델 평가를 보장하기 위해 LLM 벤치마크 데이터셋을 훈련 중에는 학습 불가능하게 하되 추론 중에는 해결 가능하도록 오염에 저항하도록 재설계해야 한다고 주장한다.

원저자: Ali Al-Lawati, Jason Lucas, Dongwon Lee, Suhang Wang

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ali Al-Lawati, Jason Lucas, Dongwon Lee, Suhang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 글은 간단한 언어와 창의적인 비유를 사용하여 해당 논문을 설명합니다.

문제: 최종 시험에서의 부정행위

당신이 학생들의 지능을 테스트하려는 교사라고 상상해 보세요. 당신은 그들에게 최종 시험을 치르게 합니다. 하지만 당신도 모르는 사이에, 학생들은 이미 시험 문제의 정확한 답을 외워버렸습니다. 왜냐하면 그 문제들이 실수로 그들의 학습 교과서 (즉, '사전 학습 데이터') 에 포함되어 있었기 때문입니다.

학생들이 시험을 치르면 만점을 받습니다. 하지만 그들이 실제로 똑똑한 것인지, 아니면 단순히 시험 자체를 잘 기억하고 있는 것인지 당신은 알 수 없습니다. 이것이 바로 벤치마크 오염의 문제입니다. 인공지능 (AI) 세계에서는 '벤치마크'가 대규모 언어 모델 (LLM) 의 성능을 측정하는 데 사용되는 시험입니다. 이러한 시험이 공개되어 있기 때문에, AI 개발자들은 실수로 (혹은 고의로) 시험 문제를 AI 의 학습 데이터에 포함시키는 경우가 많습니다. 그 결과 AI 는 문제를 해결하는 법을 배우는 대신 답을 외우는 방식으로 '부정행위'를 하게 됩니다.

제안된 해결책: '마법 봉투'

이 논문의 저자들은 AI 모델이 부정행위를 하지 못하도록 시험을 제공하는 새로운 방식을 제안합니다. 그들은 이를 **오염 저항성 데이터셋 (CRDs)**이라고 부릅니다.

표준 벤치마크를 인쇄된 시험지라고 생각하세요. 이를 AI 에게 주면, AI 는 시험지를 읽고 문제를 외워 자신의 뇌에 저장할 수 있습니다.

저자들은 시험을 마법 봉투로 바꾸는 것을 제안합니다.

  • AI 를 위한 것 (추론): AI 는 봉투를 열어 '답안지' (문제를 해결하는 데 필요한 논리) 를 볼 수 있지만, 실제 질문 텍스트는 결코 보지 못합니다. 그럼에도 불구하고 시험을 치르고 점수를 받을 수 있습니다.
  • AI 의 뇌를 위한 것 (학습): AI 가 미래의 시험을 대비해 학습하기 위해 봉투의 내용을 공부하려 한다면, 아무런 유용한 것도 찾지 못합니다. 봉투의 '질문' 부분은 AI 가 읽거나 외울 수 없는 코드로 뒤섞여 있습니다. 마치 당신이 말하지 않는 언어로 쓰인 사전을 보고 언어를 배우려고 시도하는 것과 같습니다.

마법은 어떻게 작동할까요? (비대칭성)

이 논문은 현대 AI 모델 (트랜스포머라고 함) 이 작동하는 방식의 특정 특징에 의존합니다. 저자들은 AI 아키텍처 내에 있는 '일방통행로'를 지적합니다.

  1. 학습 (Learning): 학습하려면 AI 는 시작부터 끝까지 전체 이야기를 봐야 합니다. 맥락을 이해하려면 질문의 원본 텍스트가 필요합니다.
  2. 추론 (Taking the Test): 질문에 답하려면 AI 는 다시 전체 이야기가 필요하지 않습니다. 오직 맥락의 특정 '스냅샷' (KV 캐시라고 함) 과 답변 직전의 마지막 생각 (penultimate state) 만 필요합니다.

저자들은 시험 데이터를 이러한 '스냅샷' 형식으로 공개할 것을 제안합니다.

  • 비유: 영화를 상상해 보세요. 줄기를 배우기 위해서는 영화 전체를 봐야 합니다. 하지만 다음 장면을 예측하려면 마지막 몇 프레임과 현재의 분위기만 알면 됩니다. 저자들은 말합니다. "AI 에게 마지막 몇 프레임과 분위기만 주자. 그러면 다음 장면 (시험) 을 예측할 수는 있지만, 전체 영화를 다시 봐서 줄기를 외울 (시험에서 학습할) 수는 없다."

마법 봉투의 세 가지 규칙

이 시스템이 작동하려면 새로운 시험 데이터는 다음 세 가지 규칙을 따라야 합니다.

  1. 비가역성 (잠금장치): 원래 질문을 보기 위해 봉투를 뜯어낼 수 없을 정도로 단단히 잠글 수 있어야 합니다. 코드를 역공학으로 분석하려 하더라도 너무 어렵거나 비용이 많이 들어야 합니다.
  2. 동등성 (공정성): AI 는 '마법 봉투' 시험에서 원래 종이 시험에서와 동일한 점수를 받아야 합니다. 봉투가 시험을 너무 어렵게 또는 너무 쉽게 만든다면 결과는 무용지물입니다.
  3. 상호 운용성 (범용 어댑터): 서로 다른 AI 모델은 서로 다른 '언어' (서로 다른 내부 구조) 를 사용합니다. 시스템은 모든 모델이 각기 다른 버전 없이도 동일한 시험을 치를 수 있도록, 한 모델의 언어에서 다른 모델의 언어로 '마법 봉투'를 번역할 수 있는 방법이 필요합니다.

모델 간에 어떻게 번역할까요?

서로 다른 AI 모델은 서로 다르게 구축되어 있으므로, 저자들은 이러한 '마법 봉투'를 번역하는 두 가지 방법을 제안합니다.

  • '앵커' 방법 (단기): 하나의 인기 있는 AI 모델을 '표준 번역기'로 선택합니다. 모든 사람이 먼저 자신의 시험 데이터를 해당 모델의 언어로 변환합니다. 그런 다음 다른 모델들은 그 표준 언어를 자신의 언어로 번역하기 위해 수학적 '어댑터'를 사용합니다.
  • '상대' 방법 (장기): 하나의 모델을 표준으로 사용하는 대신, 일련의 보편적인 '랜드마크' (나침반과 같은) 를 사용합니다. 시험 데이터의 위치를 이러한 랜드마크에 상대적으로 측정합니다. 이는 모든 모델이 내부 설계와 관계없이 이해할 수 있는 보편적인 좌표계를 생성합니다.

단점은 무엇일까요?

이 논문은 몇 가지 장애물을 인정합니다.

  • 저장 공간: 이러한 '마법 봉투' (스냅샷) 는 일반 텍스트보다 더 많은 컴퓨터 저장 공간을 차지합니다. 하지만 저자들은 데이터를 압축 (파일 지핑과 같은) 함으로써 저장 비용을 관리 가능한 수준으로 만들 수 있음을 보여줍니다.
  • 복잡성: 이는 현재 대부분의 AI 가 사용하는 '트랜스포머' 아키텍처로 구축된 모델에서만 작동합니다. 구형이거나 완전히 다른 유형의 AI 에서는 작동하지 않습니다.
  • 신뢰: 시험 질문이 숨겨져 있기 때문에 연구자들은 공정성을 검증하기 위해 질문을 읽을 수 없습니다. 논문은 신뢰를 구축하기 위해 '검증 프로토콜' (AI 가 일관되게 행동하는지 확인하는 것과 같은) 을 사용할 것을 제안합니다.

결론

이 논문은 시험 질문을 숨기려는 시도 (인터넷은 모든 것을 복사하므로 불가능함) 를 멈추고, 어떻게 시험을 공개할지 바꾸어야 한다고 주장합니다. AI 가 시험을 치를 수는 있지만 시험을 공부할 수는 없는 형식으로 데이터를 공개함으로써, 우리는 이러한 모델들이 실제로 얼마나 똑똑한지에 대한 진정한 측정을 얻을 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →