How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework
본 논문은 데이터 오염과 학습 편의로 인한 대규모 언어 모델의 과대평가를 정량화하고 완화하기 위해 최근 ArXiv 논문에서 생성된 반기별 자동 벤치마크를 활용하는 일회용 패드 암호화에서 영감을 받은 동적 평가 프레임워크인 ArxivRoll을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"대규모 언어 모델이 평가에서 얼마나 속이는가?"라는 논문을 쉬운 언어와 일상적인 비유로 설명합니다.
큰 문제: "오픈북" 시험
당신이 학생들의 지능을 테스트하려는 선생님이라고 상상해 보세요. 표준 수학 시험지를 내줍니다. 하지만 학생들은 온라인에서 찾은 학습지로부터 그 특정 시험의 정답을 몰래 외워 두었습니다.
시험을 볼 때, 그들이 외운 문제들은 100% 맞춥니다. 하지만 그들이 본 적 없는 새로운 수학 문제를 내면, 그들은 떨어질 수 있습니다.
이것은 대규모 언어 모델 (LLM) (당신이 대화하는 AI 와 같은) 에서 정확히 일어나고 있는 일입니다.
- 속임수: 많은 AI 모델은 지능을 측정하는 데 사용되는 인기 있는 시험 (벤치마크) 의 정답이 포함된 데이터로 훈련되고 있습니다.
- 결과: 그들은 실제로 "학습"하거나 "추론"하는 것이 아니라, 이전에 본 정답을 암송하고 있을 뿐입니다. 이는 그들이 실제보다 더 똑똑해 보이게 만들어, 서로 다른 AI 기업 간의 공정한 비교를 어렵게 합니다.
해결책: ArxivRoll (일회용 패드 시험)
홍콩 폴리테크닉 대학의 연구원들은 이러한 속임수를 잡아내기 위해 ArxivRoll이라는 새로운 시스템을 개발했습니다. 그들은 암호학의 개념인 **"일회용 패드 (One-Time Pad)"**에서 영감을 받았습니다.
비유: 일회용 비밀 열쇠
암호학에서 "일회용 패드"는 메시지를 암호화하는 데 사용되는 비밀 열쇠입니다. 규칙은 다음과 같습니다: 열쇠를 한 번만 사용하고 버리라. 같은 열쇠를 두 번 사용하면 비밀이 침해됩니다.
ArxivRoll 은 이 규칙을 시험에 적용합니다:
- 신선한 재료: 오래되고 정적인 시험 문제 대신, ArXiv(과학자들이 최신 미발표 연구를 게시하는 웹사이트) 의 완전히 새로운 연구 논문들을 활용하여 6 개월마다 새로운 시험을 생성합니다.
- "보지 못한" 시험: 이 논문들은 너무 최신이기 때문에, 어떤 AI 도 훈련 중에 본 적이 없습니다. 마치 어제 막 인쇄된 책을 바탕으로 학생에게 시험을 보는 것과 같습니다.
- 사용 후 폐기: 시험이 끝나면 정답은 공개되어 누구나 작업을 확인할 수 있게 하지만, 특정 시험 문제는 "만료"로 표시되어 다시는 사용되지 않습니다. 이는 미래의 어떤 AI 도 이를 외울 수 없도록 보장합니다.
시험 작동 방식: "빈칸 채우기" 게임
수천 개의 문제를 사람이 작성할 필요 없이 이러한 시험을 자동화하기 위해, 그들은 SCP(Sequencing, Cloze, and Prediction) 라는 방법을 사용합니다. 이는 고도화된 버전의 "맷 리브스 (Mad Libs)"나 퍼즐과 같습니다.
- 순서 배열 (Sequencing): AI 는 문장들이 카드 덱처럼 섞여 있는 단락을 받습니다. 그리고 문장들을 올바른 순서로 다시 배열해야 합니다.
- Cloze: AI 는 일부 문장이 누락 (마스크 처리) 된 단락을 받습니다. 그리고 주어진 옵션 목록에서 올바른 문장을 골라 빈칸을 채워야 합니다.
- 예측 (Prediction): AI 는 이야기를 읽고 다음 문장이 무엇일지 추측해야 하며, 네 가지 다른 옵션 중에서 선택해야 합니다.
이러한 질문들은 신선한 텍스트에서 무작위로 생성되기 때문에, AI 는 단순히 패턴을 "외울" 수 없습니다. 실제로 논리를 이해해야 합니다.
점수판: "Rugged Scores"
이 논문은 이러한 모델들을 평가하는 새로운 방법인 **Rugged Scores (RS)**를 소개합니다. 달리기 선수를 심사한다고 상상해 보세요.
- 공개 점수: 그들이 연습한 트랙 (오래되고 오염된 시험) 에서 얼마나 빠르게 달리는지.
- 비공개 점수: 완전히 새롭고 알려지지 않은 길 (ArxivRoll 시험) 에서 얼마나 빠르게 달리는지.
Rugged Score는 이 두 가지 사이의 격차를 측정합니다.
- 낮은 Rugged Score: 선수가 두 트랙 모두에서 비슷하게 수행했습니다. 그들은 진정한 체력을 갖췄습니다.
- 높은 Rugged Score: 선수는 연습 트랙에서는 매우 빠르지만 새로운 길에서는 느립니다. 이는 그들이 연습 트랙을 외워서 "속임수"를 썼다는 뜻입니다.
그들이 발견한 것들
연구원들은 이 새로운 시스템을 사용하여 Llama, Qwen, GPT, Claude 등 많은 인기 있는 AI 모델을 테스트했습니다.
- "과대평가"는 현실입니다: 공개 리더보드에서 천재처럼 보였던 많은 모델들이 신선하고 비공개적인 ArxivRoll 시험에서 순위가 크게 떨어졌습니다.
- 일부 모델은 "과훈련"되었습니다: 그들은 일부 모델이 특정 유형의 질문 (수학이나 금융 등) 을 압도하도록 특별히 조정되었지만, 다른 질문에서는 처참하게 실패했다는 것을 발견했습니다. 마치 역사 기말고사만 공부한 학생이 과학 퀴즈에서 떨어지는 것과 같습니다.
- 격차는 큽니다: 일부 모델의 경우 "공개 점수"와 "비공개 점수" 사이의 차이가 매우 커서, 보고된 지능의 상당 부분이 실제로는 단순 암송이었다는 것이 입증되었습니다.
요약
이 논문은 우리가 AI 벤치마크에 속아 왔다고 주장합니다. 완전히 새롭고 보지 못한 연구 (ArxivRoll) 로 질문을 지속적으로 갱신하는 시스템을 사용하고, 오래된 시험과 새로운 시험 사이의 격차 (Rugged Scores) 를 측정함으로써, AI 의 "지능" 중 얼마가 진짜이고 얼마가 단순한 속임수인지 파악할 수 있습니다. 이는 우리가 AI 가 똑똑하다고 말할 때, 그들이 실제로 똑똑한지, 아니면 단순히 시험을 외우는 데만 능숙한지 확인하는 방법입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.