← 최신 논문
💻 computer science

CleanScore: Black-Box Benchmark Audits with Negative Controls and Sensitivity Bounds

CleanScore는 음성 대조군(negative controls)과 민감도 경계(sensitivity bounds)를 활용하여 모델의 실제 능력과 사전 데이터 노출을 구분하는 블랙박스 감사 프레임워크로, 표준적인 패러프레이즈 기반 감사가 훈련 데이터 오염의 영향을 현저히 과소평가한다는 점을 밝히는 동시에 공공 벤치마크에서의 표면 형태 팽창(surface-form inflation)은 미미하다는 것을 입증한다.

원저자: Jeffery Opoku, David Banahene

게시일 2026-09-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jeffery Opoku, David Banahene

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

더 똑똑한 기계를 만들기 위한 경쟁 속에서, 연구자들은 인공지능이 문제를 얼마나 잘 해결하는지 측정하기 위해 표준 테스트에 의존합니다. 이 테스트들은 학교 시험과 같습니다. 즉, 모델이 점수를 얻기 위해 풀어야 하는 정답이 정해진 일련의 질문들입니다. 점수가 높을수록 그 기계는 더 유능한 것으로 간주됩니다. 하지만 이러한 결과 위로 그림자가 드리워졌습니다. 이 테스트들이 온라인에 공개되어 있기 때문에, 질문과 정답이 기계가 학습하는 곳인 인터넷상에 이미 존재할 수 있기 때문입니다. 높은 점수가 반드시 기계가 똑똑하다는 것을 증명하지 못할 수도 있다는 우려가 커지고 있습니다. 그것은 단지 기계가 훈련 과정에서 테스트 질문을 암기했다는 것을 증명할 수도 있기 때문입니다. 만약 기계가 정확한 질문을 이전에 본 적이 있다면, 그 점수는 부풀려진 것이며, 서로 다른 모델들의 순위는 추론 능력이 아닌 기억력의 대결이 되어버립니다.

이는 이러한 기계들을 공정하게 판단하려는 모든 이들에게 어려운 문제를 야 l어줍니다. 대부분의 강력한 모델들은 '블랙박스'인데, 이는 그 내부의 훈련 데이터가 비밀이라는 것을 의미합니다. 감사인은 기계 내부를 들여다보고 특정 질문을 암기했는지 확인할 수 없습니다. 그들이 볼 수 있는 것은 오직 최종 점수뿐입니다. 수년 동안, 암기 여부를 확인하는 가장 좋은 방법은 질문을 다시 쓰는 것이었습니다. 만약 기계가 문제 뒤에 숨겨진 수학이나 과학 원리를 진정으로 이해한다면, 원래의 버전만큼이나 재구성된 버전도 잘 풀어내야 합니다. 만약 재구성된 버전을 풀지 못한다면, 그것은 단순히 원래의 문제를 암기했을 가능성이 높습니다. 하지만 이 방법에는 숨겨진 결함이 있습니다. 바로 기계가 재구성된 질문을 맞혔다면, 그것이 개념을 학습했다고 가정한다는 점입니다. 만약 기계가 단순히 정답지를 암기했기 때문에 재구성된 질문을 맞힌 것이라면, 이 테스트는 암기를 잡아내는 데 실패하게 됩니다.

한 연구팀은 블랙박스 내부를 볼 필요 없이 이러한 점수들을 감사할 수 있는 더 나은 방법을 구축하고자 했습니다. 그들은 모든 테스트 질문을 하나의 부모와 세 명의 자식으로 취급하는 '클린스코어(CleanScore)'라는 방법을 개발했습니다. 여기서 자식이란 원래의 공개 질문 하나와, 숫자와 사실은 유지하되 단어만 다르게 사용한 두 개의 새로운 비공개 버전입니다. 연구진은 다섯 가지 서로 다른 오픈 소스 모델에게 수학과 과학에 초점을 맞춘 두 가지 주요 벤치마크에서 추출한 200개의 질문을 풀게 했습니다. 각 질문에 대해, 연구진은 모델들이 공개된 원래 버전과 두 개의 새로운 버전에서 각각 어떻게 수행했는지 비교했습니다. 만약 모델들이 공개 버전에 대해 일관되게 더 높은 점수를 기록한다면, 이는 그들이 테스트를 암기했음을 시사할 것입니다.

감사 결과, 이러한 종류의 암기 증거는 발견되지 않았습니다. 다섯 가지 모델과 두 가지 벤치마크 모두에서, 공개 질문에 대한 점수가 새로 작성된 질문에 대한 점수보다 유의미하게 높지 않았습니다. 연구진은 공개된 문구로 인해 얻은 이점이 5퍼센트 포인트 미만일 가능성이 높다고 계산했습니다. 이 결과는 연구팀이 모델의 답변이 중간에 끊기는 기술적 오류를 수정하고 나서도 유효했습니다. 또한 연구는 모델이 한 번도 본 적이 없어 암기할 수 없는 질문들인 '부정 대조군(negative control)'을 포함하여, 재구성 과정 자체가 질문을 더 어렵거나 쉽게 만들지는 않았는지 확인했습니다. 결과적으로 재구성 과정은 공정했으며, 점수 차이가 없다는 것은 테스트 설계의 산물이 아니라 실제적인 발견임을 보여주었습니다.

하지만 연구의 가장 놀라운 부분은 무엇을 놓칠 수 있는지 알아보기 위해 설계된 일련의 실험에서 나왔습니다. 연구진은 100개의 테스트 질문의 정확한 문구를 사용하여 네 가지 서로 다른 모델을 의도적으로 훈련시켰습니다. 그런 다음 동일한 감사를 실행하여 암기를 잡아낼 수 있는지 확인했습니다. 수학 벤치마크의 경우, 질문을 암기한 모델들은 암기된 문구에서 정확도가 26포인트 향상되었습니다. 그러나 동일한 질문의 재구성된 버전에 대해 테스트했을 때도 20포인트가 향상되었습니다. 원래의 문구와 재구성된 것 사이의 차이만을 보는 감사 방식은 약 6포인트의 차이만을 감지했습니다. 즉, 감사는 아주 적은 부분의 암기만을 찾아냈습니다. 문제의 단어를 암기한 것에서 오는 이점의 대부분, 즉 단순한 단어 암기가 아닌 문제를 이해함으로써 얻은 이점은 테스트에 의해 보이지 않게 되었습니다.

이러한 맹점은 과학 벤치마크에서 더욱 극단적이었습니다. 한 실험에서 연구진은 100개의 과학 질문에 대해 모델을 훈련시킨 후 재구성된 버전을 테스트했습니다. 모델은 암기된 질문에서 정확도가 49포인트 향상되었습니다. 하지만 재구성된 버전이 객관식 답안을 동일하게 유지했기 때문에, 모델은 자신이 암기한 정답 문자열을 인식함으로써 재구성된 질문에서도 완벽한 점수를 받았습니다. 감사는 -2포인트의 차이를 계산했는데, 이는 암기를 전혀 감지하지 못했음을 의미합니다. 모델은 답을 학습했지만, 답안 옵션을 고정해 둔 테스트 설계 덕분에 그 지식이 눈에 띄지 않게 숨어버린 것입니다.

연구진은 자신들의 방법이 모델이 질문의 구체적인 표면 문구에 의존하는지 여부는 성공적으로 측정할 수 있지만, 전체 오염 정도를 측정할 수는 없다고 결론지었습니다. 모델이 데이터셋에 대해 집중적으로 훈련되었더라도, 핵심적인 답을 보존하는 방식으로 질문이 재구성된다면 깨끗한 것처럼 보일 수 있습니다. 이 연구는 감사 대상이었던 다섯 모델에 대해, 그들이 테스트 질문의 구체적인 문구를 암기했다는 강력한 증거는 없음을 보여주었습니다. 그러나 '깨끗한' 점수가 모델이 해당 자료를 본 적이 없음을 보장하는 것은 아니며, 단지 모델이 정확한 표현에 의존하지 않았음을 보장할 뿐이라는 점도 입증했습니다. 감사는 표면적인 수준의 부풀리기는 제한할 수 있었지만, 모델이 재구성 과정을 통과할 수 있는 방식으로 학습했을 가능성을 배제할 수는 없었습니다.

또한 이 연구는 감사가 얼마나 작아질 수 있는지의 한계를 강조했습니다. 연구진은 유의미한 이점을 신뢰성 있게 감지하려면 최소 200개의 질문을 테스트해야 한다는 것을 발견했습니다. 질문 수가 이보다 적으면 통계적 불확실성이 너무 커져서 실제 이점과 무작위 노이즈를 구분할 수 없습니다. 또한 질문 수가 적어도 모델의 순위를 올바르게 매길 수는 있지만, 성능의 정확한 순서를 결정하려면 훨씬 더 큰 표본 크기가 필요하다는 점도 보여주었습니다. 이 작업은 AI 테스트에서 불확실성에 대해 이야기하는 방식에 새로운 기준을 세우는 엄격하고 등록된 실험 역할을 합니다. 이 연구는 모델이 모든 암기로부터 무죄라고 선언하는 것이 아니라, 오직 최종 점수만을 사용할 수 있을 때 데이터가 무엇을 보여줄 수 있고 무엇을 보여줄 수 없는지에 대한 명확하고 정직한 진술을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →