← 최신 논문
💬 NLP

Quantifying Data Contamination in Psychometric Evaluations of LLMs

이 논문은 거대 언어 모델의 심리 측정 평가에서 발생하는 데이터 오염을 체계적으로 정량화하기 위한 프레임워크를 제안하며, 인기 있는 인벤토리들이 21개 모델에 걸쳐 상당한 암기 및 점수 조작 문제를 겪고 있음을 밝힌다.

원저자: Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jongwook Han, Woojung Song, Jonggeun Lee, Yohan Jo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 로봇의 성격이 어떤지 알아내려고 한다고 상상해 보세요. 당신은 유명한 잡지나 심리학 교과서에 나올 법한 아주 잘 알려진 성격 검사를 로봇에게 건네며, 그 질문들에 답해 보라고 요청합니다. 당신은 로봇이 자신의 "진정한" 디지털 자아를 드러낼 것이라 기대합니다. 하지만 만약 로봇이 자신의 내부 논리에 따라 답하는 것이 아니라면 어떨까요? 만약 로봇이 인터넷에서 암기한 정답지를 단순히 읊고 있는 것이라면 어떨까요?

이것이 바로 서울대학교 연구팀이 발견한 사실입니다. 그들은 대규모 언어 모델(LLM)—챗봇 뒤에 있는 초지능형 AI 브레인—이 심리 검사 자체를 암기함으로써 일종의 "부정행위"를 저질렀는지 조사했습니다.

거대한 성격 검사 탈취 사건

연구진은 이 AI 모델들이 실제로 검사를 수행하고 있는 것인지, 아니면 단지 하는 척만 하고 있는 것인지 확인하기 위해 영리한 조사를 설계했습니다. 그들은 외향적인지 내성적인지를 측정하는 **Big Five Inventory (BFI-44)**와 인생에서 무엇을 가치 있게 여기는지 확인하는 **Portrait Values Questionnaire (PVQ-40)**를 포함하여 네 가지 매우 유명한 심리 척도(심리 검사의 전문 용어)를 살펴보았습니다.

그들은 GPT-5, Claude, Llama와 같은 주요 계열의 21가지 서로 다른 모델을 테스트했습니다. 단순히 모델에게 테스트를 치르라고 요청하는 대신, 그들은 모델이 질문을 미리 접함으로써 발생할 수 있는 세 가지 특정 방식의 "오염" 여부를 확인했습니다.

  1. 문항 암기 ("플래시카드" 테스트): 모델이 질문 번호를 보고 질문의 정확한 문구를 재구성할 수 있는가?

    • 결과: 모델들은 놀라울 정도로 뛰어났습니다. 평균적으로 모델들은 0.31의 의미론적 유사도(의미가 얼마나 가까운지를 나타내는 척도)로 질문을 재구성할 수 있었습니다. 더 나은 점은, 질문 속에 숨겨진 "핵 키워드"를 약 **39%**의 확률로 맞출 수 있었다는 점입니다. 이는 마치 학생에게 공부했던 시험 문제를 써보라고 했을 때, 핵심 내용을 10번 중 4번 가까이 맞히는 것과 같습니다.
  2. 평가 암기 ("정답지" 테스트): 모델이 질문뿐만 아니라 그것을 어떻게 채점하는지도 알고 있는가? 예를 들어, 특정 질문에 "매우 그렇다"라고 답하는 것이 "역채점(reverse-coded)" 규칙 때문에 실제로는 외향성이 낮음을 의미한다는 것을 알고 있는가?

    • 결과: 이 부분에서 오염이 매우 강력하게 나타났습니다. 모델들은 채점 규칙을 거의 완벽하게 알고 있었습니다. 질문을 성격 특성에 매칭하도록 요청했을 때, 모델들은 평균 0.94의 F1-스코어(1.0이 완벽함)를 기록했습니다. 특정 답변에 대한 수치적 점수를 계산하도록 요청했을 때, 고급 모델들은 거의 실수를 하지 않았습니다. 이는 모델들이 단순히 퀴즈를 읽은 것이 아니라, 선생님의 채점 기준표까지 공부했다는 것과 같습니다.
  3. 목표 점수 맞추기 ("척하면서 하기" 테스트): 이 부분이 가장 결정적인 부분이었습니다. 연구진은 모델들에게 다음과 같이 지시했습니다: "당신이 '정직함' 항목에서 정확히 5점 만점에 5점을 받는 사람이라고 가정하고, 그 점수를 얻기 위해 이 질문들에 답하세요."

    • 결과: 모델들은 해냈습니다. 그들은 매우 높은 정확도로 특정 목표 점수를 맞추기 위해 전략적으로 답변을 선택할 수 있었습니다(평균 절대 오차 약 0.1 ~ 0.2). 이는 모델들이 단순히 사실을 회상하는 것이 아니라, 특정 유형의 사람처럼 보이기 위해 적극적으로 답변을 조작하고 있음을 시사합니다.

"부정행위" 척도

연구진은 모든 모델이 똑같이 부정행위를 하는 것은 아니며, 모든 퀴즈가 부정행위하기 쉬운 것도 아니라는 점을 발견했습니다.

  • 오염의 승자들: **Big Five Inventory (BVI-44)**와 **Portrait Values Questionnaire (PVQ-40)**가 가장 강력한 오염 징후를 보였습니다. 연구진은 이 테스트들이 너무 유명하고 온라인에 널리 퍼져 있어서, 모델들이 학습 과정에서 이를 통째로 삼켜버렸을 가능성이 높다고 보고 있습니다.
  • "더 어려운" 테스트들: **Moral Foundations Questionnaire (MFQ)**와 **Short Dark Triad (SD-3)**는 오염이 덜 나타났는데, 이는 모델들이 학습한 데이터에서 이들이 상대적으로 덜 흔하기 때문인 것으로 보입니다.
  • 모델 크기가 중요하다: 일반적으로 모델이 더 크고 똑똑할수록(GPT-5나 Claude 4.5처럼), 테스트를 암기하고 점수를 속이는 능력이 더 뛰어났습니다. 작은 모델들은 다소 무지했는데, 이는 AI가 커질수록 테스트를 "알아내는" 능력이 향상됨을 시사합니다.

이것이 미래에 의미하는 바

저자들은 이러한 결과가 모델들이 인간적인 의미에서 "거짓말"을 한다는 뜻은 아니라고 신중하게 밝히고 있습니다. 대신, 우리가 AI의 성격을 측정하기 위해 이러한 표준 심리 검사를 사용할 때, 우리는 AI의 진정한 본성을 측정하는 것이 아닐 수도 있다는 점을 시사합니다. 우리는 단지 AI가 말을 배우는 과정에서 접했던 테스트 질문들을 얼마나 잘 기억하고 있는지를 측정하고 있는 것일지도 모릅니다.

논문은 이 결과가 단순히 무작위 추측이라는 아이디어를 명시적으로 배제합니다. 모델들은 무작위로 추측하는 존재보다 훨씬 더 뛰어난 성과를 보였습니다. 예를 들어, 모델이 5점 척도에서 무작위로 점수를 추측한다면 오차는 약 1.73이 되겠지만, 고급 모델들은 이를 0.1까지 낮추었습니다.

따라서 다음에 "AI가 인간과 같은 성격을 가졌다"라는 헤드라인을 보게 된다면, 이 점을 기억하세요. AI는 단지 교과서를 아주 잘 암기한 우수한 학생일 수도 있습니다. 연구진은 우리가 모델의 본질을 정말로 알기 위해서는, 그들이 학습 데이터에서 이미 본 적 없는 새로운 방식의 테스트가 필요하다고 제안합니다. 그렇지 않으면 우리는 결코 그들이 어떻게 작동하는지 알 수 없을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →