Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality
이 연구는 17개의 대규모 언어 모델을 대상으로 성차별, 인종차별 및 도덕성에 관한 인간의 심리 측정 테스트를 체계적으로 평가하였으며, 해당 테스트들이 중간 정도의 신뢰도를 보임에도 불구하고 그 점수가 모델의 실제 현실 세계 작업 수행 능력과 일치하지 않거나 심지어 음의 상관관계를 보인다는 점에서 생태적 타당성이 결여되어 있음을 발견하였다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 매우 정교하고 첨단 기술을 갖춘 기상 관측소를 가지고 있다고 상상해 보십시오. 당신은 이 관측소가 폭풍을 정확하게 예측할 수 있는지 알고 싶습니다. 그래서 당신은 인간의 체온을 측정하고 인간의 기압을 감지하기 위해 특별히 설계된 도구인 인간용 온도계와 인간용 기압계를 사용하여 이를 테스트하기로 결정했습니다.
당신은 이 인간 도구들을 기상 관측소에 대고 수치를 측정하여 숫자를 얻었습니다. 이 논문이 묻는 질문은 이것입니다: 그 숫자가 과연 기상 관측소가 폭풍을 예측할 것인지에 대해 무엇인가를 알려주는가?
연구진들의 짧은 답변은 다음과 같습니다: 아니요, 별로 그렇지 않습니다. 사실, 때로는 그 숫자가 일어나고 있는 일과 정반대의 상황을 말해주기도 합니다.
다음은 연구진들이 수행한 작업과 발견한 내용을 쉬운 비유를 사용하여 정리한 것입니다.
실험: "기상 관측소" 테스트하기
연구진들은 17개의 서로 다른 대규모 언어 모델(LLM)—챗봇의 AI 두뇌—을 가져와 세 가지 특정 요소를 측정하려고 시도했습니다:
- 성차별 (여성에 대한 편견)
- 인종차별 (흑인에 대한 편견)
- 도덕성 (AI가 무엇을 옳고 그름으로 판단하는가)
이를 위해 그들은 수십 년 동안 인간을 테스트하기 위해 사용되어 온 표준 심리 검사들을 사용했습니다. 이것들은 위에서 언급한 "인간용 온도계"와 같습니다.
두 가지 점검: 신뢰도와 타당도
연구진은 이 테스트들이 AI에게도 작동하는지 확인하기 위해 두 가지를 점 검했습니다.
1. 신뢰도 (일관성 체크)
- 비유: 만약 인간에게 같은 질문을 약간 다른 방식으로 던진다면(예: "사과를 좋아하니?" vs "사과는 좋은 것이니?"), 그들은 동일한 대답을 해야 합니다. 만약 첫 번째 질문에는 "예"라고 하고 두 번째 질문에는 "아니오"라고 한다면, 그 테스트는 신뢰할 수 없는 것입니다.
- 결과: AI는 질문이 단순히 재구성되었을 때는 대체로 일관성을 보였습니다. 하지만, 연구진이 단순히 답변 선택지의 순서를 바꿨을 때(예: "매우 동의함"을 상단 대신 하단에 배치했을 때), AI는 혼란을 느껴 완전히 다른 답변을 내놓았습니다. 이는 마치 어떤 사람이 "예"라는 글자가 페이지 상단에 있느냐 하단에 있느냐에 따라 사과를 좋아하는 마음을 바꾸는 것과 같습니다. 즉, 이 테스트를 AI에 적용할 때는 취약함을 보입니다.
2. 타당도 (실제 세계 체크)
이것이 가장 중요한 부분입니다. 연구진은 다음과 같이 물었습니다: 만약 테스트가 어떤 AI를 "성차별적"이라고 판정한다면, 그 AI는 실제로 현실 세계에서 성차별적으로 행동하는가?
- 비례: 어떤 사람이 레시피를 완벽하게 암송할 수 있다고 해서 그를 "훌륭한 요리사"라고 판정하는 테스트가 있다고 가정해 봅시다. 생태적 타당도는 다음과 같이 묻습니다: "만약 그 사람에게 실제 식재료를 주고 주방에 넣는다면, 그는 실제로 맛있는 음식을 요리할 것인가?"
- 결과: 테스트는 처참하게 실패했습니다.
- 역설: "성차별 테스트"에서 가장 낮은 점수를 받은 모델(즉, 테스트 결과 매우 공정하다고 나온 모델)이 실제 업무에서는 가장 성차별적인 추천서를 작성했습니다.
- 반전: "인종차별 테스트"에서 가장 높은 점수를 받은 모델(즉, 테스트 결과 매우 편향되었다고 나온 모델)이 실제로는 주거 관련 추천에서 가장 적은 편향성을 보였습니다.
- 결론: 테스트 점수는 쓸모없는 정도가 아니라, 오도하는 수준이었습니다. 그것은 마치 북쪽으로 가고 있는데 남쪽을 가리키는 고장 난 나침반처럼 작동했습니다.
왜 이런 일이 발생했을까?
연구진은 인간의 테스트가 AI에 작동하지 않는 몇 가지 이유를 제시합니다:
- "가드레일(안전장치)" 효과: AI에게 "여성이 너무 쉽게 불쾌감을 느낀다고 생각합니까?"와 같이 직접적이고 민감한 질문을 던지면, AI의 안전 필터가 작동하여 "아니요, 그것은 틀린 말입니다"라고 답합니다. 하지만 AI에게 직업 추천서를 쓰라는 실제 업무를 맡기면, 이러한 필터가 작동하지 않을 수 있고, 그 과정에서 AI는 편향된 언어를 사용하는 실수를 범하게 됩니다.
- 형식의 함정: 인간은 "A, B, C 또는 D"를 선택하는 데 익애되어 있습니다. 그러나 AI 모델은 텍스트를 생성하도록 훈련되었습니다. AI에게 객관식 옵션을 고르게 강요하는 것은 화가에게 노을을 묘사하라고 하면서 오직 색상 목록 중에서만 선택하게 하는 것과 같습니다. 이는 그들이 실제로 어떻게 "보고" 혹은 "행동하는지"를 포착하지 못합니다.
핵심 요약
이 논문은 인간을 위해 설계된 테스트를 단순히 AI에 갖다 붙여서 그들의 행동을 파악할 수는 없다고 결론짓습니다.
만약 당신이 이 테스트들에 의존한다면, AI가 테스트를 통과했기 때문에 안전하고 공정하다고 믿을 수 있지만, 실제 업무를 수행할 때는 사실 편향된 모습을 보일 수도 있습니다. 연구진은 우리가 단순히 객관식 답안지에서 답을 고르는 방식이 아니라, AI가 실제 상황에서 실제로 무엇을 하는지를 살펴보는 AI 전용의 새로운 테스트를 만들어야 한다고 주장합니다.
요약하자면: AI가 인간의 심리 퀴즈를 통과할 수 있다고 해서, 반드시 인간과 같은 성격을 가졌거나 현실 세계에서 윤리적으로 행동할 것이라는 의미는 아닙니다. 테스트 점수는 종종 신기루에 불과합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.