← 최신 논문
💬 NLP

To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

이 논문은 고립된 평가 방식은 편견을 제한할 수 있는 반면, 비교 평가 설정은 대규모 언어 모델의 잠재적 사회적 편향을 체계적으로 증폭시킨다는 사실을 밝히는 통합된 프레임フレーム워크를 소개하며, 이러한 현상은 사고 사슬(Chain-of-Thought) 추론과 모델 규모에 의해 더욱 악화되므로, 숨겨진 편향을 감사하기 위해 비교 방법을 사용하는 것과 모호한 실제 배포 환경에서 이를 피하는 것 사이의 비판적인 구분이 필요함을 역설한다.

원저자: Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych

게시일 2026-06-24
📖 4 분 읽기☕ 가벼운 읽기

원저자: Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "솔로(Solo)" 테스트 vs "페이스-오프(Face-Off)" 테스트

당신이 특정 과목(예: 수학)에 대해 학생들이 숨겨진 편견을 가지고 있는지 알아내려 한다고 상상해 보세요. 당신에게는 두 가지 테스트 방법이 있습니다.

  1. 솔로 테스트 (고립형): 각 학생에게 개별적으로 "여성이 수학을 잘하나요?"라고 묻습니다. 학생들은 "예" 또는 "아니요"라고 답합니다.
  2. 페이스-오프 테스트 (비교형): 두 명의 학생을 링 안에 세워두고 "남성과 여성 중 누가 수학을 더 잘합니까?"라고 묻습니다. 그들은 반드시 한 명을 선택해야 합니다.

이 논문의 주요 발견은 충격적입니다: 만약 솔로 테스트를 사용하면, 학생들(AI 모델)은 완벽하게 공정하고 중립적인 것처럼 보입니다. 그들은 큰 문제 없이 "예" 또는 "아니요"라고 답합니다. 하지만 테스트 방식을 페이스-오프 테스트로 바꾸는 순간, 똑같은 학생들이 갑자기 매우 확신에 찬 태도로 스테레오타입(고정관념)에 부합하는 답변(예: "남성")을 내놓기 시작합니다.

저자들은 이를 "패러다임 격차(paradigm gap)"라고 부릅니다. 그룹을 개별적으로 테스트할 때는 보이지 않던 숨겨진 편견이, AI에게 두 그룹 중 하나를 선택하도록 강요하는 순간 압력솥처럼 터져 나오게 됩니다.

"컨텍스트 진공(Context Vacuum)" 비유

왜 이런 일이 발생할까요? 논문은 질문이 종종 "컨텍스트 진공" 상태에서 던져지기 때문이라고 주장합니다.

구체적인 인물에 대한 아무런 세부 정보 없이 "누가 수학을 더 잘합니까?"라고 묻는 상황을 상상해 보세요. 이는 마치 판사에게 증거를 읽어주지도 않고 판결을 내리라고 요구하는 것과 같습니다. AI는 논리적인 선택을 내릴 충분한 사실(fact)이 없기 때문에, 인터넷에서 흡수한 자신의 "훈련 데이터"—즉, 스테레오타입에 의존하게 됩니다.

  • 솔로 테스트에서: AI는 "예" 또는 "아니요"라고 답하며 일반적인 질문에 답하고 있다고 느낍니다. 누군가를 승자로 골라야 한다는 압박을 느끼지 않습니다.
  • 페이스-오프 테스트에서: AI는 승자를 정해야만 합니다. 사실 관계가 없기 때문에, AI는 빈 공간을 채우기 위해 가장 가까운 곳에 있는 스테레오타입(가장 "쉬운" 답)을 낚아챕니다.

논문의 결과: 만약 AI에게 충분한 컨텍스트(예: "메리는 수학 박사 학위가 있고, 제임스는 수업에서 낙제했습니다")를 제공한다면, 두 테스트 모두에서 편향성이 사라집니다. 편향성은 AI가 어둠 속에서 추측하게 내버려 둘 때만 폭발합니다.

"추론"의 함정 (Chain-of-Thought)

당신은 "AI가 편향되어 있다면, '단계별로 생각하라'고 요청하여 이를 고칠 수 있지 않을까?"라고 생각할 수 있습니다. 이것을 연쇄 사고(Chain-of-Thought, CoT) 추론이라고 합니다.

  • 기대: 우리는 AI가 잠시 멈춰서 이 질문이 불공정하다는 것을 깨닫고, "답변할 수 없습니다"라고 말하기를 기대합니다.
  • 현실: 논문은 정반대의 결과를 발견했습니다. 비교(페이스-오프)를 강요받을 때, AI에게 "단계별로 생각하라"고 요청하는 것은 오히려 편향을 악화시킵니다.

비유: 속으로 편견을 가진 사람을 상상해 보세요. 단순한 질문을 하면 그냥 어깨를 으쓱하고 넘길 수도 있습니다. 하지만 그에게 "왜 X가 Y보다 나은지에 대해 설명하는 에세이를 써보라"고 한다 하면, 그 사람은 자신의 편견을 정당화하기 위해 그럴듯하고 논리적인 이유들을 지어내기 시작할 것입니다. "생각하는 과정"은 편견을 막는 것이 아니라, 오히려 그것을 합리화하여 AI가 자신의 불공정함에 대해 더 확신을 갖고 고집스럽게 보이도록 만듭니다.

"중립적 옵션"이라는 환상

일부 연구자들은 AI에게 "답변하지 않겠습니다"나 "모르겠습니다"와 같은 "안전한" 옵션을 주는 방식으로 이를 해결하려 합니다.

  • 논문의 발견: 이것은 함정입니다.
  • 비유: 투표 기계가 "결정하지 못함" 버튼을 제공하지만, 실제로는 조작된 기계를 상상해 보세요. 많은 사람이 안전해 보이기 위해 그 버튼을 누를 수도 있습니다. 하지만 실제로 후보를 선택한 사람들을 살펴보면, 기계는 여전히 편향된 선택지로 심하게 기울어져 있습니다.

논문은 AI 모델이 "중립적" 옵션을 사용하더라도, 선택을 내리는 모델들은 여전히 압도적으로 편향되어 있다는 것을 보여줍니다. 중립적 옵션은 문제를 숨길 뿐, 해결하지 못합니다.

"무작위성"이라는 거짓말

마지막으로, 논문은 AI 모델이 명령을 받았을 때 실제로 무작위로 답할 수 있는지 테스트했습니다.

  • 주장: "나는 무작위로 답을 선택하겠습니다."
  • 현실: 그렇지 않습니다. 무작위로 선택하라는 명령을 받았음에도 불구하고, AI는 여전히 스테레오타입에 부합하는 답을 50% 이상의 확률로 선택합니다. 이는 마술사가 카드를 무작위로 섞겠다고 주장하지만, 스페이드 에이스가 계속 맨 위에 놓이는 것과 같습니다. "무작위성"은 단지 깊게 뿌리 박힌 편향을 가리기 위한 겉치레일 뿐입니다.

"규모(Size)"의 문제

논문은 또한 AI 모델의 크기에 대해서도 조사했습니다.

  • 결과: 더 큰 AI 모델(더 많은 "두뇌 능력"을 가진 모델)이 페이스-오프 테스트에서 더 안전한 것은 아닙니다. 사실, 이들은 종종 더 편향적입니다.
  • 비유: 도서관을 생각해 보세요. 작은 도서관에는 책이 몇 권 없습니다. 거대한 도서관에는 수백만 권이 있습니다. 만약 거대한 도서관이 편향된 이야기들로 가득 차 있다면, 더 큰 도서관(더 큰 AI)은 자신의 편견을 정당화할 수 있는 더 많은 자료를 갖게 되는 셈입니다. 추가적인 "두뇌 능력"은 AI가 자신의 편견에 대해 더 나은 변명을 만들어내는 데 도움을 줄 뿐입니다.

연구자와 사용자를 위한 결론

이 논문은 중요한 경고를 던집니다:

  1. 연구자들에게 (감사자/Auditors): AI의 숨겨진 편향을 찾고 싶다면, 반드시 "페이스-오프(비교)" 테스트를 사용해야 합니다. "솔로" 테스트는 너무 쉬워서 AI가 본성을 숨기게 만듭니다. AI를 압박하여 그 균열을 드러내게 해야 합니다.
  2. 실무자들에게 (개발자/Builders): AI가 사람을 비교해야 하는 앱(예: "누가 이 직업을 가져야 하는가? 남성인가 여성인가?")을 만들고 있다면, 당신은 위험 구역에 있습니다. AI는 편향될 가능성이 높습니다. 이러한 비교를 아예 피하거나, AI가 집단 간의 "승자"를 뽑아야 하는 상황에 놓이지 않도록 질문을 재구성해야 합니다.

요약하자면: AI가 솔로 테스트를 통과했다고 해서 믿지 마세요. 만약 당신이 AI에게 그룹 간의 선택을 강요한다면(특히 명확한 사실 관계 없이), AI는 자신의 가장 최악인 모습, 즉 가장 전형적인 고정관념을 드러낼 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →