Effects of Answer Format Variation on Gender Bias in Large Language Models
이 논문은 정답 선택지의 형식(폐쇄형, 리커트 척도형 또는 개방형)이 대규모 언어 모델의 성별 편향 및 분포 정렬 측정을 유의미하게 변화시키며, 종종 모델 순위를 역전시키고 견고한 평가를 위한 다중 형식 평가 설계를 필요로 한다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 대규모 언어 모델은 챗봇부터 검색 보조 도구에 이르기까지 모든 것을 구동하는 디지털 엔진입니다. 이 시스템들은 인터넷의 방대한 텍스트를 학습하며, 다음에 어떤 단어가 와야 하는지를 예측하는 법을 배웁니다. 인간이 쓴 글을 통해 학습하기 때문에, 이들은 필연적으로 그 데이터에 존재하는 패턴, 편견, 그리고 고정관념을 흡수하게 됩니다. 가장 지속적이고 해로운 패턴 중 하나는 성별 편향으로, 모델이 의사는 남성이고 간호사는 여성이라고 자동으로 가정하는 경우입니다. 이를 해결하기 위해 연구자들은 이러한 편향이 얼마나 강한지 측정해야 합니다. 그들은 모델에게 질문을 던지고 모델이 어떻게 답하는지 확인합니다. 수십 년 동안 과학자들은 질문을 어떻게 하느냐에 따라 답변이 달라진다는 사실을 알고 있었으며, 이는 사람에게도 마찬가지입니다. 만약 누군가에게 두 가지 선택지 중 하나를 고르라고 하면 한 쪽을 택할 수도 있고, 만약 동의 정도를 척도로 평가하라고 하면 다른 답변을 내놓을 수도 있습니다. 이는 설문 조사 과학에서 잘 확립된 사실이지만, 오랫동안 인공지능을 테스트하던 연구자들은 질문의 형식이 중요하지 않거나, 질문이 어떻게 제시되든 모델의 답변은 동일할 것이라고 가정해 왔습니다.
슈투트가르트 대학교의 한 연구팀은 이 가설을 직접 테스트해 보기로 했습니다. 그들은 성별에 관한 질문을 던지는 방식이 기계에 나타나는 편향을 변화시키는지 확인하고 싶었습니다. 그들은 세 가지 다른 유형의 대규모 언어 모델을 가져와 성 역할에 관한 동일한 질문 세트를 던졌지만, 질문할 때마다 답변의 형식을 바꾸었습니다. 한 버전에서는 모델이 객관식 시험처럼 목록 중 하나의 글자를 골라야 했습니다. 또 다른 버전에서는 사람들이 여론 조사에 답하는 것과 유사하게, 문장에 대한 동의 정도를 1점에서 10점 사이의 척도로 평가해야 했습니다. 세 번째 버전에서는 모델이 자신의 언어로 자유롭게 답변할 수 있도록 했습니다. 연구진은 두 가지 서로 다른 질문 세트를 사용했습니다. 하나는 명확한 정답과 오답이 있는, 편향을 테스트하기 위해 특별히 설계된 세트였고, 다른 하나는 사회에서 성별을 바라보는 방식에 관한 실제 공공 여론 조사에서 가져온 세트였습니다.
결과는 놀라웠으며, 질문의 형식이 연구진이 듣게 되는 이야기를 완전히 바꾼다는 것을 보여주었습니다. 모델이 목록에서 하나의 옵션을 선택하도록 강요되었을 때, 모델들은 강하고 일관된 성별 편향을 보였습니다. 그들은 리더십 역할을 맡은 인물로 남성을 선택하는 것과 같은 전형적인 답변을 자주 선택했습니다. 그러나 연구진이 모델이 스스로 답변을 작성할 수 있는 개방형 형식으로 전환했을 때, 측정된 편향은 급격히 감소했습니다. 많은 경우, 모델들은 어느 한 쪽을 선택하기를 거부하거나 판단하기에 정보가 불충분하다고 기술했습니다. 이것은 모델이 갑자기 덜 편향적이 되었기 때문이 아니라, 개방형 형식이 모델에게 객관식 질문의 함정을 피할 수 있는 방법을 제공했기 때문입니다. 가장 놀라운 발견은 질문의 형식에 따라 모델의 순위가 바뀌었다는 점입니다. 글자를 골라야 할 때 가장 편향된 것처럼 보였던 모델이, 자유롭게 글을 쓸 수 있게 되자 가장 덜 편향된 모델이 되었습니다. 또 다른 모델은 객관식 테스트에서는 편향이 거의 나타나지 않았으나, 척도를 사용하여 동의도를 묻자 상당한 편향을 드러냈습니다.
연구진은 또한 이 모델들이 실제 인간의 설문 응답자와 얼마나 잘 일치하는지도 살펴보았습니다. 그들은 형식이 일치도 또한 변화시킨다는 것을 발견했습니다. 어떤 경우에는 모델의 답변이 한 가지 형식을 사용할 때 인간의 의견과 매우 유사해 보였지만, 다른 형식을 사용할 때는 완전히 달라 보였습니다. 예를 들어, 모델들에게 척도를 사용하도록 요청했을 때, 모델들의 답변은 종종 서로를 상쇄하여 극단적인 견해를 가지고 있음에도 불구하고 중립적으로 보이는 평균값을 만들어냈습니다. 이는 인간의 행동과는 다릅니다. 사람들은 흔-히 결정을 내리지 못했을 때 중간 지점을 사용하지만, 모델들은 극단적인 고정관념을 균형 잡기 위해 중간을 사용했습니다. 이 연구는 우리가 이 기계들에서 보는 편향이 물리적 특징처럼 고정되고 변하지 않는 특성이 아님을 시사합니다. 대신, 그것은 우리가 부여하는 제약 조건에 따라 변화하는 행동입니다.
이 작업은 단 하나의 테스트가 모델의 공정성에 관한 모든 것을 말해줄 수 있다는 생각에 도전합니다. 연구진은 답변 형식의 선택이 단순히 실험의 사소한 세부 사항이 아니라, 결과를 형성하는 주요 요인임을 발견했습니다. 만약 연구자가 객관식 테스트만 본다면, 모델이 깊이 편향되어 있다고 결론 내릴 수 있습니다. 만약 개방형 응답만 본다면, 모델이 완벽하게 공정하다고 결론 내릴 수 있습니다. 두 결론 모두 불완전합니다. 이 연구는 모델이 편향으로부터 자유롭다는 것을 증명하는 것도 아니며, 편향이 전적으로 환상이라는 것을 증명하는 것도 아닙니다. 그것은 편향이 서로 다른 조건 하에서 다르게 나타나는 복잡한 행동임을 보여줍니다. 연구진은 이러한 시스템을 진정으로 이해하고 평가하기 위해서는 질문을 던지는 단 하나의 방식에 의존하는 것을 멈춰야 한다고 주장합니다. 우리는 마치 의사가 단 하나의 증상만으로 환자를 진단하는 것이 아니라 건강의 전체적인 모습을 살펴봐야 하는 것처럼, 모델의 행동을 온전히 파악하기 위해 다양한 형식을 가로질러 모델이 어떻게 행동하는지 살펴봐야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.