It's How You Ask: Gender-Associated Linguistic Bias in LLMs
이 논문은 거대 언어 모델이 여성과 흔히 연관되는 언어적 특징을 포함하는 프롬프트에 대해 체계적으로 더 짧고, 덜 정교하며, 덜 격식 있는 응답을 생성한다는 것을 입증하며, 이는 사용자의 자기 제시(self-presentation)를 통해서는 완화하기 어려운 초기 트랜스포머 레이어에 뿌리를 둔 깊은 편향을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 투명한 도서관에 들어선다고 상상해 보세요. 그곳의 책들은 인터넷에 입력된 거의 모든 것을 읽은 초지능 로봇이 쓴 것입니다. 이 로봇은 거대 언어 모델(LLM)이며, 이메일, 입사 지원서, 그리고 다른 중요한 메모를 작성하는 데 있어 우리의 새로운 단짝이 되어가고 있습니다. 하지만 여기 함정이 하나 있습니다. 인간과 마찬가지로, 이 로봇은 미묘한 습관과 암묵적인 규칙으로 가득 찬 인간 언어의 복잡하고 무질서한 세상을 통해 학습했습니다. 그 규칙 중 하나는 남성과 여성이 서로 다르게 말하고 글을 쓰는 경향이 있다는 것입니다. 이는 그들이 일부러 다르게 행동하려 함이 아니라, 그들이 어떻게 자랐고 어떤 문화 속에 살고 있는지에 따른 것입니다. 예를 들어, 여성들은 "아마도"나 "제 생각에는"과 같은 "완곡한" 단어를 더 많이 사용하거나, 문장 끝에 "그렇지 않나요?"와 같은 질문을 더 많이 던지거나, "나" 대신 "우리"라는 표현을 더 자주 사용할 수 있습니다. 과학자들이 던지는 핵심적인 질문은 이것입니다. 이 로봇이 우리의 이러한 미묘하고 무의식적인 습관에 따라 우리를 다르게 대우하는가? 만약 로봇이 여성의 글쓰기 스타일이 "덜 진지하다"고 판단한다면, 여성에게 더 약한 수준의 이메일을 써줄 것이고, 이는 직장에서 그녀의 기회를 해칠 수 있습니다. 이것은 로봇이 못되게 굴어서 발생하는 문제가 아닙니다. 우리가 인지하지 못하는 사이에 로봇이 고정관념을 그대로 복제하고 있는가에 대한 문제입니다.
이 연구를 진행한 연구자들은 이 초지능 로봇과 함께 "차이점 찾기" 게임을 하기로 했습니다. 그들은 사람들이 로봇에게 했던 실제 요청들—예를 들어 "상사에게 보낼 이메일을 써줘"—을 가져온 뒤, 이를 몰래 수정했습니다. 어떤 요청에는 여성과 연관된 "부드러운" 습관들(예를 들어 "아마도"를 추가하거나 "함께 이것을 해봅시다"라고 하는 것)을 더했습니다. 다른 요청에는 남성과 연관된 습관인 더 직접적이고 단호한 말투를 입혔습니다. 그러고 나서 그들은 네 가지 서로 다른 로봇 모델에게 이메일을 작성하도록 요청했습니다.
결과는 놀랍기도 하고 조금 걱정스럽기도 했습니다. 로봇이 "더 부드럽고" 협력적인 요청을 받았을 때, 로봇은 더 짧고 단순하며 격식이 덜한 답변을 작성했습니다. 마치 로봇이 "아마도"라는 말을 듣고, "오, 이 사람은 확신이 없으니 그냥 빠르고 쉬운 답을 주자"라고 생각한 것 같았습니다. 하지만 요청이 직접적이고 단호했을 때, 로봇은 더 길고 정교하며 전문적인 느낌을 주는 이메일을 작성했습니다. 연구자들은 로봇이 단순히 요청의 스타일을 흉내 내는 것(예를 들어 단어를 반복하는 앵무새처럼)이 아님을 확인하기 위해 검증 과정을 거쳤으며, 로봇이 이러한 미묘한 언어적 단서에 따라 답변의 '질' 자체를 실제로 바꾸고 있다는 것을 발견했습니다.
정말 까다로운 부분은 여기입니다. 연구자들은 로봇이 요청 끝에 남자의 이름을 넣거나 여자의 이름을 넣는 것과 같은 명시적인 성별 단서에 신경을 쓰는지도 테스트했습니다. 그 결과, 이름은 별로 중요하지 않다는 것을 발견했습니다. 로봇은 이메일이 "존"으로 끝나든 "제인"으로 끝나든 상관하지 않았습니다. 로봇이 관심을 가진 것은 단어가 어떻게 조합되었는가였습니다. 마치 로봇에게 이름표가 아닌 언어의 "분위기"에 따라 작동하는 숨겨진 스위치가 있는 것 같았습니다.
로봇이 어떻게 이런 행동을 하는지 알아내기 위해, 과학자들은 로봇의 뇌(컴퓨터 코드) 내부를 들여다보았습니다. 그들은 로봇이 프로세싱의 초기 단계, 즉 아주 첫 몇 개의 층에서 이러한 "부드러운" 언어 습관을 매우 빠르게 인식한다는 것을 발견했습니다. 그러나 로봇은 결정을 내리는 데 이름을 사용하지 않았습니다. 이는 로봇이 언어 스타일을 성별을 추측하는 지름길로 사용하도록 학습했으며, 그 후에 그 성별에 대한 고정관념을 답변에 적용한다는 것을 시사합니다.
이 연구는 이것이 해결하기 어려운 문제임을 시사합니다. 이러한 언어 습관은 종종 무의식적이기 때문에—사람들은 자신이 항상 "아마도"나 "우리"를 사용하고 있다는 사실을 깨닫지 못합니다—사용자가 더 나은 답변을 얻기 위해 단순히 "더 노력해서" 더 직접적으로 말하려고 노력할 수는 없습니다. 사람들이 컴퓨터를 만족시키기 위해 자연스러운 말투를 바꾸도록 요구하는 것은 불공평합니다. 연구자들은 우리가 이 도구들이 어떻게 만들어지는지에 대해 주의를 기울여야 한다고 결론지었습니다. 왜냐하면 현재로서는, 이 도구들이 협력적이거나 "부드러운" 스타일을 사용하는 사람들의 업무 소통을 의도치 않게 더 어렵게 만들 수 있기 때문입니다. 로봇이 악의를 가지고 그러는 것은 아니지만, 학습한 방식에 의해 편향되어 있는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.