← 최신 논문
💬 NLP

Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social Groups

본 연구는 240 개 사회 집단에 대한 내집단 및 외집단 프레임워크를 비교하기 위해 만다린어 전용 프롬프트를 사용하여 10 개 중국어 대규모 언어 모델의 사회적 정체성 편향을 평가한 결과, 지시 튜닝이 감정 비대칭성을 줄이지만 독성 격차는 지속되며 명시적 여성 복수 대명사 사용으로 인해 더욱 심화됨을 밝혀냈다.

원저자: Geng Liu, Feng Li, Junjie Mu, Mengxiao Zhu, Francesco Pierri

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Geng Liu, Feng Li, Junjie Mu, Mengxiao Zhu, Francesco Pierri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 중국어를 구사하는 매우 똑똑한 디지털 이야기꾼들 (대규모 언어 모델, 즉 LLM) 의 그룹이 있다고 가정해 봅시다. 이러한 모델들은 인터넷에 작성된 거의 모든 것을 읽어왔기 때문에 세계에 대해 많은 것을 알고 있습니다. 하지만 사람들과 마찬가지로, 그들은 그 과정에서 숨겨진 편견을 일부 습득했을지도 모릅니다.

이 논문은 마치 탐정 이야기처럼, 연구자들이 이러한 디지털 이야기꾼들을 테스트에 붙여 "우리"와 "그들"을 다르게 대우하는지 확인하는 내용입니다.

설정: "우리" 대 "그들"

연구자들은 이야기가 내부 관점에서 ("우리는...") 서술될 때와 외부 관점에서 ("그들은...") 서술될 때 모델들이 특정 그룹에 더 친절하게 반응하는지 확인하고자 했습니다.

학교 운동장을 생각해 보세요. 한 학생이 "우리는 축구팀입니다"라고 말하면 자부심과 기쁨이 느껴질 수 있습니다. 하지만 "그들은 축구팀입니다"라고 말하면 (라이벌 팀을 지칭할 때) 비판적이거나 못된 어조로 들릴 수 있습니다. 연구자들은 질문했습니다: 이러한 AI 모델들도 그렇게 행동할까요?

연구자들은 240 개의 다양한 사회적 그룹 (연령, 직업, 배경이 다른 사람들 등) 을 대상으로 10 개의 서로 다른 중국어 AI 모델을 테스트했습니다.

특별한 중국어 변주: "그" 대 "그녀" 대명사

여기서 연구는 매우 기발해집니다. 영어에서는 성별과 관계없이 사람 그룹을 지칭할 때 "they"라는 단어를 사용합니다. 하지만 중국어에는 글자 모양에서 시각적 차이가 있습니다:

  • 他们 (Tāmen): 혼합된 그룹이나 성별을 알 수 없을 때 사용하는 기본형 "그들"입니다. 이는 "사람"과 "말"이 결합된 모양으로 중립적인 상징을 띱니다.
  • 她们 (Tāmen): 여성만 있는 그룹을 지칭하는 특정 "그들"입니다. 이는 "사람"과 "여성" 기호가 결합된 모양입니다.

연구자들은 이 차이를 특별한 도구로 활용했습니다. AI 에게 중립적인 "그들"을 사용하여 그룹에 대해 말하게 한 다음, 여성 전용 "그들"을 사용하여 말하게 했습니다. 그룹이 명시적으로 여성으로 표시되었을 때 AI 가 더 못된 태도를 보이는지 확인하고자 했습니다.

그들이 발견한 것들

1. "우리"가 "그들"보다 낫다는 편향
운동장 비유와 마찬가지로, AI 모델들은 일반적으로 "그들" 그룹보다 "우리" 그룹을 더 좋아했습니다.

  • AI 가 "우리는..."이라고 말할 때, 응답은 더 따뜻하고 긍정적이었습니다.
  • AI 가 "그들은..."이라고 말할 때, 응답은 더 차가웠고 때로는 적대적이었습니다.
  • 주의할 점: 이는 거대한 증오의 폭발이 아니라 미묘하고 일관된 패턴이었습니다. 내부인에 대해서는 미소를 짓는 반면 외부인에 대해서는 살짝 찡그리는 것과 같습니다.

2. "선생님" 대 "학생" (지시 튜닝)
연구자들은 두 가지 유형의 모델을 테스트했습니다:

  • 기초 모델 (Base Models): 이는 많은 것을 읽었지만 아직 예의 바르게 행동하는 법을 배운 적이 없는 raw 상태의 학생들과 같습니다. 이러한 모델들은 "그들" 그룹에게 훨씬 더 못된 태도를 보일 가능성이 높았습니다.
  • 지시 튜닝 모델 (Instruction-Tuned Models): 이는 인간이라는 "선생님"으로부터 도움이 되고 안전하도록 가르침을 받은 학생들과 같습니다. 이러한 모델들은 모두에게 더 예의 바르게 반응하는 데 더 능했습니다. 그들은 "미소 대 찡그림" 격차를 줄였습니다.
  • 그러나: "좋은 학생들" (예의 바른 모델들) 조차도 숨겨진 문제가 여전히 있었습니다. 그들은 어조상으로는 못된 태도를 멈추었지만, "그들" 그룹에 대해 이야기할 때, 특히 그룹이 여성으로 표시된 경우, 여전히 독성 (무례하거나 안전하지 않은 언어) 의 징후를 보였습니다.

3. "여성"에 대한 페널티
이는 놀라운 발견이었습니다. 여러 모델에서 AI 가 여성 전용 대명사 (她们) 를 사용할 때, 중립적 대명사 (他们) 를 사용할 때보다 응답이 실제로 더 독성 (더 무례하거나 더 해로운) 이었습니다.

  • 마치 AI 가 예의를 갖추려고 노력하면서도 무의식적으로 "아, 이 그룹은 모두 여성이군"이라고 생각하자마자 언어가 약간 더 비판적이거나 안전하지 않게 되는 것과 같습니다. 이는 "그들"에 대한 시각적 차이가 없는 영어에서는 볼 수 없는 편향입니다.

4. 현실 세계 점검
연구자들은 또한 인간과 AI 간의 실제 대화 (공개 데이터셋에서) 를 살펴보았습니다. 그들은 실제 상황에서도 AI 가 "우리"에게는 더 친절하고 "그들"에게는 약간 더 비판적인 경향이 있음을 발견했습니다. 이는 단순히 실험실 실험이 아니라 현실 세계에서도 일어난다는 것을 시사합니다.

결론

이 논문은 중국어 AI 모델들이 중립적인 로봇이 아니라고 결론 내립니다. 그들은 사회적 편향을 지니고 있습니다:

  • 그들은 "그들"보다 "우리"를 선호합니다.
  • 그들은 "우리"에게 친절하게 대하는 것보다 "그들"에게 더 못하게 대할 수 있습니다.
  • 그들은 여성으로 표시된 그룹에 대한 특정 숨겨진 편향을 가지고 있으며, AI 가 예의를 갖추려고 노력할 때도 무례한 언어로 나타납니다.

연구자들은 이를 해결하기 위해 영어 규칙만으로는 부족하다고 말합니다. 이러한 AI 도구를 모두에게 공정하고 안전하게 만들기 위해서는 (대명사 차이와 같은) 중국어 특유의 특징을 이해해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →