← 최신 논문
💬 NLP

Measuring Stereotype and Deviation Biases in Large Language Models

본 연구는 네 가지 고급 대규모 언어 모델이 생성한 개별 프로필을 분석하여 고정관념 편향과 편차 편향을 조사한 결과, 검토된 모든 모델이 특정 인구 통계 집단을 특정 속성과 연관시키는 데서 그리고 실제 인구 통계 분포에서 벗어나는 데서 상당한 편향을 보임을 밝혀냈다.

원저자: Daniel Wang, Eli Brignac, Minjia Mao, Xiao Fang

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniel Wang, Eli Brignac, Minjia Mao, Xiao Fang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

네 가지 다른 AI "이야기꾼"(대규모 언어 모델, 또는 LLM) 이 있다고 상상해 보세요. 여러분은 이들에게 한 명의 인물을 창조하고 그들의 정치적 견해, 종교, 사랑하는 사람, 소득, 직업에 대해 모든 것을 말해달라고 요청합니다.

이 논문은 이러한 이야기꾼들이 현실 세계에 대해 진실을 말하고 있는지, 아니면 단순히 오래되고 게으른 고정관념을 반복하고 있는지 확인하는 수사 보고서와 같습니다. 연구자들은 두 가지 주요 질문을 던졌습니다:

  1. "고정관념" 테스트: 이러한 AI 이야기꾼들은 서로 다른 집단을 다르게 대우합니까? (예: 남성은 항상 "엔지니어"로, 여성은 항상 "교사"로 만듭니까?)
  2. "편차" 테스트: 그들이 창조한 인물들은 실제 세계의 실제 사람들과 닮아 있습니까? (예: 100 명의 인물을 창조할 때, 정치적 견해가 실제 미국 인구 분포와 일치합니까, 아니면 갑자기 모두 진보주의자가 됩니까?)

다음은 그들이 발견한 바를 간단히 정리한 것입니다:

1. "정치적 렌즈"는 고장 났습니다

AI 에게 한 사람의 정당 소속을 추측하도록 요청했을 때, 그것은 고장 난 나침반처럼 행동했습니다.

  • 발견: AI 가 창조한 거의 모든 인물은 **진보주의자 (Liberal)**였습니다. 인물이 남성이든 여성이든, 흑인이든 백인이든 아시아인이든, AI 는 압도적으로 "그들은 진보주의자입니다"라고 말했습니다.
  • 현실 점검: 실제 세계에서는 사람들이 진보주의자, 보수주의자, 중립자 사이로 나뉩니다. AI 는 보수주의자와 중립자를 거의 완전히 무시했습니다.
  • 비유: 군중을 위한 뷔페를 요리하라고 요리사에게 요청했지만, 요리사는 피자만 내놓는 것과 같습니다. 샐러드, 스테이크, 타코를 요청해도 요리사는 자신이 익숙하게 요리하는 피자만 더 많이 줍니다.

2. "종교" 필터는 좁습니다

AI 가 한 사람이 믿는 종교를 추측했을 때:

  • 발견: AI 는 주로 기독교 또는 **무교 (종교 없음)**라고 추측했습니다. 수백만 명의 실제 사람들이 이러한 종교를 따르고 있음에도 불구하고 힌두교, 유대교, 이슬람교라고 추측하는 경우는 드뭅니다.
  • 연령 반전: AI 는 노년층 (베이비붐 세대) 에 대해 특정 습관을 보였습니다. 거의 항상 그들이 기독교인이라고 추측했습니다. 반면 젊은 세대에 대해서는 "무교"라고 추측했습니다.
  • 비유: 지도에서 미국과 캐나다만 그려져 있고, 나머지 모든 국가는 단순히 "알 수 없음"으로 표시된다고 상상해 보세요. AI 의 세계 종교 지도는 실제 인구의 거대한 부분을 누락하고 있습니다.

3. "연애 생활" 왜곡

AI 가 성적 지향을 추측했을 때:

  • 발견: AI 는 LGBTQ+ 인물을 지나치게 많이 창조했습니다. 실제 세계에서는 대부분의 사람들이 이성애자로 정체화합니다. AI 는 이를 뒤집어 창조한 인물의 대다수를 LGBTQ+ 로 만들었습니다.
  • 성별 분리: 그것은 특정 패턴을 보였습니다: 거의 항상 남성은 게이이고 여성은 양성애자라고 추측했습니다.
  • 비유: AI 가 "여기 있는 모든 사람이 빨간 모자를 쓰고 있다"고 말하지만, 실제로는 소수의 사람만 빨간 모자를 쓰고 있는 방에 들어가는 것과 같습니다. AI 는 소수 집단을 증폭시켜 마치 다수인 것처럼 보이게 합니다.

4. "직업"과 "재산" 고정관념

AI 가 직업과 부를 추측했을 때:

  • 발견: AI 는 구식 고정관념에 크게 의존했습니다.
    • 직업: 거의 모든 사람, 특히 노년층을 위해 교사그래픽 디자이너를 만드는 것을 좋아했습니다.
    • 인종과 부: 흑인은 "하층민"이고 아시아인은 "상층민"이라고 자주 추측했습니다.
    • 거부: AI 모델 중 하나 (Claude) 는 특정 집단 (백인 남성이나 흑인 남성 등) 에 대한 직업을 추측하는 것에 너무 불안해하여 단순히 "그건 할 수 없습니다"라고 말하며 답변을 거부했습니다.
  • 비유: AI 는 몇 편의 영화만 본 사람과 같습니다. 흑인 캐릭터를 보면 커뮤니티 조직가라고 가정하고, 아시아인 캐릭터를 보면 의사라고 가정합니다. 그들은 실제 통계가 아닌 "영화 논리"에 따라 행동합니다.

5. "이름 게임" (암시적 vs 명시적)

연구자들은 교묘한 방법을 사용했습니다. 두 가지 방식으로 AI 에게 요청했습니다:

  • 명시적: "흑인 남성에 대해 쓰세요."
  • 암시적: "**자말 (Jamal)**이라는 이름의 남성에 대해 쓰세요." (이름이 인종을 직접 말하지는 않지만 암시합니다).

결과: AI 는 두 경우 모두 거의 동일한 방식으로 행동했습니다. "흑인 남성"이라고 직접 말하든, 해당 집단과 관련된 이름만 사용하든, AI 는 여전히 동일한 고정관념을 적용했습니다. 이는 AI 가 단순히 입력한 단어에 반응하는 것이 아니라, 그 뇌 깊숙이 이러한 연관성을 "학습"했음을 시사합니다.

큰 그림

이 논문은 이러한 AI 모델이 사회의 중립적인 거울이 아니라고 결론 내립니다. 대신 그들은 특정 집단을 늘리고 줄이는 기괴한 거울과 같습니다.

  • 그들은 진보주의적 견해를 유일한 견해처럼 보이게 합니다.
  • 그들은 LGBTQ+ 정체성을 다수처럼 보이게 합니다.
  • 그들은 노년층을 기독교인과 교사처럼 보이게 합니다.
  • 그들은 아시아인을 부유하게, 흑인을 가난하게 보이게 합니다.

저자들은 우리가 이러한 AI 모델을 채용, 대출, 뉴스 분석과 같은 의사결정에 사용할 경우, 우연히 실제 세계가 아닌 AI 의 왜곡된 상상력이 반영된 세상을 구축할 수 있다고 경고합니다. 그들은 개발자들이 훈련 데이터를 수정하여 AI 가 이러한 "게으른" 추측을 반복하는 것을 멈추고 현실을 더 정확하게 반영하도록 해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →