← 최신 논문
💬 NLP

Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models

이 논문은 프롬프트 언어의 문법적 성별이 텍-투-이미지(Text-to-Image) 모델의 출력물을 해당 시각적 성별로 크게 편향시킨다는 것을 입증하는 교차 언어적 벤치마크를 소개하며, 이는 단순한 의미적 내용을 넘어 언어 구조 자체가 AI가 생성하는 시각적 표현을 형성한다는 것을 드러낸다.

원저자: Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 레시피를 읽기만 하면 어떤 요리든 만들어낼 수 있는 셰프라고 상상해 보세요. 하지만 여기 반전이 있습니다. 레시피는 단순히 재료 목록이 아닙니다. 당신이 사용하는 언어의 '문법'이 재료가 정확히 같더라도 요리의 맛을 몰래 변화시킵니다.

이 논문은 연구진이 텍스트-이미지(T2I) AI 모델(셰프)이 우리가 그들을 묘사할 때 사용하는 단어의 의미뿐만 아니라, **문법적 성(grammatical gender)**에 의해 크게 영향을 받는다는 사실을 발견한 것에 관한 내용입니다.

연구진의 발견을 쉬운 비유를 통해 정리했습니다.

핵심 아이디어: "문법 유령"

프랑스어, 독일어, 스페인어와 같은 언어에서는 모든 명사에 성별(남성 또는 여성)이 부여됩니다. 영어 나 중국어와 달리, 영어의 'guard'나 'gossip' 같은 단어는 성별이 중립적입니다.

  • 실험: 연구진은 문법적 성별이 고정관념적 성별과 충돌하는 단어들을 선택했습니다.
    • 예시: 프랑스어에서 '파수꾼'이라는 단어(une sentinelle)는 문법적으로 여성형이지만, 파수꾼은 일반적으로 남성으로 인식됩니다.
    • 예시: 독일어에서 '가십(뒷담화)'이라는 단어(der Tratsch)는 문법적으로 남성형이지만, 가십은 흔히 여성과 연관되는 경향이 있습니다.

연구진은 세 가지 유형의 프롬프트를 사용하여 세 가지 다른 AI 모델(DALL-E 3, Ideogram, Flux)에게 이 개념들을 그려보라고 요청했습니다.

  1. 성별이 드러난 프롬프트: 프랑스어/독일어 단어 사용 (예: "A photo of a sentinelle").
  2. 중립적인 프롬프트 (영어): 영어 단어 사용 ("A photo of a guard").
  3. 중립적인 프롬프트 (중국어): 중국어 단어 사용.

거대한 폭로: 마법 지팡이가 된 문법

결과는 놀라웠습니다. AI는 단어가 무엇을 의미하는지만 보는 것이 아니라, 단어의 성별에 귀를 기울였습니다.

  • 남성형 효과: AI에게 남성형 문법을 가진 단어를 주었을 때(설령 그 개념이 여성적일지라도), AI는 훨씬 더 자주 남성을 그렸습니다.

    • 비유: 마치 당신이 "여성스러운" 레시피를 요청했는데 "남성용" 재료 라벨을 사용하자, 셰프가 갑자기 샐러드 대신 스테이크를 내놓기로 결정한 것과 같습니다.
    • 수치: 남성형 문법을 사용했을 때, AI는 **73%**의 확률로 남성을 그렸습니다. 중립적인 영어로 했을 때는 남성을 그리는 비율이 **22%**에 불과했습니다. 단지 작은 문법적 표식 하나 때문에 엄청난 차이가 발생한 것입니다.
  • 여성형 효과: AI에게 여성형 문법을 주었을 때 여성 이미지가 더 많이 생성되었지만, 그 효과는 다소 복합적이었습니다.

    • 수치: 여성형 문법은 여성 이미지를 **38%**까지 증가시켰습니다 (영어의 28%와 비교했을 때).
    • 반전: 어떤 경우에는 (특히 DALL-E 3 모델에서), AI가 문법이 제안하는 바와 정반대로 행동하기도 했는데, 이는 AI가 고정관념을 "교정"하려고 너무 과하게 노력했기 때문으로 보입니다.

왜 이런 일이 발생하는가?

연구진은 두 가지 주요 원인을 찾아냈습니다.

  1. "고자원(High-Resource)" 편향: 이 효과는 데이터가 많은 언어(프랑스어, 스크립어, 독일어 등)에서 가장 강력했습니다. 마치 AI가 이 언어들을 아주 많이 "읽어서", 문법적 성별 태그를 특정 시각적 스타일과 연관 짓는 법을 배운 것과 같습니다.
  2. "영어 필터": 결과를 영어와 비교했을 때, 그 효과가 때때로 약해졌습니다. 연구진은 영어 AI 모델들이 영어에 대해 집중적으로 "편향 제거(debiasing)"(고정관념을 피하도록 훈련됨) 과정을 거쳤기 때문이라고 추측합니다. 그러나 중국어(편향 연구가 적은 언어)와 비교했을 때는 문법적 성별 효과가 훨씬 더 강하고 명확했습니다.

모델마다 반응이 다르다

세 가지 AI 모델을 세 명의 서로 다른 화가라고 생각해보세요.

  • Flux: 가장 민감한 화가입니다. 문법적 성별 규칙을 엄격히 따라, 남성형 단어에는 남성을, 여성형 단어에는 여성을 거의 매번 그렸습니다.
  • Ideogram: 중간 단계의 화가입니다. 규칙을 따르긴 하지만 극단적이지는 않았습니다.
  • DALL-E 3: "반항적인" 화가입니다. 고정관념을 피하라는 강력한 지침을 포함하여 훈련되었기 때문에, 문법적 성별을 무시하거나 심지어 정반대로 행동하는 경우가 많았습니다.

"모호함"의 부작까지

한 가지 흥란한 참고 사항은, AI에게 성별이 있는 언어로 프롬프트를 주었을 때, 성별을 분류하기 어려운 이미지들이 더 많이 생성되었다는 점입니다. 마치 단어의 의미와 문법적 성별 사이의 충돌이 AI를 혼란스럽게 하여, 성별이 "흐릿하게" 보이도록 만든 것 같습니다.

결론

이 논문은 언어 구조 자체가 AI의 현실을 형성한다는 것을 증명합니다. 당신이 무엇을 말하는가(내용)뿐만 아니라, 어떻게 말하는가(문법)가 그림을 바꿉니다.

만약 당신이 "파수꾼(guard)"의 그림을 원한다면, 영어로는 남성을 보여줄 수 있지만, 프랑스어로는 그 단어가 문법적으로 여성형이기 때문에 여성을 보여줄 수도 있습니다. 연구진은 이를 새로운 차원의 편향, 즉 **문법적 성별 편향(Grammatical Gender Bias)**이라고 부릅니다.

이 논문이 말하지 않는 것:

  • 성별이 있는 언어를 사용하지 말라는 뜻이 아닙니다.
  • 이 문제에 대한 구체적인 해결책을 아직 제시하지 않습니다 (모델 훈련 시 이를 고려해야 한다는 점을 언급한 것 외에는).
  • 이 현상이 모든 AI 시스템에서 일어난다고 주장하는 것이 아니라, 테스트한 세 가지 특정 모델에 국한된 것입니다.

요약하자면, 언어의 문법은 AI를 위한 숨겨진 지시 설명서와 같아서, 단어의 의미를 살피기도 전에 누구를 그릴지 결정해 버립니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →