← 최신 논문
💬 NLP

SoS: Analysis of Surface over Semantics in Multilingual Text-To-Image Generation

이 논문은 다국어 텍스트-이미지 모델에서 발생하는 "표면-대-의미"(Surface-over-Semantics, SoS) 현상에 대한 최초의 포괄적인 분석을 소개하며, 대부분의 모델이 의미론적 의미보다 표면적인 언어적 단서를 우선시하여 다양한 언어와 문화 전반에 걸쳐 문화적으로 정형화된 묘사를 초래한다는 점을 밝혀낸다.

원저자: Carolin Holtermann, Florian Schneider, Anne Lauscher

게시일 2026-01-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Carolin Holtermann, Florian Schneider, Anne Lauscher

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 입력한 대로 그림을 그리는 마법의 예술 기계가 있다고 상상해 보세요. 만약 당신이 "독일 사람을 그려줘"라고 말한다면, 기계는 독일 사람을 그려야 합니다. 하지만 똑같은 요청을 다른 언어, 예를 들어 "Zeichne eine Person aus Deutschland"(독일어)나 "Dibuja una persona de Alemania"(스페인어)로 입력하면 어떻게 될까요?

이 논문은 이 기계들에서 발견되는 **표면-의미 중첩(Surface-over-Semantics, SoS)**이라는 이상한 결함을 조사합니다.

핵심 문제: "억양"인가, 아니면 "의미"인가?

텍text-to-image 프롬프트를 예술가에게 보내는 편지라고 생각해 보세요.

  • 의미 (Semantics): 편지의 실제 내용입니다. "독일 사람의 사진을 원합니다."
  • 표면 (Surface): 편지가 쓰인 언어와 스크립트(문자)입니다. 영어로 쓰였나요, 힌디어로 쓰였나요, 아니면 중국어로 쓰였나요?

연구진은 이러한 많은 AI 예술 기계들이 이야기보다는 억양에 집중하는 서툰 번역가와 같다는 것을 발견했습니다. 당신이 영어로 "독일 사람"을 요청하면 기계는 독일 사람을 그립니다. 하지만 동일한 "독일 사람"을 다른 언어(예: 힌디어나 핀란드어)를 사용하여 요청하면, 기계는 종종 "독일"이라는 부분을 무시하고 대신 당신이 사용한 언어의 스테레오타입(고정관념)처럼 보이는 것을 그려냅니다.

마치 요리사에게 이탈리아어로 "스파게티"를 주문했는데, 요리사가 "스파게티"라는 단어 대신 "이탈리아"라는 말을 듣고 그것을 원한다고 가정하여 파스타 대신 피자를 내놓는 것과 같습니다.

실험: 글로벌 맛 테스트

이를 증명하기 위해 연구진은 거대한 "맛 테스트"를 설계했습니다:

  1. 메뉴: 17부터 171개의 다양한 문화적 정체성(예: "일본인", "나이지리아인", "브라질인")을 선정했습니다.
  2. 언어: "A photo of a [Culture] person"이라는 요청을 14개의 다양한 언어(영어, 아랍어, 중국어, 핀란드어 등을 포함)로 번역했습니다.
  3. 예술가: 7개의 서로 다른 AI 예술 기계에게 이 그림들을 그리도록 요청했습니다.
  4. 채점표: 결과값을 측정하기 위해 SoS 점수라고 불리는 새로운 측정 방식을 고안했습니다.

SoS 점수는 "편향 측정기"와 같습니다:

  • 점수가 **양수(+)**라면, 기계가 의미에 집중했다는 뜻입니다 (예: 어떤 언어를 사용하든 독일 사람을 요청했을 때 독일 사람을 그린 경우).
  • 점수가 **음수(-)**라면, 기계가 표면에 집중했다는 뜻입니다 (예: 핀란드어로 요청했을 때, 독일 사람을 요청했음에도 불구하고 핀란드어와 관련된 스테레오타입의 장면을 그린 경우).

연구 결과

  1. 대부분의 기계는 "표면에 치우쳐 있음": 테스트된 7개의 기계 중 6개가 사용된 언어에 강한 영향을 받았습니다. 만약 당신이 기계가 잘 다루지 못하는 언어로 입력한다면, 기계는 실제 요청한 문화가 아니라 그 언어의 스크립트나 문화와 관련된 스테레오타입을 기본값으로 그려내는 경우가 많았습니다.
  2. "딥 다이브(Deep Dive)" 효과: 연구진은 기계의 내부(특히 텍스트가 처리되는 레이어)를 들여다보았습니다. 그 결과, 메시지가 기계 내부 깊숙이 전달될수록 편향이 더 강력해진다는 것을 발견했습니다. 이는 마치 메시지가 멀리 전달될수록 왜곡되는 "전화기 게임(말 전달하기 게임)"과 같습니다. 그림을 그리기 시작할 때쯤이면 언어의 "억양"이 원래의 의미를 완전히 집어삼킨 상태가 됩니다.
  3. 시각적 스테레오타입: 기계가 혼란에 빠졌을 때, 단순히 무작위적인 것을 그리는 것이 아니라 문화적 스테레오타입을 그렸습니다.
    • 핀란드어 프로프트는 종종 눈 덮인 숲으로 나타났습니다.
    • 암하라어(에티오피아 언어) 프롬프트는 종종 건조하고 모래가 날리는 사막으로 나타났습니다.
    • 중국어일본어 프롬프트는 실제 요청과는 전혀 상관없는 피나 흉터 같은 무서운 요소들을 포함하기도 했습니다.

단 하나의 예외

AltDiffusion이라는 이름의 한 기계는 "모범생"이었습니다. 이 기계는 언어의 억양을 대부분 무시하고 의미에 집중하여, 어떤 언어를 사용하든 요청된 문화를 그려냈습니다. 하지만 이 기계조차 학습 과정에서 많이 접하지 못한 언어에 대해서는 약간 어려움을 겪었습니다.

이것이 중요한 이유

이 논문은 이러한 AI 도구들이 발전하고 있지만, 여전히 사각지대가 있다고 결론짓습니다. 이들은 단어의 의미보다는 단어의 모습(언어)에 너무 쉽게 휘둘립니다. 이는 당신이 모국어로 이 도구들을 사용할 때, 당신이 요청한 구체적인 사람이나 사물이 아니라 그 언어의 스테레오타입을 반영한 그림을 얻게 될 수도 있음을 의미합니다.

연구진은 이를 해결하기 위해, 특히 영어가 아닌 언어들에 대해 기계가 "억양"(표면)보다는 "이야기"(의미)에 더 집중하도록 훈련시켜야 한다고 제안합니다. 또한, 개발자들이 자신들의 기계가 공정한지 확인할 수 있는 도구로서 그들의 "편향 측정기"(SoS 점수)를 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →