← 최신 논문
🤖 AI

Investigating Social Bias in Narrative Image Generation

이 논문은 텍스트-이미지 생성 모델의 사회적 편향이 단일 이미지에 비해 스토리보드나 만화와 같은 서사적 형식에서 더 널리 퍼져 있을 뿐만 아니라 더 명시적으로 나타난다는 점을 입증하며, 다양한 시각적 맥락에 걸쳐 이러한 시스템을 평가해야 할 결정적인 필요성을 강조한다.

원저자: Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

게시일 2026-08-04
📖 1 분 읽기☕ 가벼운 읽기

원저자: Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: 서사적 이미지 생성에서의 사회적 편향 조사

문제 정의

텍스트-이미지(T2I) 생성 모델이 미디어, 교육, 디자인 분야에 점점 더 많이 도입되고 있는 가운데, 사회적 편향을 재현하는 경향에 대한 우려가 지속되고 있다. 기존 연구는 T2I 모델이 특정 인구 통계적 특성을 특정 직업, 특성 및 사회적 역할과 연관 짓는다는 점을 광범적으로 입증해 왔다. 그러나 기존의 편향 평가는 주로 단일 샷 실사 이미지 생성에 집중되어 있다. 이러한 좁은 범위는 중요한 공백을 남긴다. 즉, 캐릭터의 연속성, 사건의 시퀀스, 시간적 진행, 그리고 시각적 요소와 텍_스트 요소 간의 상호작용을 통해 의미가 구축되는 서사적 시각 형식(스토리보드 및 만화 등)에서 사회적 편향이 어떻게 나타나는지는 아직 불분명하다. 저자들은 정적인 사진에서는 미묘하거나 보이지 않을 수 있는 편향이 순차적 스토리텔링 형식에서는 더욱 명시적이거나 증폭될 수 있다고 가정한다.

방법론

본 연구는 텍스트 생성용으로 설계된 BBG (Bias Benchmark for Generation) 프레임워크를 이미지 생성 모델 평가에 맞게 변형하여 적용하였다. 방법론은 다음 구성 요소를 포함한다:

  • 프롬프트 구성: 저자들은 연령, 장애, 성별, 외모, 인종/국적, 종교, 사회경제적 지위(SES)의 7가지 사회적 편향 카테고리를 다루는 140개의 시드 프롬프트를 BBG 데이터셋에서 선정하였다. 이 프롬프트들은 특정 속성(예: 어떤 캐릭터가 특정 특성이나 결과를 보유하는지)을 명시하지 않도록 의도적으로 맥락적 모호성을 갖도록 설계되었다. 데이터셋에는 교차 언어적 편향을 조사하기 위해 영어 70개와 한국어 70개의 프롬프트가 포함되었다.
  • 평가 대상 모델: 다음과 같은 6개의 최첨단 T2I 모델을 테스트하였다:
    • 독점 모델(Proprietary): GPT-Image-1.5, GPT-Image-2, Gemini-3.1-Flash-Image, Gemini-3-Pro-Image.
    • 오픈 소스 모델: FLUX.1-Dev, SDXL.
  • 생성 설정: 각 프롬프트에 대해 출력물은 세 가지 뚜로 다른 형식으로 생성되었다:
    1. 실사 이미지: 단일 정적 이미지.
    2. 스토리보드: 텍스트 없이 샷 프레이밍과 카메라 커버리지에 집중한 거친 스케치.
    3. 4컷 만화: 시각적 요소와 말풍선, 캡션, 내레이션을 통합한 순차적 서사.
  • 평가 프로토콜: 4명의 저자가 BBG 질문에 대한 암시된 답변을 바탕으로 생성된 이미지(총 2.4K)를 수동으로 주석 처리하였다. 출력물은 편향됨(biased), 역편향됨(counter-biased), 또는 **중립적(neutral)**으로 라벨링되었다. 또한 반복되는 시각적 및 서사적 패턴을 식별하기 위해 주제적 코딩(thematic coding)을 사용하였다. 영상 생성(Sora-Pro-2 및 Veo-3.1)에 대한 사례 연구를 수행하여 연구 결과를 시계열 미디어로 확장하였다.

주요 결과

정량적 결과

  • 서사 형식이 편향을 증폭함: 독점 모델은 사진에 비해 서사 형식에서 유의미하게 더 많은 편향된 출력을 생성했다. 독점 모델은 사진 생성에서 평균 **25.9%**의 편향된 출력을 생성했다. 이 비율은 스토리보드 생성에서는 9.6 퍼센트 포인트(pp), 만화 생성에서는 18.2 pp 증가했다.
  • 언어적 격차: 편향 발생률은 영어 프롬프트보다 한국어 프롬프트에서 더 높았으며, 한국어 설정이 평균적으로 7.2 pp 더 높은 편향된 출력률을 보였다. 가장 큰 격차는 사진 생성에서 나타났다 (예: Nano Banana 2는 17.4 pp 증가).
  • 오픈 모델 성능: 오픈 모델(FLUX.1-Dev 및 SDXL)은 평균적으로 **93.6%**의 사례에서 중립적인 출력을 생성했다. 그러나 저자들은 이를 효과적인 편향 완화라기보다는 지시 이행 능력의 약화 때문이라고 설명하며, 이 모델들이 인구 통계적 단서를 반영하지 못하거나 문화적으로 맞지 않는 콘텐츠를 생성하는 경우가 많다고 지적했다.

정성적 결과

  • 명시적 vs 암묵적 편향: 사진 생성에서 편향은 종종 미묘한 시각적 단서(예: 특정 의상, 액세서리 또는 표정)를 통해 인코딩된다. 반면, 스토리보드와 만화는 사건의 시퀀스, 캐릭터 배치, 서사적 결말, 그리고 텍스트 요소(예: 스테레오타입을 명시적으로 언급하는 말풍선)를 통해 편향을 더 명시적으로 드러낸다.
  • 시각적 연상의 지속성: 스타일이 바뀌더라도 스테레오타입적인 시각적 연상(예: '창의적인' 사람을 캐주얼한/히피 스타일의 패션이나 전구 기호와 함께 묘사하는 것)은 모든 형식에서 지속되었다.
  • 계층적 스테레오타입: 서사 형식은 단순한 역할 할당 이상의 편향을 노출했다. 예를 들어, 캐릭터의 실패나 의존성에 대한 이유는 스테레오타입에 따라 달랐다 (예: 여성 간호사의 의존성은 정서적 취약성으로 프레임화된 반면, 시각 장애인의 의존성은 실질적인 필요로 프레임화됨).
  • 표면적 완화: 모델은 때때로 반(反)스테레오타입적 요소를 도입하거나 도덕적인 결말(예: 갈등하는 이웃을 화해시킴)을 제시함으로써 편향을 피하려고 시도했다. 그러나 저자들은 이것이 근본적인 연상을 제거하는 것은 아니라고 언급했는데, 미묘한 시각적 단서가 여전히 스테레오타입을 강화할 수 있기 때문이다.
  • 문화적 불일치: 한국어 맥락에서 모델은 문화적 뉘nuance를 맞추는 데 자주 실패하여, 영어를 사용하거나 혼합된 언어를 생성하거나, 프롬프트의 문화적 맥락과 일치하지 않는 서구적/과도하게 전통적인 동아시아 이미지를 생성했다.

의의 및 기여

본 논문은 세 가지 주요 기여를 주장한다:

  1. 서사적 편향에 대한 첫 연구: 실사 이미지와 스토리보드 및 4컷 만화를 비교함으로써 서사적 이미지 생성 형식에서의 사회적 편향에 대한 최초의 체계적인 조사를 제시한다.
  2. 형식 의존적 편향의 증거: 독점 모델이 단일 이미지 생성보다 서사 형식(스토리보드 및 만화)에서 유의미하게 높은 편향을 보인다는 점을 입증하며, 이는 단일 이미지 평가가 모델 편향의 전체 범위를 포착하기에는 불충분함을 시사한다.
  3. 질적 메커니즘: 편향이 형식에 따라 어떻게 다르게 나타나는지(사진에서의 미묘한 시각적 단서에서 만화에서의 명시적 서사 및 텍스트 강화로의 변화)에 대한 질적 증거를 제공한다.

저자들은 서사적 이미지 형식이 단일 사진 생성보다 모델 편향을 측정하는 더 강력한 프로브(probe) 역할을 한다고 결론짓는다. 그들은 T2I 시스템을 평가할 때 단일 이미지 출력을 넘어 다양한 생성 형식을 고려해야 한다고 주장하는데, 이는 정적 이미지에서는 덜 가시적인 편향이 순차적 스토리텔링 맥락에서는 드러나고 더 해로울 수 있기 때문이다. 또한 본 연구는 현재 모델들이 특정 문화적 맥락에 프롬프트를 접지(grounding)시키는 데 자주 실패한다는 점을 지적하며, 다국어 및 교차 문화적 역량을 평가할 필요성을 강조한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →