← 최신 논문
💻 computer science

Assessing the Geographic Diversity of AI's Platial Representations in Image Generation

이 논문은 생태계 종 다양성 측정 방식을 응용하여 구형 모델과 프롬프트 수정이 최신 모델보다 더 높은 다양성을 나타내는 경우가 많음을 밝히는 한편, 현재의 시스템들이 특정 장소를 정형화하여 표현하는 방식에 있어 우려스러운 균질성을 드러내고 있다는 점을 통해 AI 이미지 생성의 지리적 다양성을 평가한다.

원저자: Zilong Liu, Krzysztof Janowicz, Mina Karimi

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zilong Liu, Krzysztof Janowicz, Mina Karimi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하고 창의적인 로봇 그룹이 있다고 상상해 보세요. 당신이 그들에게 비엔나와 같은 특정 도시를 그려달라고 요청합니다. 당신은 30대의 서로 다른 로봇에게 요청한다면, 어떤 로봇은 공원을, 어떤 로봇은 박물관을, 어떤 로봇은 번화한 거리를, 어떤 로봇은 유명한 교회를 보여주는 등 30가지의 서로 다른 관점을 얻게 될 것이라 기대할 것입니다.

하지만 이 논문은 다음과 같은 질문을 던집니다: 만약 그들이 모두 정확히 똑같은 것을 그린다면 어떻게 될까요?

이 연구의 저자들은 다양한 AI 모델(DALL·E 및 GPT-4o 등)에게 비엔나를 그려달라고 요청함으로써 이를 테스트하기로 했습니다. 그들은 단순히 그림을 보는 것에 그치지 않고, AI가 정말로 창의적인지 아니면 그저 고장 난 레코드판처럼 반복하고 있는 것인지 확인하기 위해 그림 뒤에 숨겨진 '아이디어'를 살펴보았습니다.

다음은 이 연구의 결과를 쉬운 비유를 사용하여 정리한 내용입니다:

1. "관광 브로슈어" 문제

연구진이 AI에게 비엔나를 그려달라고 요청했을 때, 거의 모든 모델이 즉각적으로 성 슈테판 대성당을 떠올렸습니다. 마치 모든 로봇의 머릿속에 똑같은 관광 브로슈어가 들어있는 것 같았습니다.

  • 연구 결과: AI 모델들은 매우 "정형화되어" 있었습니다. 그들은 도시 전체를 보여주는 것이 아니라, 가장 유명하고 상징적인 랜드마크(오페라 하우스나 시청 등)만을 보여주었습니다.
  • 비유: 100명에게 숲을 묘사해 달라고 부탁했는데, 그들 중 90명이 양치식물, 강, 바위는 무시한 채 오직 가장 높은 소나무만을 언급한다면, 그들은 숲을 제대로 묘고하는 것이 아니라 단지 '소나무'라는 '개념'을 설명하고 있는 것입니다. AI도 비엔나에 대해 똑같은 행동을 하고 있었습니다.

2. "구형 vs 신형"의 반전

보통 우리는 새로운 기술이 항상 더 나을 것이라고 생각합니다. 가장 최신 AI 모델이 더 창의적이고 다양할 것이라고 가정하죠.

  • 연구 결과: 저자들은 역설적인 사실을 발견했습니다. 오래된 AI 모델(DALL·E 2와 같은)이 오히려 최신 모델보다 더 다양한 이미지를 생성했습니다. 최신 모델들은 오히려 자신들의 방식에 더 갇혀 있어서, 몇 가지 랜드마크에 과도하게 집중하는 경식을 보였습니다.
  • 비유: 이것은 음악 플레이리스트와 같습니다. 당신은 "프리미엄 2026" 버전의 음악 앱이 가장 다양한 곡을 들려줄 것이라 기대할 수 있습니다. 하지만 이 경우, "프리미엄" 버전은 상위 히트곡 3곡만을 계속 반복해서 재생하는 반면, "베이직 2022" 버전은 훨씬 더 다양한 노래들을 들려주었습니다.

3. "단어와 그림" 사이의 간극

연구는 프로세스의 두 단계를 살펴보았습니다:

  1. 프롬프트: AI가 무엇을 그릴지 설명하기 위해 작성하는 텍스트.
  2. 이미지: 실제로 생성된 그림.
  • 연구 결과: AI는 그림을 그릴 때보다 설명을 작성할 때 더 다양성을 보였습니다.
  • 비유: 요리사가 20가지의 이국적인 요리가 담긴 메뉴(프롬프트)를 작성했지만, 실제로 요리를 할 때는 똑같은 세 가지 기본 요리만을 내놓는 것과 같습니다. '아이디어'는 다양했지만, '실제 결과물'은 그렇지 못했습니다.

4. 사과와 오렌지 세기 (수학적 부분)

이 "다양성"을 측정하기 위해 연구진은 생태학(자연을 연구하는 학문)에서 도구를 빌려왔습니다.

  • 기존 방식 (힐 수, Hill Number): 만약 10그루의 나무가 있는 숲에 10종류의 나무가 모두 다르다면 다양성이 높습니다. 만약 10그루의 나무 중 9그루가 소나무이고 1그루가 참나무라면 다양성이 낮습니다.
  • 새로운 방식 (레인스터-코볼드 수, Leinster-Cobbold Number): 저자들은 단순히 "다른" 것들을 세는 것만으로는 부족하다는 점을 깨달았습니다. 만약 10그루의 나무가 있는데 5그루는 소나무고 5그루는 가문비나무라면 어떨까요? 종은 다르지만, 그들은 서로 매우 유사합니다.
  • 통찰: 이 "유사성" 수학을 적용했을 때 다양성 점수는 훨씬 더 낮아졌습니다. AI가 서로 다른 랜드마크를 선택하더라도, 그것들은 종종 동일한 유형의 건물(예: 서로 다른 형태의 교회들)의 변형에 불과하다는 것이 밝혀졌습니다.
  • 비유: 아이에게 과일 5개를 골라보라고 했을 때, 아이가 청사과, 후지 사과, 갈라 사과를 골랐다면 아이는 "저는 3가지 다른 과일을 골랐어요!"라고 말할 수도 있습니다. 하지만 전문가는 그것들이 모두 사과라는 것을 알고 있습니다. AI는 "다른" 랜드마크를 골랐지만, 실제로는 그저 서로 다른 "사과"들을 고른 것이었습니다.

5. 왜 우리가 관심을 가져야 하는가?

저자들은 이것이 단순한 기술적 오류가 아니라, **편향(Bias)**의 한 형태라고 주장합니다.

  • AI가 어떤 도시에 대해 물었을 때 항상 몇몇 랜드마크만을 보여준다면, 그 장소에 대한 좁고 정형화된 시각을 만들어냅니다.
  • 이는 도시의 나머지 부분(현지 동네, 작은 공원, 독특한 지역 건축물 등)을 보이지 않게 만들 위험이 있습니다.
  • 결론: AI가 이미지를 만드는 능력이 좋아질수록, 오히려 세상의 진실하고 복잡하며 다양한 현실을 보여주는 능력은 떨어질 수 있습니다. AI는 우리에게 가장 유명한 것들만을 다시 비춰주는 "거울의 방"이 되어가고 있습니다.

요약하자면: 이 논문은 우리의 AI 이미지 생성기들이 지리학의 "에코 체임버(메아리 방)"가 되고 있다고 경고합니다. AI는 대중의 흐름을 따르는 데 너무 능숙해진 나머지, 세상의 독특하고 다양하며 덜 유명한 부분들을 보여주는 법을 잊어가고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →