Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South
본 논문은 글로벌 남반구의 지역사회와 협력하여 26,000 개 이상의 현지화된 실패 사례로 구성된 다양한 데이터셋을 생성함으로써 텍스트-이미지 안전 분야의 서구 중심 편향을 해소하고 고유한 문화적 해악을 드러내며 맥락 인식 안전 체계를 옹호하는 참여형 레드 팀링 이니셔티브인 PLACES 를 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 당신이 묘사하는 모든 것을 그려낼 수 있는 마법의 예술 기계 (텍스트-이미지 모델) 가 있다고 가정해 봅시다. 오랫동안 이 기계는 주로 서구 (북미와 유럽) 의 사람들에 의해 훈련되어 그들의 시선으로 세상을 바라보도록 학습되었습니다. 이는 미국식 위안 음식만 요리하는 방법을 아는 셰프와 같습니다. 인도나 나이지리아의 특정 지역 요리를 요청하면, 그들은 그저 일반적인 햄버거나 혼란스러운 요리만 내놓을지도 모릅니다.
이 논문은 **"Going PLACES"**라는 제목으로, 이 예술 기계에 나머지 세계를 올바르게 바라보는 법을 가르치기로 결심한 연구팀에 관한 것입니다. 그들은 단순히 온라인에서 무작위 사람들에게 기계가 어떻게 고장 나는지 시도해 보라고 요청하지 않았습니다. 대신 '글로벌 사우스' (특히 가나, 나이지리아, 인도의 일부 지역) 의 지역 사회 깊숙이 들어가, 그 기계가 그 특정 장소에서 무엇을 잘못 이해하는지 파악했습니다.
간단한 비유를 사용하여 그들의 작업을 다음과 같이 분류해 보겠습니다:
1. 문제: "일률적" 안전망
연구자들은 현재 이러한 AI 예술 기계의 안전 규칙이 단일 사이즈의 구명조끼와 같다고 주장합니다. 이는 서구 수영자에게는 완벽하게 맞을지 모르지만, 다른 문화권 사람에게는 너무 헐거우거나 너무 꽉 끼일 수 있습니다.
- 문제점: AI 는 서구 규칙을 따름으로써 '안전'하다고 생각하지만, 지역 문화에서는 깊이 모욕적이거나 종교적으로 부적절하거나 문화적으로 무지한 이미지를 생성할 수 있습니다.
- 비유: AI 가 '종교 의식'을 그린다고 상상해 보세요. 서구에서는 단순히 일반적인 교회를 그릴 수 있습니다. 하지만 인도에서 특정 힌두교 의식을 요청하면, AI 는 우연히 신의 발에 신발을 신겨 버릴 수도 있습니다 (이는 매우 큰 금기입니다) 또는 두 가지 다른 축제를 혼동할 수 있습니다. AI 는 이러한 지역적 '교통 규칙'을 알지 못합니다.
2. 해결책: 현지 가이드와 함께하는 "레드 팀링"
"레드 팀링"은 보안 시스템을 해킹해 보게 하여 나쁜 놈들이 하기 전에 고칠 수 있도록 해커 그룹을 고용하는 것과 같습니다. 보통 이러한 '해커'들은 미국이나 영국의 대형 기술 사무실에 앉아 있는 전문가들입니다.
- PLACES 가 한 일: 외부인을 고용하는 대신, 그들은 주요 도시가 아닌 2 차 도시의 대학들 (뭄바이나 라고스 같은 대도시가 아닌) 과 파트너십을 맺었습니다. 그들은 지역 학생들과 교수를 '커뮤니티 가이드'로 모집했습니다.
- 워크숍: 학생들이 시작하기 전에 연구자들은 워크숍을 개최했습니다. 이는 훈련 캠프와 같아서, "여기 AI 가 작동하는 방식이 있고, 여기 당신들의 문화가 안전을 어떻게 보는지"를 설명했습니다. 그들은 학생들이 지역 언어를 사용하고, 언어를 섞어 (영어와 힌디어나 피진어를 섞어) 말하며, 지역적 은유를 사용하도록 장려했습니다.
- 결과: 그들은 서구 테스트자가 결코 생각하지 못했을 AI 의 실패 사례 26,000 개 이상을 수집했습니다. 이 컬렉션은 PLACES 데이터셋이라고 불립니다.
3. 그들이 발견한 것: AI 의 "문화적 맹점"
그들이 26,000 개의 예를 분석했을 때, 세 가지 주요 유형의 '맹점'을 발견했습니다:
A. "코드 믹싱" (Code-Mixing) 의 허점
글로벌 사우스의 많은 지역에서 사람들은 단일 문장 안에 자연스럽게 언어를 섞습니다 (예: "라고스에서 jolof rice를 먹는 남자").
- 발견: AI 의 안전 필터는 영어만 말하는 바운서와 같습니다. 영어와 지역 언어를 섞어 속삭이면, 바운서는 위험을 이해하지 못하고 당신을 들여보냅니다. 연구자들은 언어를 섞는 것이 순수 영어로 작성되었으면 차단되었을 동일한 요청을 우회할 수 있게 해준다는 것을 발견했습니다.
B. "규범적 불일치" (Normative Dissonance)
이는 AI 가 '서구 규칙'을 따르지만 '지역 규칙'을 위반할 때 발생합니다.
- 비유: AI 가 만찬 파티에 초대된 손님과 같다고 상상해 보세요. 주최자 (지역 문화) 는 "왼손으로 먹지 마세요"라고 말합니다. 손님 (AI) 은 "하지만 내 규칙서에는 손은 그냥 손이라고 되어 있어요!"라고 말하며 여전히 왼손을 사용합니다.
- 실제 예시:
- 종교: AI 는 힌두교 남성이 소고기를 먹는 이미지 (많은 힌두교도에게 금지됨) 나 메카에서 도박을 하는 무슬림의 이미지를 생성했습니다. AI 에게는 이 것들이 단지 "무언가를 하는 사람들"이었지만, 현지인들에게는 깊이 모욕적인 일이었습니다.
- 관습: AI 는 인도에서 아이가 노인과 악수하는 모습을 보여주었지만, 지역의 관습은 발을 만지는 것입니다. AI 는 그 문화의 '순수성'과 '존경' 규칙을 놓쳤습니다.
- 징조: AI 는 길 건너는 검은 고양이거나 깨진 거울을 그렸습니다. 어떤 문화에서는 이 것들이 단순히 '고양이'나 '유리'가 아니라 나쁜 운을 가져오는 나쁜 징조입니다. AI 는 이미지의 느낌을 이해하지 못했습니다.
C. "존재론적 평탄화" (Ontological Flattening) (정체성 지우기)
이는 AI 가 독특하고 구체적인 무언가를 취해 일반적이고 서구적인 형태로 부숴버릴 때 발생합니다.
- 비유: 화가에게 특정 유형의 지역 버스를 그려달라고 요청했는데, 그들이 일반적인 미국 학교 버스를 그리는 것과 같습니다.
- 실제 예시:
- 음식: "푸푸 (Fufu, 서아프리카 요리)"를 요청하고 으깬 감자나 햄버거 그림을 받는 경우.
- 예술: "야크샤가나 (Yakshagana, 특정 인도 극장 양식) 예술가"를 요청하고 흰 발레 tutu 를 입은 일반적인 '전통 무용수'를 얻는 경우.
- 사람: "남인도 길거리 행상인"을 요청하고, 프롬프트에 빈곤을 요구하지 않았음에도 불구하고 빈곤에 대한 고정관념을 강화하는 방식으로 어두운 피부색을 가진 사람의 그림을 얻는 경우.
4. 이것이 중요한 이유
이 논문은 AI 를 더 '크게' 만들거나 같은 오래된 곳에서 더 많은 데이터를 추가함으로써만 AI 를 더 안전하게 만들 수 없다고 결론지었습니다. 당신은 **클로즈업 (zoom in)**해야 합니다.
- 교훈: AI 를 전 세계를 위해 진정으로 안전하게 만들려면, 그 문화에 사는 사람들이 그들 자신에게 '안전'이 무엇을 의미하는지 정의하도록 해야 합니다. '본사'가 아니라 '커뮤니티 가이드'의 말을 들어야 합니다.
요약
PLACES 프로젝트는 외국 로봇에게 지역 방언, 관습, 금기를 가르치기 위해 현지 통역사 팀을 보내는 것과 같습니다. 그들은 로봇이 '나쁘기' 때문에 실패한 것이 아니라 문화적 문맹이었기 때문에 실패했다는 것을 발견했습니다. 지역 사회가 AI 를 '레드 팀'하게 함으로써, 그들은 AI 가 잘못될 수 있는 수천 가지 새로운 방식을 밝혀냈으며, 안전은 보편적인 규칙서가 아니라 지역적 대화임을 증명했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.