Characterizing Cultural Localization in AI-Generated Stories
이 논문은 AI가 생성한 이야기에서 피상적인 '템플릿형' 문화 현지화와 심층적인 '전체론적' 문화 현지화를 구분하는 방법을 소개하며, 모델들이 193개 국적의 서사를 차별화하기 위해 소수의 정형화되거나 공격적인 문화적 표식에 의존하는 반면, 서사 구조는 대체로 공유된 문화적 중립적 플롯 구조를 따르고 있음을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 다섯 명의 서로 다른 요리사에게 아이를 위한 '정직'에 관한 이야기를 지어달라고 요청한다고 상상해 보십시오. 한 번은 인도의 아이를 위해, 또 한 번은 미국의 아이를 위해 똑같은 이야기를 요청하는 것입니다. 당신은 인도의 이야기는 차이(chai)와 크리켓이 있는 뭄바이의 거리 풍경처럼 느껴지고, 미국의 이야기는 야구와 커피가 있는 시카고의 공원처럼 느껴질 것이라 기대할 수도 있습니다.
이 논문은 AI 요리사들이 실제로 두 가지 서로 다른 요리를 만들고 있는지, 아니면 그저 똑같은 접시 위에 고명만 바꾸어 올리고 있는 것인지 조사합니다.
AI가 이야기를 "현지화"하는 두 가지 방식
저자들은 AI가 이야기를 현지 느낌이 나도록 만드는 두 가지 방ways를 정의합니다:
- "스티커" 방식 (템플릿 기반 현지화): 잃어버린 돈을 돌려주는 소년에 관한 일반적인 이야기가 있다고 가정해 봅시다. AI는 전체 이야기를 쓴 다음, 단순히 "시카고"를 "방갈로르"로, "커피"를 "차이"로, "야구"를 "크리켓"으로 바꿉니다. 줄거리, 가치관, 구조는 정확히 동일하며, 오직 표면적인 라벨만 바뀝니다.
- "리믹스" 방식 (전체론적 현지화): 여기에서 AI는 실제 이야기를 바꿉니다. 예를 들어, 인도의 이야기는 교통 체증 속에서 가방을 돌려주는 릭샤 운전사에 관한 이야기일 수 있고, 미국의 이야기는 학교 복도에서 지갑을 돌려주는 학생에 관한 이야기일 수 있습니다. 줄거리, 배경, 문화적 가치가 이야기의 결 속에 직접 짜여 들어갑니다.
실험: "양파 껍질 벗기기" 테스트
연구진은 AI가 어떤 방식을 사용하는지 알아보고 싶었습니다. 그들은 다섯 가지 서로 다른 AI 모델에게 193개 국적을 대상으로 125개의 서로 다른 이야기를 쓰게 했습니다.
이 이론을 테스트하기 위해, 그들은 "제거하고 비교하기" 게임을 수행했습니다:
- 스티커 식별하기: 컴퓨터 프로그램을 사용하여 이야기가 "인도적"이거나 "미국적"으로 들리게 만드는 특정 단어들(이름, 장소, 또는 특정 음식 등)을 찾아냈습니다.
- 껍질 벗기기: 디지털 방식으로 그 특정 단어들을 제거했습니다.
- 남은 부분 비교하기: 그리고 질문했습니다. "만약 우리가 '인도식' 단어와 '미국식' 단어를 제거한다면, 남은 이야기들은 서로 같아 보이는가?"
결과:
그것은 마치 양파 껍질을 벗겨냈더니 핵심이 동일한 것을 발견한 것과 같았습니다. 단 **9%에서 17%**의 어휘(즉, "스티커")만을 제거했을 때, 서로 다른 국가의 이야기들은 거의 구분이 불가능할 정도로 비슷해졌습니다. 남은 텍스트는 너무나 유사해서, AI가 모두에게 동일한, 일반적이고 "문화적으로 중립적인" 템플릿을 사용하고 있음을 입증했습니다.
비유:
이것을 AI가 이미 써놓은 대본을 가지고 하는 "매드 립스(Mad Libs, 빈칸 채우기 게임)"라고 생각하십시오. AI는 국가에 맞게 명사와 형용사만 바꿀 뿐, 문장 구조, 이야기의 교훈, 그리고 사건의 순서는 동일합니다. AI는 각 문화에 맞는 새로운 이야기를 쓰는 것이 아니라, 마스터 템플릿의 빈칸을 채우고 있을 뿐입니다.
"풍미"의 문제: 스테레오타입과 불쾌감
연구진은 제거된 "스티커"들을 살펴보았습니다. 이 문화적 표식들이 정확한 것인가, 아니면 그저 스테레오타입(고정관념)인가?
그들은 많은 표식이 무해한 것들(예: "차" 또는 "사모사")이었지만, 19개국의 표식은 해당 지역 사람들에 의해 평균적으로 불쾌한 것으로 평가되었다는 것을 발견했습니다.
- 누가 나쁜 라벨을 받았나? 불쾌한 표식들은 거의 예외 없이 글로벌 사우스(Global South)(주로 아프리카와 서아시아 지역) 국가들을 향해 있었습니다.
- 라벨의 내용은 무엇이었나? 풍부한 문화적 세부 사항 대신, AI는 자주 부정적인 스테레오타입에 의존했습니다. 예를 들어, 일부 국가의 표식에는 "거지", "신뢰할 수 없는", "테러리스트" 또는 "냄새나는"과 같은 단어들이 포함되었습니다.
거시적 관점
논문은 현재의 AI 모델들이 진정한 의미의 "문화적 역량"을 갖추지 못했다고 결론짓습니다. 그들은 서로 다른 문화의 깊은 가치나 독특한 스토리텔링 스타일을 이해하지 못합니다. 대신, 그들은 다음과 같이 행동합니다:
- 실제 이야기에는 하나의 사이즈를 모든 곳에 적용하는 템플릿을 사용합니다.
- 현지처럼 보이게 하기 위해 표면적인 라벨을 갖다 붙입니다.
- 특히 덜 부유한 국가들에 대해서는, 그 라벨로서 불쾌한 스테레오타입을 사용하기도 합니다.
저자들은 만약 우리가 AI가 현지 요소들을 "언급"하는지만 본다면, 우리가 잘하고 있다고 착각할 수 있다고 경고합니다. 하지만 그 이야기의 밑바닥을 들여다본다면, 그것은 종종 이름표만 바꾼 똑같은 옛날이야기일 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.