Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS)
이 논문은 중동 지역에서 개발된 모델들을 포함하여 거대 언어 모델들이 '세이드 워싱(Said-washing)'과 서구적 지식을 보편적인 것으로 프레이밍함으로써 구조적 오리엔탈리즘 편향을 체계적으로 재현하고 있음을 입증하기 위해 중동 문화 감수성 점수(MECSS)를 도입하며, 이를 통해 표준 공정성 지표들이 이러한 뿌리 깊은 인식론적 왜곡을 감지하는 데 실패한다는 점을 밝힌다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
우리가 컴퓨터에게 한 문화를 설명해 달라고 요청할 때, 우리는 흔히 사실에 기반한 중립적인 요약을 얻고 있다고 가정합니다. 하지만 이러한 질문에 답하는 시스템은 백지 상태가 아닙니다. 이들은 주로 서구의 사람들이 영어로 작성한 방대한 텍례들을 바탕으로 구축되었으며, 그 도서관들에 존재하는 패턴을 모방함으로써 언어를 배우는 법을 익혔습니다. 이는 사용자가 중동에 대해 물을 때, 컴퓨터가 단순히 정보를 검색하는 것이 아니라, 학습 과정에 내재된 가설들을 바탕으로 하나의 이야기를 구성한다는 것을 의미합니다. 수십 년 동안 학자들은 동양에 대해 이야기를 전달하는 특정한 방식, 즉 '오리엔탈리즘'이라 알려진 방식을 설명해 왔습니다. 이것은 단순히 무례하거나 고정관념을 사용하는 것에 관한 문제가 아닙니다. 그것은 서구를 정상적이고 능동적인 관찰자로, 동양을 서구의 규칙에 의해 설명되어야 하는 수동적이고 신비로운 대상으로 취급하는 더 깊고 구조적인 서술 습관입니다. 이는 서구의 아이디어를 보편적 진리로 간주하는 반면, 현지의 아이디어는 단지 '문화적 특이점'으로 치부하는 것을 전제로 합니다. 연구자들이 현재 던지는 질문은, 수억 명의 사람들에게 주요한 정보원으로 자리 잡은 현대 인공지능이, 설령 예의 바르게 행동하려 할지라도 이러한 오래된 패턴을 조용히 반복하고 있는가 하는 점입니다.
한 연구자가 두 가지 서로 다른 거대 언어 모델을 통해 이 보이지 않는 편향성을 측정하고자 했습니다. 하나는 미국에서 개발된 강력한 시스템이었고, 다른 하나는 상당량의 아랍어 콘텐츠를 학습하여 아랍에미리트(UAE)에서 구축된 모델이었습니다. 연구자는 중동에서 현지 언어와 지역 데이터를 사용하여 인공지능을 구축한다면 자연스럽게 더 공정하고 편향이 적은 관점을 만들어낼 것이라는 희망적인 아이디어를 테스트하고자 했습니다. 답을 찾기 위해, 연구자는 '중동 문화 감수성 점수(Middle East Cultural Sensitivity Score)'라는 새로운 측정 도구를 만들었습니다. 이 도구는 단순히 노골적인 비속어나 나쁜 단어를 찾는 대신, 모델이 생성하는 문장의 구조 자체를 조사했습니다. 연구자는 모델이 중동 전체를 하나의 구별되지 않는 덩어리로 취급하는지, 현지 사람들을 능동적인 의사 결정자가 아닌 수동적인 피해자로 묘사하는지, 그리고 현지 지식을 특별한 정당화가 필요한 것으로 취급하면서 서구의 정치 이론을 사건을 설명하는 기본 방식으로 사용하는지 등 일곱 가지 구체적인 습관을 확인했습니다.
연구자는 280회의 대화를 실행하며 모델들에게 정치, 문화, 역사에 관한 폭넓은 질문을 던졌습니다. 그런 다음 모델들이 이러한 구조적 함정에 얼마나 자주 빠지는지 분석하기 위해 응답을 검토했습니다. 결과에 따르면, 제작 위치와 상관없이 두 모델 모두 이러한 편향된 패턴을 체계적으로 재현했습니다. 미국 모델도 일부 편향성을 보였으나, UAE에서 구축된 모델은 오히려 편향성 척도에서 더 높은 점수를 기록했는데, 이는 해당 모델이 문제적인 패턴을 더 빈번하고 강렬하게 재현했음을 의미합니다. 이 발견은 개발자의 위치를 바꾸거나 학습 데이터에 현지 언어를 추가하는 것만으로는 문제를 해결하기에 충분하다는 가정을 뒤흔듭니다. 연구자는 UAE 모델이 지역적 기원에도 불구하고, 여전히 세상을 설명하는 데 있어 서구적 틀에 크게 의존하며, 이를 모든 것을 바라봐야 하는 표준적인 렌즈로 취급한다는 것을 발견했습니다.
가장 놀라운 발견 중 하나는 연구자가 '세이드 워싱(Said-washing)'이라고 부른 현상이었습니다. 이는 모델이 응답을 시작할 때 해당 지역이 다양하고 복잡하다고 명시적으로 언급하면서도, 곧바로 그 복합성을 무시하는 일반화를 이어갈 때 발생합니다. 예를 들어, 모델은 "물론 중동은 다양한 문화와 역사를 가지고 있습니다"라고 말한 뒤, 즉시 "중동 사회"를 단일한 동기와 단일한 집합을 가진 하나의 통일된 실체로 묘사하며 진행할 수 있습니다. 이 패턴은 미국 모델과의 대화에서 약 88퍼센트, UAE 모델과의 대화에서 약 63퍼센트 나타났습니다. 이는 모델들이 실제로는 사고의 구조를 바꾸지 않으면서도, 감수성을 갖춘 것처럼 보이도록 학습되었음을 시사합니다. 그들은 공정해 보이기 위해 올바른 단어를 사용할 수는 있지만, 정보를 조직하는 방식은 여전히 과거의 식민지적 세계관에 깊이 뿌리박고 있습니다.
또한 이 연구는 편향이 모델이 무엇을 말하는가뿐만 아니라, 세상을 어떻게 조직하는지에 관한 문제임을 밝혀냈습니다. 두 모델 모두 일관되게 서구적 분석 틀을 현실을 이해하는 기본적이고 특징 없는 방식으로 취급한 반면, 비서구적 지식은 특수하고 특별한 설명이 필요한 것으로 취급했습니다. 이것은 두 시스템 모두에서 나타난 가장 일관된 결과였으며, 거의 모든 대화에서 등장했습니다. 연구자는 모델의 성능 차이가 부분적으로는 크기의 차이 때문일 수 있다고 언급했는데, 미국 모델이 UAE 모델보다 훨씬 더 크고 발전된 형태였기 때문입니다. 작은 모델은 더 단순하고 미묘함이 부족한 텍스트를 생성하는 경향이 있으며, 이는 연구자가 측정한 광범위한 일반화처럼 보일 수 있습니다. 그러나 두 모델 모두 서구적 틀을 사용하는 것과 관련하여 동일하게 높은 수준의 편향성으로 수렴했다는 사실은, 문제가 단순히 컴퓨터의 크기나 개발자의 위치에 있는 것보다 더 깊은 곳에 있음을 시사합니다.
결국, 이 논문은 이 편향성이 단순히 더 많은 언어를 추가하거나 서버를 다른 국가로 옮긴다고 해서 해결될 수 있는 단순한 오류가 아니라고 결론짓습니다. 문제는 인식론적인 것, 즉 모델이 학습한 지식의 본질 자체에 관한 문제입니다. 학습 데이터 자체가 중동을 스스로의 주체성을 가진 주체가 아니라 연구 대상인 객체로 취급하는 서구적 관점으로 가득 차 있습니다. 이를 진정으로 바꾸기 위해서, 연구자는 학습 데이터가 해당 지역의 학자들이 자신의 언어와 자신의 지적 전통을 사용하여 쓴 훨씬 더 많은 양의 학술적 성과를 포함하도록 변형되어야 한다고 주장합니다. 데이터가 바뀌지 않는 한, 이 시스템들은 자신감 있고 권위 있게 들리는 답변을 생성하겠지만, 그 이면에는 서구가 서술자가 되고 나머지 세계는 단지 이야기의 소재가 되는 세계관을 조용히 강화하는 작업을 계속할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.