← 최신 논문
💬 NLP

Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages

본 논문은 비서구 문화와 관련된 다국어 대형 언어 모델의 심각한 문화적 편향과 맥락 이해 격차를 평가하고 드러내기 위해 9 개 아시아 언어로 구성된 19,000 개 이상의 주석된 개체와 2,000 개의 마스킹된 문맥을 포함하는 벤치마크인 Camellia 를 소개합니다.

원저자: Tarek Naous, Anagha Savit, Carlos Rafael Catalan, Geyang Guo, Jaehyeok Lee, Kyungdon Lee, Lheane Marie Dizon, Mengyu Ye, Neel Kothari, Sahajpreet Singh, Sarah Masud, Tanish Patwa, Trung Thanh Tran, Zo
게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tarek Naous, Anagha Savit, Carlos Rafael Catalan, Geyang Guo, Jaehyeok Lee, Kyungdon Lee, Lheane Marie Dizon, Mengyu Ye, Neel Kothari, Sahajpreet Singh, Sarah Masud, Tanish Patwa, Trung Thanh Tran, Zohaib Khan, Alan Ritter, Tanmoy Chakraborty, Yuki Arase, Keisuke Sakaguchi, JinYeong Bak, Wei Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 세계를 많이 누빈 로봇들 (대형 언어 모델, 또는 LLM) 이 한 무리 있다고 가정해 봅시다. 이 로봇들은 인터넷에 있는 거의 모든 것을 읽었고 여러 언어를 구사할 수 있습니다. 그들이 그렇게 많은 것을 읽었기 때문에 모든 문화를 동등하게 잘 이해할 것이라고 생각할지도 모릅니다. 하지만 '카멜리아 (Camellia)'라는 이 논문은 사실 이 로봇들이 특히 아시아 문화와 관련하여 상당히 편향되어 있음을 시사합니다.

다음은 일상적인 비유를 사용하여 연구자들이 무엇을 했는지와 무엇을 발견했는지 간단히 정리한 내용입니다.

문제: "서구적 렌즈"

이 AI 로봇들을 뉴욕과 런던에서 대부분의 시간을 보낸 관광객이라고 생각해 보세요. 그들은 그 장소들을 속속들이 잘 알고 있습니다. 하지만 시골 인도의 마을이나 서울의 한 neighborhoods 에 대해 물어보면 때때로 혼란을 겪습니다. 맥락이 명확히 아시아적인 경우에도 뉴욕에서 통하는 것이 "기본"이거나 "올바른" 답변이라고 가정할 수 있습니다.

연구자들은 다음과 같은 점을 알고 싶어 했습니다: 이 로봇들이 아시아의 이름, 음식, 장소를 서구적인 것과 동등한 존중과 이해로 대우할까요?

도구: "카멜리아" 테스트

이를 알아내기 위해 팀은 '카멜리아'라는 거대한 테스트를 구축했습니다. 카멜리아를 방대한 다국어 "차이점 찾기" 게임이라고 생각하세요.

  • 참가자: 그들은 네 가지 인기 있는 AI 모델 (Llama, Qwen, Aya, Gemma) 을 테스트했습니다.
  • 언어: 중국어, 일본어, 한국어, 힌디어, 우르두어 등 6 개의 뚜렷한 문화를 아우르는 9 개 아시아 언어에 집중했습니다.
  • 데이터: 그들은 두 가지 주요 항목을 만들었습니다:
    1. 19,530 개 항목 목록: 이름, 음식, 음료, 도시, 스포츠 팀이 포함됩니다. 모든 언어에 대해 "서구" 버전 (예: "Lasagna" 또는 "New York") 과 "아시아" 버전 (예: "Biryani" 또는 "Seoul") 을 모두 포함하도록 했습니다.
    2. 2,173 개의 "빈칸 채우기" 이야기: 소셜 미디어의 실제 문장을 가져와 중요한 단어 (개체) 를 [MASK] 토큰 뒤에 숨겼습니다.
      • 예시: "한국에 가면 반드시 [MASK] 을 (를) 맛봐야 합니다." (정답은 피자 같은 것이 아니라 한국 요리여야 합니다).

그들이 플레이한 세 가지 게임

연구자들은 AI 가 얼마나 편향되었는지 보기 위해 세 가지 다른 게임을 하도록 요청했습니다:

1. "문화적 적합성" 게임 (맥락 적응)

  • 설정: AI 는 특정 문화에 대한 문장 (예: 한국 축제에 대한 이야기) 을 보고 누락된 단어를 추측해야 합니다.
  • 테스트: AI 가 한국 이름/음식을 추측할까요, 아니면 실수로 서구적인 것을 추측할까요?
  • 결과: AI 는 어려움을 겪었습니다. 약 30% 에서 40% 의 경우에, 이야기가 명확히 아시아 문화에 관한 것임에도 로봇은 서구적인 항목을 추측했습니다. 마치 도쿄의 관광객이 초밥을 주문하려다가 "버거"가 기본 음식이라고 생각하여 실수로 햄버거를 요청하는 것과 같습니다.

2. "무드 링" 게임 (감정 연관성)

  • 설정: AI 는 숨겨진 단어가 포함된 문장을 읽고 그 문장이 행복한지, 슬픈지, 중립적인지 추측해야 합니다.
  • 테스트: AI 는 서구적인 이름이 포함된 문장이 더 부정적이라고 생각할까요, 아니면 아시아적인 이름이 포함된 문장이 더 긍정적이라고 생각할까요?
  • 결과: AI 의 "기분"은 이야기 속의 누가 있느냐에 따라 달라졌습니다. 일부 모델은 서구적 개체가 "나쁘다"거나 "부정적"이라고 생각할 가능성이 더 높았으며, 다른 모델들은 아시아적 개체가 "좋다"고 생각했습니다. 마치 주인공의 이름이 외국인 이름이라는 이유만으로 무의식적으로 이야기가 더 슬프다고 느끼는 사람과 같습니다.

3. "보물 찾기" 게임 (추출형 QA)

  • 설정: AI 는 긴 단락을 읽고 그 안에 숨겨진 특정 이름이나 장소를 찾아야 합니다.
  • 테스트: 서구적인 이름만큼 아시아적인 이름도 쉽게 찾을 수 있을까요?
  • 결과: AI 는 아시아적인 이름보다 서구적인 이름을 훨씬 더 잘 찾았습니다. 일부 언어에서는 정확도 격차가 매우 컸습니다 (최대 20%). 마치 유명한 서구 유명인을 군중 속에서 쉽게 찾아내는 탐정이 바로 옆에 서 있는 지역 영웅은 놓치는 것과 같습니다.

왜 이런 일이 일어날까요?

이 논문은 도서관이 어떻게 조직되어 있는지에 비유할 수 있는 몇 가지 이유를 제시합니다:

  • "도서관" 문제: AI 는 인터넷의 데이터로 훈련되었습니다. 인터넷에 아시아 문화보다 서구 문화에 대한 책이 더 많다면, AI 는 서구에 대해 더 많이 배우게 됩니다.
  • "번역기" 문제: AI 는 단어를 조각으로 나누는 도구인 "토크나이저 (tokenizer)"를 사용합니다. 일부 아시아 언어의 경우, AI 의 토크나이저는 약간 흐릿하거나 조각이 빠진 안경과 같습니다. 서구적인 단어만큼 아시아적인 단어를 명확히 "보지" 못하므로 맥락을 이해하기가 더 어려워집니다.
  • "출신" 문제: 중국에서 구축된 모델 (예: Qwen) 은 다른 곳에서 구축된 모델보다 중국어, 일본어, 한국어 작업에서 더 잘 수행했습니다. 이는 로봇이 "태어난" (훈련된) 곳이 매우 중요하다는 것을 시사합니다.

결론

이 논문은 이러한 AI 모델들이 "다국어"라고 하더라도 아직 "다문화"는 아니라고 결론지었습니다. 그들은 종종 서구적인 아이디어를 기본으로 삼고, 아시아적 맥락의 뉘앙스를 이해하는 데 어려움을 겪으며, 아시아적 개체를 서구적인 개체와 다르게 대합니다.

연구자들은 로봇들을 즉시 고치기 위해 카멜리아를 구축한 것이 아니라, 그들이 정확히 어디서 실패하는지 볼 수 있도록 성적표를 주기 위해 구축했습니다. 그들은 이것이 미래 개발자들이 모든 문화를 동등한 공정성과 이해로 대우하는 AI 를 구축하는 데 도움이 되기를 바랍니다.

중요한 참고 사항: 이 논문은 이러한 로봇들이 임상적 의미에서 위험하다고 주장하거나, 지금 당장 특정 실세계 결정에 사용되어야 한다고 주장하지 않습니다. 단순히 "여기 테스트가 있고, 로봇들이 편향되어 있다는 증거가 있습니다. 중요한 작업에 이들을 신뢰하기 전에 이를 수정해야 합니다"라고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →