← 최신 논문
💬 NLP

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

이 논문은 다국어 시각-언어 모델(Vision-Language Models)에서 나타나는 유의미한 철자 편향(orthographic bias)을 정량화하는 첫 번째 벤치마크인 PuMVR을 소개하며, 이 시스템들이 펀잡어의 세 가지 활성 스크립트(구르무키, 샤무키, 로만)에 걸쳐 상당한 성능 격차와 일관되지 않은 추론을 보인다는 점을 입증함으로써, 하나의 언어가 단일한 문자 체계와 동일하다는 가정에 의문을 제기한다.

원저자: Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑하고 다국어를 구사하는 로봇 비서가 있다고 상상해 보세요. 당신이 "나는 펀잡어를 해"라고 말하자, 로봇은 자랑스럽게 "좋아요! 제가 펀잡어로 도와드릴 수 있습니다"라고 답합니다. 하지만 여기 함정이 있습니다. 펀잡어는 단순히 한 가지 방식으로만 쓰이는 것이 아닙니다. 마치 펀잡어가 세 가지 서로 다른 가면을 쓰고 있는 것과 같습니다:

  1. 구르무키(Gurmukhi): 인도에서 사용하는 스크립트 (마치 각진 글꼴 같은 형태).
  2. 샤무키(Shahmukhi): 파키스탄에서 사용하는 스크립트 (마치 흘려 쓰는 필기체 같은 형태).
  3. 로만(Roman): 표준 영어 알파벳으로 쓰는 방식 (예를 들어 "नमस्ते" 대신 "Hello"라고 타이핑하는 것).

이 논문은 현재의 AI 모델들이 일종의 속임수를 쓰고 있다고 주장합니다. 그들은 "하나의 언어 = 하나의 스크립트"라고 가정합니다. 즉, 모델이 구르무키로 된 펀잡어를 안다면, 자동으로 샤무키와 로만 방식의 펀잡어도 알 것이라고 생각합니다. 하지만 이는 틀렸습니다.

저자들은 이를 증명하기 위해 PuMVR(스크립트 전환 장애물 코스라고 생각하세요)이라는 테스트를 구축했습니다. 그들은 375개의 퍼즐(드럼 같은 문화적 물체를 식별하는 것부터 시각적 수수께끼를 푸는 것까지)을 가져와서, 세 가지 스크립트 모두로 동일한 퍼즐을 AI 모델들에게 제시했습니다.

그 결과는 다음과 같았습니다 (쉬운 비유를 사용하여 설명합니다):

1. "스크립트 격차" (사각지대)

AI가 구르무키로 된 퍼즐을 풀 때는 90%의 확률로 정답을 맞힐 수 있습니다. 하지만 동일한 퍼즐을 샤무키로 전달하면, 성능이 60%로 떨어질 수 있습니다.

  • 비유: 어떤 요리사가 영어로 된 레시피로는 완벽하게 요리를 할 수 있지만, 똑같은 레시피가 프랑스어로 적혀 있으면 갑자기 물 끓이는 법조차 잊어버리는 것과 같습니다. 재료(시각적 이미지)와 목표(정답)는 같지만, 지시사항이 적힌 방식이 요리사의 뇌를 고장 낸 것입니다.

2. "시각적 보너스"도 문제를 해결하지 못함

여러분은 이렇게 생각할 수도 있습니다. "음, AI는 그림을 볼 수 있잖아! 그게 도움이 될 거야."
논문은 AI에게 이미지와 텍스트를 함께 제공하여 이를 테스트했습니다.

  • 비유: 이것은 어떤 사람이 모르는 언어로 된 표지판을 읽으려고 애쓰는 동안 지도(이미지)를 건네주는 것과 같습니다. 지도가 조금은 도움이 되겠지만, 표지판을 읽는 법을 가르쳐주지는 않습니다. AI는 그림을 볼 수 있음에도 불구하고 여전히 샤무키 스크립트 때문에 어려움을 겪었습니다. 편향은 해결되지 않았고, 아주 미미한 도움만을 받았을 뿐입니다.

3. "추론의 분리" (정체성 혼란)

연구진은 AI가 문제를 어떻게 해결하는지 보기 위해 "생각하며 말하기(Chain-of-Thought)"를 요청했습니다.

  • 비유: AI가 구르무키로 된 퍼즐을 읽을 때는 "이것은 시크교의 문화적 상징이므로 종교적 단서를 찾아야겠다"라고 생각합니다. 하지만 똑같은 퍼즐을 샤무키로 읽을 때는 갑자기 "이것은 이슬람 문화적 상징이므로 다른 단서를 찾아야겠다"라고 생각합니다.
    AI는 그림에 대해 추론하는 것이 아니라, 글자의 모양에 반응하고 있었습니다. 스크립트 자체가 AI의 전체적인 성격과 전략을 바꾸는 스위치 역할을 한 것입니다.

4. "일관성 점수" (진정한 시험)

논문은 **SCR(스크립트 일관성 비율)**이라는 새로운 점수를 도입합니다.

  • 비유: 수학 시험을 치르는 학생을 상상해 보세요. 만약 그 학생이 Times New Roman 글꼴으로 된 시험에서는 90점을 받지만, Comic Sans 글꼴로 된 시험에서는 60점을 받는다면, 그 학생이 정말 수학을 잘한다고 할 수 있을까요? 아닙니다. 그 학생은 단지 Times New Roman을 읽는 데 능숙할 뿐입니다.
    논문에 따르면 많은 최상위권 AI 모델들의 "일관성 점수"는 충격적으로 낮았습니다(때로는 25%까지 떨어졌습니다). 이는 그들이 다양한 글쓰기 방식을 다루지 못하기 때문에 진정한 의미의 "다국어 구사"를 하지 못하고 있음을 의미합니다.

결론

이 논문의 결론은 우리가 AI가 "다국어 구사"를 한다고 말하며 스스로를 속이고 있다는 것입니다. 사실 AI는 매우 제한적인 방식으로만 "다중 스크립트"를 구사합니다. 만약 여러분이 여러 스크립트를 사용하는 언어(펀잡어, 세르비아어, 쿠르드어 등)를 사용한다면, 여러분의 AI 비서는 한 가지 스크립트에서는 믿을 수 있지만 다른 스크립트에서는 완전히 신뢰할 수 없게 됩니다.

저자들은 AI가 쓸모없다고 말하는 것이 아닙니다. 스크립트를 전환하며 살아가는 수십억 명의 사람들에게 AI가 불확실하다는 점을 지적하는 것입니다. AI를 진정으로 공정하게 만들기 위해서는, 단순히 한 가지 버전의 언어로만 테스트하는 것을 넘어, 사람들이 실제로 사용하는 모든 방식의 언어를 테스트해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →