← 최신 논문
💬 NLP

P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs

이 논문은 전문가가 큐레이션한 벤치마크이자 평가 프레임워크인 P3B3를 소개하며, 이것이 현재 대규모 언어 모델들이 유럽 포르투갈어보다 브라질 포르투갈어에 대해 상당한 편향을 보이고 있음을 드러내고 더욱 균형 잡힌 다국어 표현의 시급한 필요성을 강조한다고 밝히고 있습니다.

원저자: Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rafael Ferreira, Inês Vieira, Inês Calvo, James Furtado, Iago Paulo, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 포르투갈어를 구사하는 매우 똑똑하고 박식한 로봇들(대규모 언어 모델, 즉 LLM) 그룹이 있다고 상상해 보세요. 문제는 포르투갈어가 단 하나의 목소리가 아니라는 점입니다. 마치 두 개의 매우 뚜렷한 사촌 관계인 유럽 포르투갈어(포르투갈에서 사용)와 브라질 포르투갈어(브라질에서 사용)처럼 말이죠.

그들은 같은 성을 공유하지만, 말하는 방식은 다릅니다. 같은 사물에 대해 서로 다른 단어를 사용하고(예: "bus" vs "autocarro"), 서로 대화하는 방식도 다르며, 문장을 구성하는 방식도 독특합니다.

문제점: "브라질 편향성"

이 논문의 연구자들은 이상한 점을 발견했습니다. 인터넷에는 브라질에서 생성된 텍스트가 넘쳐나기 때문에, 이 로봇들은 유럽 포르투갈어보다 브라질 포르투갈어를 훨씬 더 많이 읽었다는 것입니다. 이는 마치 어떤 학생이 한 가지 방언으로 된 교과서만 읽은 것과 같습니다. 그래서 그들이 말을 하려고 할 때, 설령 반대편 대양 너머에 있는 사람과 대화하고 있더라도 의도치 않게 특정 지역의 말투를 내게 되는 것입니다.

연구팀은 알고 싶었습니다: 이 로봇들에게도 '최애 사촌'이 있을까? 그리고 만약 우리가 "유럽 스타일로 말해줘"라고 말한다면, 그들은 실제로 그렇게 할 수 있을까?

해결책: P3B3 ("액센트 테스트")

연구진은 P3B3라고 불리는 특별한 테스트를 만들었습니다. 이것을 언어에 대한 "블라인드 맛 테스트"라고 생각하면 됩니다.

  • 설정: 그들은 단순히 로봇에게 "버스가 뭐야?"라고 묻지 않았습니다(이는 특정 답변을 유도할 수 있기 때문입니다). 대신, 교통이나 미용 제품과 같은 일상적인 주제에 대해 자연스러운 다회차 대화를 생성했습니다.
  • 트릭: 질문들은 "다양성 중립적(variety-agnostic)"으로 설계되었습니다. 즉, 질문이 어떤 액센트를 사용해야 하는지에 대한 힌트를 주지 않았다는 뜻입니다. 이는 마치 "리스본에서" 혹은 "상파울루에서"라는 말을 붙이지 않고, 그냥 "가게에 어떻게 가나요?"라고 묻는 것과 같습니다.
  • 목표: 그들은 로봇이 자연스럽게 무엇을 말할지 보고 싶었습니다. 로봇은 자신이 가장 많이 읽은 브라질 액센트로 기본 설정되어 말할까요? 아니면 요청을 받았을 때 모드를 전환할 수 있을까요?

측정 방법

연구진은 로봇의 답변을 채점하기 위해 두 가지 방법을 사용했습니다:

  1. "문법 경찰" (분류기): 포르투갈 또는 브라질에 속하는 특정 단어와 문법 규칙을 찾아내도록 훈련된 컴퓨터 프로그램입니다.
  2. "전문가 심판" (LLM-as-Judge): 매우 똑똑한 AI인 Gemini를 사용하여 답변을 읽고 인간 언어학자처럼 행동하게 하여, 0점(순수 브라질어)에서 10점(순수 유럽 포르투갈어)까지 점수를 매기고 그 이유(예: "그들은 'autocarro' 대신 'ônibus'라는 단어를 사용했습니다")를 설명하게 했습니다.

발견한 내용

결과는 마치 출연자들이 자신의 출신 성분을 숨기기 어려워하는 리얼리티 TV 쇼와 같았습니다:

  • 기본 모드: 아무런 지시가 없을 때, 거의 모든 로봇은 자연스럽게 브라질 포르투갈어로 말했습니다. 그것이 그들의 "편안한 구역"이었습니다. 유럽 언어를 사용하도록 특별히 훈련받은 로봇(예: AMALIA)만이 일관되게 유럽 액센트를 유지할 수 있었습니다.
  • "전환" 테스트: 연구진이 명시적으로 "브라질식으로 말해줘"라고 요청했을 때, 대부분의 로봇은 훌륭하게 수행했습니다. 하지만 "유럽식으로 말해줘"라고 했을 때는 훨씬 어려워했습니다. 많은 로봇이 일관성을 유지하는 데 어려움을 겪었습니다. 그들은 유럽식으로 말하기 시작했지만, 몇 문장 후에 실수로 브라질식 단어나 문법으로 되돌아갔습니다.
  • 크기의 차이: 더 새롭고, 크고, 강력한 로봇일수록 지시를 따르고 액센트를 전환하는 능력이 더 좋았습니다. 하지만 가장 뛰어난 로봇들조차 긴 대화 도중에는 가끔 브라질의 뿌리로 돌아가는 모습을 보였습니다.

큰 그림

이 논문은 AI 모델들이 발전하고는 있지만, 훈련 데이터로 인해 여전히 강한 "브라질 편향성"을 가지고 있다고 결론짓습니다. 이들은 브라질 캐릭터를 연기하는 데는 뛰어나지만, 감독이 요청하더라도 전체 연극 내내 유럽 캐릭터를 유지하는 데는 어려움을 겪는 배우들과 같습니다.

연구진은 개발자들이 향후에 자신들의 로봇이 모든 포르투갈어 사용자에게 더 균형 잡히고 공정해지고 있는지 확인할 수 있도록 이 테스트(P3B3)를 구축했습니다. 이를 통해 리스본의 사용자가 리우데자네이루의 사용자만큼이나 고품질의 문화적으로 정확한 경험을 누릴 수 있도록 보장하고자 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →