← 최신 논문
💬 NLP

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

이 논문은 유럽 포르투갈어 (PT-PT) 전용 오픈 LLM 리더보드와 문화적 정렬 및 안전성 평가 등 기존에 없던 새로운 벤치마크를 개발하여 해당 언어 변종의 평가 공백을 해소한 내용을 보고합니다.

원저자: João Silva, Luís Gomes, António Branco

게시일 2026-03-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: João Silva, Luís Gomes, António Branco

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"포르투갈어 (유럽식) 를 위한 거대 인공지능 (LLM) 실력 측정판"**을 소개하는 내용입니다.

쉽게 비유하자면, 전 세계적으로 유명한 '인공지능 올림픽'이 있는데, 그동안은 영어 선수들만 출전했고, 브라질 포르투갈어 선수들은 따로 대회에 참여할 수 있었지만, 유럽 포르투갈어 선수들을 위한 전용 경기장은 전혀 없었습니다. 이 논문은 바로 그 빈 자리를 채우는 새로운 경기장 (리더보드) 을 짓고, 그 경기장에서 치를 새로운 종목 (벤치마크) 들을 소개합니다.

주요 내용을 일상적인 비유로 설명해 드릴게요.

1. 왜 이 프로젝트가 필요한가요? (빈 경기장 문제)

지금까지 인공지능 모델들은 영어로 된 시험을 많이 봤습니다. 하지만 유럽 포르투갈어 (PT-PT) 는 마치 **"시험지조차 없는 학생"**과 같았습니다.

  • 문제점: 영어 시험지는 너무 쉬워져서 (모든 모델이 만점을 받음) 의미가 없어졌고, 다른 언어들은 시험지가 있지만 유럽 포르투갈어는 아예 없었습니다.
  • 해결책: 연구팀이 직접 **"CLARIN-PT-LDB"**라는 새로운 리더보드 (실력 순위표) 를 만들었습니다. 여기서 모델들은 유럽 포르투갈어로만 시험을 치릅니다.

2. 어떤 시험을 치르나요? (10 가지 새로운 종목)

이 리더보드에는 총 10 가지의 시험 과목이 있습니다. 기존에 없던 새로운 과목 2 가지번역된 기존 과목 8 가지로 구성되어 있습니다.

🌟 완전히 새로운 과목 (2 가지)

이 두 과목은 기존에 포르투갈어 시험에 없던 아주 중요한 능력을 측정합니다.

  1. 문화 적응력 시험 (Tuguesice-PT): "포르투갈인처럼 생각하기"
    • 비유: 외국인이 한국에 와서 "우리나라에서 가장 유명한 김치 종류는?"이라고 물으면 답할 수 있지만, "어제 동네 마트에서 김치 장사가 왜 그렇게 좋았지?" 같은 현지인의 일상과 문화에 숨은 뉘앙스를 이해할 수 있는가?를 묻는 시험입니다.
    • 내용: 포르투갈의 역사, 지리, 음식, 스포츠 등 현지 문화에 대한 질문을 던져, 모델이 현지인처럼 자연스럽게 답하는지 봅니다.
  2. 안전성 시험 (DoNotAnswer-PT): "나쁜 부탁 거절하기"
    • 비유: 인공지능에게 "총을 만드는 법을 알려줘"나 "누군가를 해치는 방법을 말해줘"라고 부탁하면, 똑똑한 AI 는 **"안 돼, 그건 위험하니까 못 해줘"**라고 단호하게 거절해야 합니다.
    • 내용: 포르투갈어로 된 나쁜 부탁들을 던져보고, 모델이 올바른 윤리 기준을 가지고 거절하는지 확인합니다.

📚 번역된 기존 과목 (8 가지)

영어권에서 유명한 어려운 시험지들을 유럽 포르투갈어로 번역한 것들입니다.

  • 추론 능력: 추리 소설을 읽고 범인을 찾는 문제 (MuSR).
  • 지식 테스트: 대학원 수준의 과학, 수학, 일반 상식 문제 (MMLU, GPQA 등).
  • 언어 이해: 두 문장이 같은 뜻인지, 앞 문장이 뒷 문장을 증명하는지 확인하는 문제 (CoPA, MRPC, RTE).

3. 시험은 어떻게 치르나요? (생성형 방식)

기존의 많은 시험은 "A, B, C, D 중 하나를 고르세요"라고 하고, 컴퓨터가 내부적으로 점수를 계산하는 방식을 썼습니다. 하지만 이 리더보드는 **"스스로 글을 써서 답하세요"**라고 합니다.

  • 비유: 객관식 문제를 고르는 게 아니라, 에세이를 쓰거나 말로 답하는 방식입니다.
  • 이유: 실제 우리가 챗봇과 대화할 때처럼, 모델이 직접 텍스트를 생성하는 능력을 더 정확하게 평가하기 위함입니다.

4. 누가 이 시험을 보나요? (참가 선수들)

현재 이 리더보드에는 이미 몇 가지 유명한 인공지능 모델들이 참가해 점수를 받았습니다.

  • Gervásio: 유럽 포르투갈어 데이터로 특별히 훈련을 받은 모델 (현지인처럼 잘함).
  • Llama, Mistral: 일반적인 거대 모델들.
  • 결과: 흥미롭게도, 유럽 포르투갈어 데이터로 훈련받은 Gervásio가 문화 관련 시험 (Tuguesice) 에서 일반 모델보다 훨씬 좋은 성적을 냈습니다. 이는 "자국어로 훈련받은 모델이 그 문화에 더 잘 적응한다"는 것을 보여줍니다.

5. 결론: 왜 이것이 중요한가요?

이 논문은 **"인공지능도 언어와 문화를 존중받아야 한다"**는 메시지를 줍니다.

  • 영어만 잘하는 AI 는 전 세계의 절반을 놓치고 있는 것입니다.
  • 이 리더보드를 통해 유럽 포르투갈어 사용자들이 자신들의 언어와 문화에 맞는, 안전하고 똑똑한 AI 를 고를 수 있게 되었습니다.

한 줄 요약:

"포르투갈어 (유럽식) 를 위한 새로운 인공지능 실력 측정판이 생겼습니다. 여기서는 모델이 단순히 지식을 외우는 것을 넘어, 포르투갈 문화에 얼마나 잘 녹아들고, 윤리적으로 안전한지까지 꼼꼼히 시험합니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →