Language Models for Portuguese: A Systematic Mapping Study
본 논문은 포르투갈어를 위해 개발된 46개의 언어 모델에 대한 체계적 매핑 연구를 제시하며, 향후 이 분야의 발전을 안내하기 위해 기술적 특성, 진화적 관계 및 현재의 연구 공백에 대한 포괄적인 개요를 제공한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 모든 책이 서로 다른 언어로 쓰인 거대하고 북적이는 도서관이라고 상상해 보세요. 오랫동안 이 도서관에서 가장 똑똑한 컴퓨터들, 즉 인간처럼 읽고 쓰고 대화할 수 있는 컴퓨터들은 대부분 영어 책으로 학습되었습니다. 그들은 영어에 매우 능숙해졌지만, 다른 나라의 이야기에 대해 물으면 종종 비틀거리거나 혼란스러워하거나 그냥 지어내곤 했습니다. 이는 이 컴퓨터들의 '두뇌'가 읽은 단어들로 구축되기 때문입니다. 특정 언어로 된 책을 충분히 읽지 못했다면, 그 단어들 뒤에 숨겨진 문화, 농담, 역사를 진정으로 이해할 수 없습니다. 최근 과학자들은 브라질, 포르투갈, 그리고 아프리카와 아시아 일부 지역에서 수억 명의 사람들이 사용하는 언어인 포르투갈어를 위한 특별한 컴퓨터들을 만들기 시작했습니다. 하지만 흩어진 책들이 있는 도서관처럼, 이 새로운 포르투갈어 컴퓨터들에 대한 정보는 어지럽고, 숨겨져 있으며, 한꺼번에 찾기가 어렵습니다.
이 논문은 마치 포르투갈어 구역 전체를 정리하기로 결심한 매우 체계적인 사서와 같습니다. 저자들인 브라질의 한 대학교 팀은 2020년에서 2025년 사이에 발표된 포르투갈어를 말하도록 설계된 모든 컴퓨터 모델을 찾아내는 대대적인 추적 조사를 수행했습니다. 그들은 단순히 개수만 센 것이 아니라, 상자를 열고, 설명서를 확인하고, 그것들이 어떻게 만들어졌는지, 무엇을 배웠는지, 그리고 실제로 사용할 수 있는지 확인했습니다. 그들은 일반적인 챗봇부터 법률, 의료, 또는 석유 및 가스 분야만을 전문적으로 다루는 특화 모델에 이르기까지 총 46개의 서로 다른 모델을 발견했습니다. 그들의 큰 발견은 무엇이었을까요? 흥미로운 진전이 많기는 하지만, 여전히 '도서관'은 다소 혼란스럽다는 것입니다. 많은 모델이 요리사만이 알고 있는 비밀 레시피(코드가 공유되지 않음)와 같으며, 일부는 현지의 맛을 제대로 담아내지 못하는 번역된 책들로 학습되었고, 이 모델들을 사용해도 안전하거나 공정한지 확인된 경우는 매우 드뭅로었습니다. 저자들은 이 컴퓨터들이 포르투갈어를 사용하는 모든 사람에게 진정으로 도움이 되기 위해서는 번역에 의존하는 것을 멈추고, 우리의 청사진을 더 개방적으로 공유하며, 컴퓨터가 가장 인기 있는 버전뿐만 아니라 언어의 풍부한 다양성을 이해하도록 만들어야 한다고 제안합니다.
위대한 포르투갈어 모델 탐색
인공지능(AI)의 세계를 거대한 건설 현장이라고 생각해 보세요. 수년 동안 가장 크고 인상적인 마천루들은 영어 벽돌을 사용하여 지어졌습니다. 이것들이 바로 에세이를 쓰고, 질문에 답하며, 심지어 코드를 작성할 수도 있는 똑똑한 컴퓨터들인 '거대 언어 모델(LLM)'입니다. 하지만 이 현장의 노동자들은 영어 벽돌로만 집을 짓는다면, 포르투갈어를 사용하는 사람들에게 집처럼 느껴지는 집을 지을 수 없다는 사실을 깨달았습니다. 그래서 2020년에서 2025년 사이에, 포르투갈어 화자들을 위해 특별히 설계된 집을 짓는 새로운 건설 물결이 시작되었습니다.
문제는 이 새로운 집들이 지도 곳곳에 흩어져 있다는 것이었습니다. 어떤 것들은 화려한 과학 학술지에 기술되어 있었고, 어떤 것들은 웹사이트의 단순한 메모에 불과했으며, 어떤 것들은 아무도 읽지 않는 기술 보고서 속에 숨겨져 있었습니다. 마치 라벨이 붙어 있거나 붙어 있지 않은 다양한 더미 속에 장난감들이 던져져 있는 방에서 특정 장난감을 찾는 것과 같았습니다. 이 논문의 저자들은 이 방을 정리하기로 결в 결정했습니다. 그들은 '체계적 매핑 연구(systematic mapping study)'를 수행했는데, 이는 멋진 말로 모든 포르투갈어 언어 모델의 마스터 리스트를 만들었다는 뜻입니다.
그들은 총 46개의 모델을 발견했습니다. 정말 많은 종류의 컴퓨터들입니다! 그들은 수집가가 우표를 분류하듯 이 모델들을 분류했습니다. 각 모델이 어떤 '기본 모델'(예를 들어 BERT, Llama, 또는 T5라는 기초 위에서 만들어졌는지)에서 시작했는지, 무엇을 하도록 설계되었는지(일반적인 채팅, 법률 자문, 의료 진단, 또는 트윗 분석), 그리고 규모가 얼마나 큰지(1,200만 개의 파라미터를 가진 아주 작은 모델부터 720억 개의 파라미터를 가진 거대한 모델까지)를 살펴보았습니다.
포르투갈어 AI의 "가계도"
저자들이 한 일 중 가장 멋진 것 중 하나는 "계통 발생 트리(phylogenetic tree)"를 그린 것입니다. AI 모델들을 위한 가계도를 상상해 보세요. 인간이 조부모와 어떻게 연결되는지를 보여주는 대신, 이 트리는 이 AI 모델들이 그들의 '부모'와 어떻게 연결되는지를 보여줍니다.
그들은 대부분의 포르투갈어 모델이 몇몇 유명한 '조상' 모델의 후손이라는 것을 발견했습니다. 가장 큰 가계 가지는 BERT로부터 나오는데, 이는 많은 포르투갈어 모델의 증조할아버지와 같은 존재입니다. 발견된 46개 모델 중 20개가 직접적으로 BERT나 그 친척 모델들을 기반으로 구축되었습니다. 두 번째로 큰 가계는 Llama 가족이며, 이는 10개의 모델이 기반을 두고 있는 새롭고 유행하는 조상입니다.
이 트리는 또한 이 모델들이 어떻게 진화했는지 보여줍니다. 어떤 모델들은 범용 컴퓨터(모든 것에 능숙함)로 시작하여 특정 분야의 전문가가 되기 위해 특화된 훈련을 받았습니다. 예를 들어, 어떤 모델은 일반적인 독자로 시작하여 의학 교과서를 공부하여 'CardioBERTpt'(심장 전문 AI)가 되었고, 또 다른 버전은 법률 문서를 공부하여 'JurisBERT'(변호사 AI)가 되는 가지가 있습니다. 이는 일반 학교에서 시작하여 의사나 변호사가 되기 위해 전문 대학에 가는 학생과 같습니다.
"열린 문" 문제
저자들은 또한 이 46개의 집 문을 열어보고 누구나 들어올 수 있는지 확인했습니다. 그들은 세 가지를 살펴보았습니다:
- 코드: 청사진을 볼 수 있는가?
- 모델: 완성된 컴퓨터 두뇌를 다운로드할 수 있는가?
- 데이터: 컴퓨터가 학습한 책들을 볼 수 있는가?
이 소식은 조금 엇갈립니다. 46개의 모델 중 오직 11개만이 모두가 볼 수 있도록 소스 코드(청사진)를 공개했습니다. 약 5개의 모델은 완전히 잠겨 있어서 아예 사용할 수 없었습니다. 그리고 학습 데이터(책)의 경우, 17개의 모델만이 자유롭게 다운로드할 수 있는 데이터를 사용했습니다. 나머지는 유료 결제가 필요하거나, 특별한 허가를 요청해야 하거나, 혹은 이를 만든 회사에 의해 비밀로 유지되었습니다.
저자들은 또한 이 모델들이 AI의 '영양 성분표'와 같은 '모델 카드(Model Card)'를 갖추고 있는지 확인했습니다. 이것은 모델이 무엇을 잘하고 무엇을 못하는지, 그리고 어떤 편향성을 가지고 있는지를 알려줍니다. 놀랍게도, 46개 모델 중 완전하고 완벽한 영양 성분표를 가진 모델은 단 3개뿐이었습니다. 대부분은 미완성된 라벨을 가지고 있었고, 10개는 라벨이 전혀 없었습니다. 이는 이 모델들을 사용할 때 여러분이 정확히 무엇을 마주하게 될지 모를 수도 있음을 의미합니다.
"번역의 함정"과 사라진 목소리들
가장 중요한 발견 중 중 하나는 이 모델들이 어떻게 말하는 법을 배웠는지에 관한 것입니다. 저자들은 많은 모델이 영어에서 포르투갈어로 번역된 책들을 통해 학습되었다는 점을 주목했습니다. 뉴욕에서 쓰인 책을 단어 그대로 포르투갈어로 번역하여 브라질 문화를 배우려고 노력하는 상황을 상상해 보세요. 문법은 맞출 수 있겠지만, 슬랭, 농담, 그리고 현지의 정서는 놓치게 될 것입니다.
논문은 번역된 데이터에 의존하는 것이 문제라고 제안합니다. 이는 이러한 모델들이 브라질이나 포르투갈, 혹은 아프리카의 포르투갈어 화자들의 고유한 문화적 뉘-앙스를 이해하지 못할 수 있음을 의미합니다. 더욱이, 저자들은 발견된 거의 모든 모델이 브라질 포르투갈어와 유럽 포르투갈어라는 두 가지 버전에만 집중하고 있다고 지적합니다. 그들은 앙골라, 모잠비크, 카보베르데와 같이 포르투갈어가 공용어인 다른 일곱 국가의 목소리를 완전히 무시했습니다. 저자들은 이것이 '언어적 편견'의 형태라고 주장합니다. 즉, 모델이 브라질과 유럽 포르투갈어를 할 줄 안다고 해서, 그 언어를 사용하는 모든 사람을 대변할 수 있다고 가정하는 것입니다. 저자들은 미래의 모델들이 포르투갈어를 사용하는 모든 국가의 다양성을 진정으로 나타내는 데이터로 학습되어야 한다고 제안합니다.
무엇이 다음 단계인가?
저자들은 우리가 많은 진전을 이루었지만, 아직 갈 길이 멀다고 결론짓습니다. 그들은 차세대 포르투갈어 AI가 다음과 같이 되어야 한다고 제안합니다:
- 번역된 데이터 사용을 멈추고, 전 세계의 실제적이고 독창적인 포르투갈어 책과 대화를 사용해야 합니다.
- 청사진(코드)을 공유하여 다른 과학자들이 그들의 작업을 검토하고 개선할 수 있도록 해야 합니다.
- 브라질과 포르투갈뿐만 아니라, 아프리카와 아시아의 포르투갈어 화자들의 더 많은 목소리를 포함해야 합니다.
- 더 많은 감각을 추가해야 합니다. 현재 대부분의 모델은 텍텍스트만 이해합니다. 저자들은 포르투갈어를 위한 특화된 '멀티모달 모델'(이미지와 소리도 이해할 수 있는 모델)을 구축할 수 있는 큰 기회가 있다고 봅니다. 예를 들어, 브라질의 거리 사진을 보고 현지 슬랭으로 묘사할 수 있는 컴퓨터와 같은 것입니다.
요약하자면, 포르투갈어 AI의 도서관은 빠르게 성장하고 있지만, 언어를 사용하는 수백만 명의 사람들에게 진정으로 봉사하기 위해서는 더 나은 조직화, 더 열린 문, 그리고 더 넓은 범위의 목소리가 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.