NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
이 논문은 3310 억 개의 토큰으로 구성된 가장 대규모 공개 단일 언어 말뭉치인 Aurora-PT 를 기반으로 훈련된 브라질 포르투갈어용 현대형 인코더 전용 모델인 NorBERTo 를 소개하며, 이는 여러 의미 벤치마크에서 최첨단 성능을 달성하고 하류 NLP 작업에 대한 효율적이고 배포 가능한 솔루션을 제공합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇에게 포르투갈어 이해를 가르치려 한다고 상상해 보세요. 오랫동안 최고의 로봇들은 몇 권의 좋은 책을 읽었지만 전체 도서관을 보지 못한 학생들과 같았습니다. 이 논문은 NorBERTo라는 새로운 로봇과 이를 학습시키는 데 도움이 되는 거대한 새로운 도서관 Aurora-PT를 소개합니다.
그들이 어떻게 했는지 간단히 설명한 이야기입니다:
1. 문제: 로봇이 더 큰 도서관이 필요했습니다
이전까지 최고의 포르투갈어 로봇들 (BERTimbau와 Albertina 등) 은 약 20 억~30 억 개의 '단어'(토큰) 로 구성된 도서관에서 훈련되었습니다. 이는 좋지만, 몇 권의 소설과 사전만 읽어서 언어를 배우려는 것과 같습니다.
저자들은 진정한 지능을 갖춘 로봇을 만들기 위해서는 거대한 도시 크기의 도서관이 필요하다고 깨달았습니다. 그들은 끝없이 이야기를 생성하는 (그리고 사실을 지어내거나 '환각'을 일으키기 쉬운) 거대하고 비싼 슈퍼컴퓨터가 되지 않고도 브라질 포르투갈어의 뉘앙스를 이해할 수 있는 로봇을 원했습니다.
2. 새로운 도서관: Aurora-PT
팀은 Aurora-PT라는 완전히 새로운 텍스트 컬렉션을 구축했습니다.
- 규모: 총 3,310 억 개의 토큰을 포함합니다. 이를 비유하자면, 이전 도서관들이 단일 책장이었다면 Aurora-PT 는 전체 창고와 같습니다. 현재 포르투갈어용으로는 가장 큰 공개 도서관입니다.
- 정제: 그들은 모든 것을 무작정 넣지 않았습니다. 엄격한 사서처럼 행동하여 자동 도구를 이용해 쓰레기, 중복 페이지, 유해 콘텐츠를 제거했습니다. 위키피디아, 블로그, 웹페이지 등 다양한 출처의 고품질이고 깨끗한 텍스트만 남겼습니다.
3. 새로운 로봇: NorBERTo
이 거대한 도서관을 이용해 그들은 NorBERTo라는 새로운 로봇을 훈련시켰습니다.
- 디자인: 로봇을 위한 구식 표준 디자인 대신 ModernBERT라는 현대적인 청사진을 사용했습니다. 이는 자전거에서 고속 전기 자전거로 업그레이드하는 것과 같습니다. 이 디자인은 긴 문장을 읽을 때 혼란을 겪지 않고 정보를 훨씬 빠르게 처리할 수 있는 특수 기능을 갖추고 있습니다.
- 크기: 그들은 두 가지 버전을 만들었습니다. 'Base' 모델 (약 1 억 5 천만 개의 '뇌 세포' 또는 파라미터) 과 'Large' 모델 (약 3 억 9 천 5 백만 개) 입니다.
- 훈련: 그들은 오직 포르투갈어 텍스트만을 사용하여 로봇을 처음부터 훈련시켰습니다. 영어 지식을 바탕으로 시작하여 속임수를 쓰지 않았으며, 오직 Aurora-PT 도서관에서 순수하게 포르투갈어를 배웠습니다.
4. 시운전: 성능은 어땠나요?
팀은 NorBERTo 를 일련의 주행 테스트 (벤치마크) 에 통과시켜 이전 챔피언들과 비교하여 포르투갈어를 얼마나 잘 이해하는지 확인했습니다.
- '논리' 테스트 (텍스트 함의): 로봇에게 두 문장을 보여주고 "두 번째 문장이 첫 번째 문장에서 논리적으로 도출될까요?"라고 묻는 것입니다.
- 결과: NorBERTo(Large) 가 이 부문을 우승하여 이전 최고 모델을 능가했습니다. 이는 현대적인 디자인 + 거대한 도서관 = 더 나은 논리임을 증명했습니다.
- '의미' 테스트 (의미적 유사성): "이 두 문장은 같은 말을 하고 있나요?"라고 묻는 것입니다.
- 결과: 이전 챔피언인 BERTimbau 가 여전히 선두를 유지했습니다. 저자들은 이것이 BERTimbau 가 영어 훈련에서 선제적 이점을 얻었던 반면, NorBERTo 는 처음부터 모든 것을 배워야 했기 때문일 것이라고 설명합니다.
- '개조' 테스트 (MRPC): 로봇이 두 문장이 같은 말을 다른 방식으로 표현한 것인지 구분할 수 있을까요?
- 결과: NorBERTo(Large) 가 경쟁을 압도하여 포르투갈어에서 이 특정 작업에 대해 기록된 최고 점수를 달성했습니다.
5. 주요 교훈
이 논문은 이야기 작성과 같은 거대 AI 모델과 같은 거대하고 비싼 '슈퍼 로봇'이 특정 작업을 잘 수행하기 위해 필요하지 않다고 결론 내립니다.
**거대하고 깨끗한 도서관 (Aurora-PT)**과 **현대적이고 효율적인 디자인 (ModernBERT)**을 결합함으로써 그들은 '골디락스' 로봇을 만들었습니다:
- 너무 작지 않습니다 (이전 모델보다 더 똑똑합니다).
- 너무 크지 않습니다 (거대 AI 보다 저렴하고 빠르게 실행됩니다).
- 이메일 분류, 고객 질문 이해, 검색 엔진이 올바른 답변을 찾도록 돕는 등 실제 세계 작업에 딱 맞습니다.
간단히 말해: 그들은 더 크고 깨끗한 도서관과 더 똑똑하며 효율적인 로봇을 구축하여 포르투갈어 이해를 위해서는 방에서 가장 큰 AI 일 필요가 없다는 것을 증명했습니다. 단지 올바른 도구와 올바른 데이터만 있으면 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.