NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
本論文は、3310 億トークンの最大規模のオープン利用可能単一言語コーパス(Aurora-PT)を用いて訓練されたブラジルポルトガル語向けの現代エンコーダのみのモデルである NorBERTo を紹介するものであり、これは複数の意味ベンチマークにおいて最先端の性能を達成し、下流の NLP タスクに対して効率的かつ展開可能なソリューションを提供する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにポルトガル語を理解させる方法を想像してみてください。長らく、最優秀なロボットは、いくつかの良書を読んだものの、図書館全体を見たことのない学生のような存在でした。この論文は、NorBERToという新しいロボットと、その学習を支援する壮大な新しい図書館Aurora-PTを紹介しています。
彼らがどのようにしてこれを実現したか、その物語を簡単に説明しましょう。
1. 課題:ロボットにはより大きな図書館が必要だった
それ以前、最高のポルトガル語ロボット(BERTimbauやAlbertinaなど)は、約 20 億から 30 億の「単語」(トークン)を含む図書館で訓練されていました。それは良いことでしたが、数冊の小説と辞書を読んで言語を学ぼうとするようなものです。
著者らは、真に賢いロボットを作るためには、巨大な都市ほどの規模の図書館が必要だと気づきました。彼らは、無限の物語を生成する(それは事実を捏造したり、「幻覚」を起こしたりしやすい)巨大で高価なスーパーコンピュータにならなくても、ブラジルポルトガル語のニュアンスを理解できるロボットを構築したいと考えていました。
2. 新しい図書館:Aurora-PT
チームは、新しいテキストのコレクションであるAurora-PTを構築しました。
- 規模: 含まれるトークンは3310 億です。これを例えるなら、古い図書館が単一の本棚だったとすれば、Aurora-PT は丸ごと一つの倉庫です。これは現在、ポルトガル語において同種の最大規模のオープン図書館です。
- クリーニング: 彼らは単に何でもかんでも詰め込んだわけではありませんでした。厳格な司書のように行動し、自動ツールを使ってゴミ、重複ページ、有害なコンテンツを排除しました。ウィキペディア、ブログ、ウェブページなど、多様なソースから高品質でクリーンなテキストのみを保持しました。
3. 新しいロボット:NorBERTo
この壮大な図書館を用いて、NorBERToという新しいロボットを訓練しました。
- 設計: 従来の標準的なロボット設計を使う代わりに、ModernBERTと呼ばれる現代的な設計図を採用しました。これは、自転車から高速電動自転車へアップグレードするようなものです。これには、長い文を読んでも混乱せず、情報をはるかに高速に処理できる特別な機能があります。
- サイズ: 2 つのバージョンを構築しました。「Base」モデル(約 1 億 5000 万の「脳細胞」またはパラメータ)と「Large」モデル(約 3 億 9500 万)です。
- 訓練: 彼らは、ポルトガル語のテキストのみを使用して、ロボットを一から訓練しました。英語の知識からスタートして不正をするのではなく、Aurora-PT 図書館から純粋にポルトガル語を学びました。
4. 試運転:パフォーマンスはどのようだったか
チームは、NorBERTo を一連の運転テスト(ベンチマーク)にかけ、旧王者と比較してどの程度ポルトガル語を理解しているかを確認しました。
- 「論理」テスト(テキスト含意): ロボットに 2 つの文を見せて、「2 番目の文は 1 番目の文から論理的に導かれますか?」と尋ねると想像してください。
- 結果: NorBERTo(Large)がこの部門で勝利し、以前の最高モデルを破りました。これは、現代的な設計+巨大な図書館=より優れた論理であることを証明しました。
- 「意味」テスト(意味的類似性): 「これら 2 つの文は同じことを言っていますか?」と尋ねると想像してください。
- 結果: 旧王者である BERTimbau がここで依然としてリードしていました。著者らは、これはおそらく BERTimbau が英語訓練からのスタートダッシュがあったのに対し、NorBERTo はゼロからすべてを学ばなければならなかったためだと説明しています。
- 「言い換え」テスト(MRPC): ロボットは、2 つの文が単に同じことを異なる方法で言っているかどうかを判断できますか?
- 結果: NorBERTo(Large)は競合他社を圧倒し、ポルトガル語におけるこの特定のタスクで過去最高得点を記録しました。
5. 大きな教訓
この論文は、物語を書くような巨大な AI モデルのような巨大で高価な「スーパーロボット」がなくても、特定の仕事をうまく遂行できることを結論付けています。
巨大でクリーンな図書館(Aurora-PT)と現代的で効率的な設計(ModernBERT)を組み合わせることで、彼らは「金髪姫」のようなロボットを創造しました。
- 小さすぎません(古いモデルよりも賢いです)。
- 大きすぎません(巨大な AI よりも安価で高速に実行できます)。
- メールを分類したり、顧客の質問を理解したり、検索エンジンが正しい答えを見つけるのを助けたりする、現実世界のタスクにはちょうど良いサイズです。
要約すると: 彼らはより大きくてクリーンな図書館と、より賢く効率的なロボットを構築しました。これは、ポルトガル語を理解するために部屋で最大の AI である必要はなく、正しいツールと正しいデータが必要だけであることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。