← 最新の論文
💻 computer science

Language Models for Portuguese: A Systematic Mapping Study

本論文は、ポルトガル語向けに開発された46の言語モデルに関する系統的なマッピング調査を提示するものであり、今後の分野の進展を導くために、それらの技術的特性、進化の関係、および現在の研究上の空白に関する包括的な概要を提供するものである。

原著者: Jhessica Silva, Carlos Caetano, Helena Maia, Breno Bernard Nicolau de França, Sandra Avila, Helio Pedrini

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Jhessica Silva, Carlos Caetano, Helena Maia, Breno Bernard Nicolau de França, Sandra Avila, Helio Pedrini

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、あらゆる本が異なる言語で書かれた、巨大で賑やかな図書館だと想像してみてください。長い間、この図書館における最も賢いコンピュータたち――人間のように読み、書き、会話ができるもの――は、主に英語の本で学習されてきました。彼らは英語に関しては驚くほど流暢になりましたが、他の土地の物語について尋ねると、しばしばつまずいたり、混乱したり、あるいは単に作り話をしたりしました。これは、これらのコンピュータの「脳」は、彼らが読んだ言葉によって構築されているからです。もし特定の言語の書物を十分に読んでいなければ、その言葉の背後にある文化やジョーク、歴史を真に理解することはできません。最近、科学者たちは、ブラジル、ポルトガル、そしてアフリカやアジアの一部で何億人もの人々が話す言語であるポルトガル語のための、特別なコンピュータを構築し始めました。しかし、本が散乱している図書館のように、これらの新しいポルトガル語コンピュータに関する情報は、乱雑で、隠されており、一度にすべてを見つけ出すのが困難です。

この論文は、ポルトガル語のセクション全体を整理整頓しようと決めた、超組織的な司書のようなものです。著者たち(ブラジルの大学のチーム)は、2020年から2025年の間に発表された、ポルトガル語を話すように設計されたあらゆるコンピュータモデルを見つけ出すという、大規模な捜索を行いました。彼らは単に数を数えただけではありません。箱を開け、マニュアルをチェックし、それらがどのように作られ、何を教えられ、実際に使えるものなのかを解明しようとしました。彼らは、一般的なチャットボットから、法律、医学、あるいは石油・ガスについてのみ話す専門家まで、46種類の異なるモデルを見つけ出しました。彼らの大きな発見は何でしょうか? それは、刺激的な進歩は多くあるものの、「図書館」はいまだに少し混沌としているということです。多くのモデルは、シェフしか知らない秘密のレシピ(コードが共有されていない)のようであり、中には現地の風味を完全には捉えきれない翻訳された本を使って教えられたものもあり、さらに、それらが公平であるか、あるいは安全に使用できるかをチェックしたモデルは極めてわずかでした。著者たちは、これらのコンピュータをポルトガル語を話すすべての人にとって真に役立つものにするためには、翻訳に頼るのをやめ、設計図をもっとオープンに共有し、そしてコンピュータが単に最も人気のあるバージョンだけでなく、言語の豊かな多様性を理解するようにする必要があると提案しています。

ポルトガル語AIの大捜索

人工知能(AI)の世界を、巨大な建設現場だと考えてみてください。長年、最も大きく印象的な高層ビルは、英語のレンガを使って建てられてきました。これらは「大規模言語モデル(LLM)」、つまりエッセイを書いたり、質問に答えたり、さらにはコードを書いたりすることもできる賢いコンピュータです。しかし、この現場の作業員たちは、英語のレンガだけで家を建てても、ポルトガル語を話す人が「我が家」と感じられるような家を建てることはできないと気づきました。そこで、2020年から2025年の間に、ポルトガル語話者のために特別に設計された家を建設する、新しい建設の波が押し寄せました。

問題は、これらの新しい家が地図上のいたるところに散らばっていたことでした。あるものは豪華な学術誌に記載され、あるものはウェブサイト上の単なるメモであり、またあるものは誰も読まない技術報告書の中に隠されていました。それはまるで、おもちゃがさまざまな山に投げ込まれ、ラベルが付いているものもあれば付いていないものもある部屋の中で、特定のおもちゃを探そうとするようなものでした。この論文の著者たちは、その部屋を片付けることに決めました。彼らは「系統的マッピング研究」を行いました。これは、彼らが発見できたすべてのポルトガル語モデルのマスターリストを作成した、という格好の良い言い方です。

彼らは合計で46のモデルを見つけました。それは実に多くの異なるコンピュータです! 彼らは、コレクターが切手を分類するように、それらを仕分けました。それぞれのモデルがどのような「ベースモデル」(それがBERT、Llama、またはT5といった基礎の上に築かれているか)から始まり、どのような目的(一般的なチャット、法的助言、医学的診断、あるいはツイートの分析)のために設計され、どの程度の規模(1,200万個のパラメータを持つ極小のものから、720億個のパラメータを持つ巨大なものまで)であるかを調べました。

ポルトガル語AIの「家系図」

著者たちがした最も素晴らしいことの一つは、「系統樹」を描いたことです。AIモデルの家系図を想像してみてください。人間が祖父母とどのように親族関係にあるかを示す代わりに、この樹は、これらのAIモデルが彼らの「親」とどのように関係しているかを示しています。

彼らは、ほとんどのポルトガル語モデルが、いくつかの有名な「祖先」モデルの末裔であることを発見しました。最大の家系はBERTから来ており、これはこれら多くのモデルの曽祖父のような存在です。彼らが見つけた46モデルのうち、20モデルがBERTまたはその親戚の上に直接構築されていました。二番目に大きい家系はLlamaファミリーであり、これは10のモデルが基づいている、新しく流行の祖先です。

この樹は、これらのモデルがいかに進化したかも示しています。一部は汎用的なコンピュータ(あらゆることに優れている)として始まり、その後、特定の分野の専門家になるための専門的な訓練を受けました。例えば、あるモデルが一般的な読者として始まり、その後、心臓医となるために医学の教科書を学び、「CardioBERTpt」となり、さらに別のバージョンが法律文書を学んで弁護士となる「JurisBERT」になった、という枝分かれがあります。これは、一般の学校からスタートして、その後、医者や弁護士になるために専門学校へ行く学生のようなものです。

「開かれた扉」の問題

著者たちはまた、これら46軒の家のドアをチェックして、誰かが中に入れるかどうかを確認しました。彼らは3つのことを調べました。

  1. コード: 設計図を見ることができますか?
  2. モデル: 完成したコンピュータの脳をダウンロードできますか?
  3. データ: コンピュータが学習した本を見ることができますか?

ここでのニュースは、少し複雑です。46のモデルのうち、ソースコード(設計図)が誰にでも公開されていたのはわずか11でした。約5つのモデルは完全にロックアップされており、全く使用することができませんでした。そして学習データ(本)については、わずか17のモデルが、自由にダウンロード可能なデータを使用していました。残りは、ペイウォールの後ろに隠されていたり、特別な許可を求める必要があったり、あるいはそれを作った企業によって秘密にされていたりするデータを使用していました。

著者たちは、これらのモデルに「モデルカード」が付いているかどうかも確認しました。これはAIの「栄養成分表示」のようなものです。そのモデルが得意なこと、苦手なこと、そしてバイアス(偏り)があるかどうかを教えてくれます。驚くべきことに、46モデルのうち、完全で完璧な栄養成分表示を持っていたのはわずか3でした。ほとんどは未完成のラベルであり、10はラベルすらありませんでした。これは、これらのモデルを使用する場合、自分が一体何に踏み込もうとしているのかを正確に把握できない可能性があることを意味します。

「翻訳の罠」と失われた声

最も重要な発見の一つは、これらのモデルが「どのように」言葉を学んだかについてです。著者たちは、多くのモデルが英語からポルトガル語へと翻訳された本を使って教えられていることに気づきました。ブラジル文化について学ぶために、ニューヨークで書かれ、その後、逐一翻訳された本を読んでいる状況を想像してみてください。文法は正しくなるかもしれませんが、スラングやジョーク、そして現地の感覚を逃してしまうでしょう。

論文は、翻訳されたデータに依存することは問題であると示唆しています。それは、これらのモデルがブラジルやポルトガル、あるいはアフリカのポルトガル語話者特有の文化的ニュアンスを理解できない可能性があることを意味します。さらに、著者たちは、彼らが見つけたほとんどすべてのモデルが、ポルトガル語の2つのバージョン、すなわちブラジル・ポルトガル語と欧州ポルトガル語のみに焦点を当てていることを指摘しています。彼らは、アンゴラ、モザンビーク、カーボベルデといった、ポルトガル語を公用語とする他の7カ国を完全に無視しています。著者たちは、これは「言語的偏見」の一形態であると主張しています。つまり、モデルがブラジルやポルトガルのポルトガル語を話せるからといって、その言語を話す「すべての人」を代表できると想定することです。彼らは、将来のモデルは、ポルトガル語を話すすべての国の多様性を真に代表するデータを用いて訓練される必要があると述べています。

次は何が行われるのか?

著者たちは、私たちは多くの進歩を遂げてきたものの、まだ道のりは長いと結論づけています。彼らは、次世代のポルトガル語AIには以下のことが必要であると示唆しています。

  • 翻訳されたデータを使うのをやめ、世界中の本物の、オリジナルのポルトガル語の本や会話を使用すること。
  • 設計図(コード)を共有し、他の科学者が彼らの成果を検証し、改善できるようにすること。
  • より多くの声を取り入れること。ブラジルやポルトガルだけでなく、アフリカやアジアのポルトガル語話者の声を含めることです。
  • より多くの感覚を加えること。 現在、これらのモデルのほとんどはテキストのみを理解しています。著者たちは、ポルトガル語に特化した、画像や音を理解できる(マルチモーダルな)モデルを構築できる大きな機会があると考えています。例えば、ブラジルの街並みの写真を撮り、それを現地のスラングで説明できるコンピュータのようなものです。

要約すると、ポルトガル語AIのライブラリは急速に成長していますが、言語を話す何百万もの人々に真に奉仕するためには、より優れた組織化、より開かれた扉、そしてより幅広い多様な声が必要なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →