← 最新の論文
🤖 AI

Toten: Knowledge-Based Ontological Tokenization Of Physical Quantities And Technical Notation In Brazilian Portuguese

本論文は、統計的に導出されたサブワードに代わり、物理量や技術的表記の意味的および構造的な完全性を保持するために宣言的かつオントロジー駆動のアプローチを採用した、ブラジル・ポルトガル語のための知識ベースのオントロジー・トークナイゼーション・フレームワークであるTOTENを紹介し、単位の原子性と数値再構成において最先端のベースラインを上回る優れた性能を実証するものである。

原著者: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Antonio de Sousa Leitão Filho; Allan Kardec Duailibe Barros Filho; Fabrício Saul Lima; Selby Mykael Lima dos Santos; Rejani Bandeira Vieira Sousa

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ブラジル・ポルトガル語で書かれた複雑なエンジニアリング・マニュアルをコンピュータに読ませようとしていると想像してください。そのマニュアルには、「5.2 kN/m²」(キロニュートン毎平方メートル)や「1.5 × 10⁻³ m」といった精密な測定値が満載されています。

問題点: 「ピクセル化された」翻訳者
現代のほとんどのAIモデルは、テキストを読み取るために**バイトペアエンコーディング(BPE)**という手法を使用しています。これは、テキストを断片的な破片として扱う、いわば「バラバラの言葉しか話せない翻訳者」のようなものです。スペースを節約するために、この翻訳者は一般的な書籍での出現頻度に基づいて、単語を恣意的な断片へと細切れにします。

  • もしテキストに「5.2 kN/m²」と書かれていた場合、標準的なBPEトークナイザーは、それを 5, ., 2, k, N, /, m, ² という風に切り刻んでしまうかもしれません。
  • コンピュータにとって、「5.2 kN/m²」は単一の概念ではなく、単なる8つの別々のパズルのピースの集まりに過ぎません。コンピュータは後で、これらをどうやって組み立て直して、それが特定の物理的な力であることを理解するかを推測しなければなりません。これは、文字そのものを見るのではなく、文字の個々のピクセルを見て文章を理解しようとするようなものです。

解決策: TOTEN(「賢い司書」)
著者らは、TOTENと呼ばれる新しいシステムを開発しました。統計に基づいてどのように言葉を切り刻むかを推測するのではなく、TOTENはエンジニアリング用語が「実際に何であるか」についての厳格で形式的なルールブック(オントロジー)を持つ、知識ベースの司書のように振る舞います。

TOTENの仕組みを、簡単な比喩を用いて説明します:

  1. ルールブック(オントロジー): テキストを読み始める前に、TOTENにはエンジニアリングのルールが書かれた辞書があらかじめ用意されています。それは「kN」が力の単位であり、「m²」が面積であり、「5.2」が数値であることを知っています。推測するのではなく、定義を暗記しているのです。
  2. 3人の専門家アシスタント(オラクル): TOTENは、あらゆるタイポ(誤字)や記号を暗記しようとはしません。代わりに、3人の信頼できる専門家に助けを求めます:
    • Pint: 単位の専門家(「キロワット」が正確に何であるかを知っています)。
    • Unicode Database: 記号とフォントの専門家(上付き文字の「2」が、単なる数字ではなく「二乗」であることを知っています)。
    • RSLP: ポルトガル語文法の専門家(技術的な文脈において「potências」が「累乗(powers)」を意味することを知っています)。
  3. 分類プロセス: TOTENが「5.2 kN/m²」というテキストを見たとき、それを切り刻んだりはしません。ルールブックと専門家を参照し、「これは『物理量』という名前の、単一の原子的なブロックである」と判断します。そして、そのフレーズ全体を単一のラベル付きタグで包み込み、正確な意味を保持します。

結果: なぜ重要なのか
著者らは、800件のエンジニアリング事例と、他の4つの実世界のポルトガル語テキストコレクションを用いたベンチマークを使用して、TOTENを他の8つのトップティアのシステム(標準的な「ピクセル化された」翻訳者や他の数値検出ツールを含む)と比較テストしました。

  • 原子性(ひと塊を維持すること): TOTENは、物理量を単一の、途切れないユニットとして保持することに完璧でした。他のシステムは、それらをしばしばバラバラにしてしまいました。
  • 再構成(組み立て直すこと): 後でコンピュータが実際の数値と単位を抽出する必要があるとき、TOT-ENは**78%から90%の確率で正しく行うことができました。最も優れた競合システムは、わずか63%から70%**しか達成できませんでした。
  • 正確性: その差はわずかなものではなく、統計的に有意でした。TOTENは単に推測したのではなく、ルールブックを使用して一貫して正しい答えを導き出したのです。

結論
TOTENは、技術的・科学的なテキストにおいて、統計的な「推測」に頼る(これは日常会話には適していますが、エンジニアリングでは失敗します)必要はないことを証明しています。代わりに、技術用語を完全で意味のあるオブジェクトとして扱う、構造化されたルールベースのアプローチを使用することができます。

この論文は、この手法を用いることで、コンピュータが数字と単位の構造を、エンジニアが意図した通りに正確に「見る」ことができ、それらが混乱を招く断片へと分解されることなく、「5.2 kN/m²」をバラバラの文字の塊ではなく、単一の、一貫した概念として扱えるようになる、と主張しています。これは、ブラジル・ポルトガル語の技術テキストを機械にとって読みやすくするために特別に設計されたツールであり、「5.2 kN/m²」が混乱した文字の集まりではなく、一つのまとまった概念として扱われることを保証するものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →