Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources
本論文は、2020 年から 2025 年の間に開発されたローマ字表記のシンハラ語からシンハラ語への転写のための包括的なデータおよびアルゴリズムのコレクションを提供する公開プラットフォームである「Swa-bhasha Resource Hub」を紹介するとともに、シンハラ語自然言語処理の進展に向けた既存ツールの比較分析を提示する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
スリランカの人々が英語のキーボードを使ってスリランカ・シンハラ語を入力する様子を、美しく複雑な庭園に例えてみましょう。何十年もの間、彼らはこの庭園に入るために、異なる鍵のセット、すなわち英語のキーボードを使ってきました。シンハラ語のキーボードが手元にないため、彼らは英語の文字を使ってシンハラ語の音をタイプし始めました。彼らはこれを「シンリッシュ」(ローマ字化されたシンハラ語)と呼びました。
シンリッシュを「秘密の暗号」や「タイプミスの方言」と考えてみてください。それは速く便利ですが、散漫です。「Adaraya」とタイプされた一つの単語は、文脈によって「愛」を意味することも「援助」を意味することもあります。まるで「bat」とタイプしたとき、それが動物を指すのか、スポーツ用具を指すのか、それとも動詞を指すのか、コンピュータが文全体を読まなければどちらを意図したのか分からないようなものです。
この論文は、この散漫な暗号を理解し、それを正しく美しいシンハラ語に戻すための橋を何年もかけて建設した研究者チーム(Swa-bhasha チーム)からの、成績表であり道具箱です。
彼らが何を作ったのか、簡単に説明します。
1. 問題:「翻訳の行方不明」ゲーム
チームは、コンピュータが英語からフランス語への翻訳には長けている一方で、「シンリッシュ」からシンハラ語への翻訳には苦労していることに気づきました。
- 散漫さ: 人々は異なる方法でタイプします。母音を省略する人(「kalana」の代わりに「klna」と書く)、英語の綴り規則を使う人、同じ文の中で英語とシンハラ語の単語を混ぜる人がいます。
- 曖昧さ: 最大の頭痛の種は、一つのタイプされた単語が複数の意味を持ちうるという点です。コンピュータは、どの意味が物語に合うか突き止める探偵になる必要があります。
2. 道具箱:彼らがどのように修正したか
チームは単一のツールを構築しただけでなく、世代が進むごとに賢くなるさまざまな機械を備えた工房全体を構築しました。
規則ブック・ロボット(Swa Bhasha 1.0):
- 仕組み: 厳格な指示書に従うロボットを想像してください。「k」を見ると、次に母音が必要だとわかります。辞書の中で最も近い一致を見つけるために「ファジー」検索(推測するスペルチェックのようなもの)を使用します。
- 結果: 許容範囲でしたが、人々が規則を破った場合(例えば母音を省略した場合など)には苦労しました。
ハイブリッド探偵(Swa Bhasha 2.0 および N-gram モデル):
- 仕組み: 彼らは規則ブック・ロボットを「統計的探偵」と組み合わせました。この探偵は数百万の文を見てパターンを学習します。「Trie」(スマートな木構造)を使用して、スマートフォンの自動補完のような単語の提案を行います(ただしシンハラ語用です)。
- 結果: 正しい単語を推測する能力は大幅に向上しましたが、非常にトリッキーな文ではまだ混乱しました。
スーパーリーダー(BERT およびトランスフォーマー):
- 仕組み: これはチームの「スーパーリーダー」です。個々の単語を見るだけでなく、人間のように文脈を理解しながら、文全体を一度に読みます。彼らは、シンハラ語のテキストのインターネット全体を読んだような脳を持つ強力な AI モデルである BERT を使用しました。
- トリック: AI が混乱する単語を見たとき、それを「マスク」で覆い、「この前後の単語に基づいて、ここに入る最も適切な単語は何ですか?」と問いかけました。
- 結果: これが優勝者でした。これは以前のどの手法よりも曖昧さの問題を解決し、テストでほぼ完璧な精度を達成しました。
コードミキシングの専門家:
- 仕組み: 人々はよく一つの文の中で英語とシンハラ語を混ぜます(例:「I went to the kade [shop]」)。チームは、混ざり合ったものを混乱することなく処理する、両言語を流暢に話す通訳のような特別なモデルを構築しました。
3. 図書館:彼らが収集したデータ
子供に本なしで読み方を教えることはできず、AI にデータなしで教えることもできません。チームは、シンリッシュのための良い「教科書」がないことに気づき、自分たちで書きました。
- 「Swa-Bhasha」図書館: 彼らは、YouTube のコメントやソーシャルメディアなど、実生活から700 万語以上と数千の文を収集しました。これは、コンピュータに実際の人がどのようにタイプするかを教えるために、スリランカ人が書いたすべての散漫なメモを集めるようなものです。
- 「曖昧さ」テスト: 彼らは、一つの単語が二つの意味を持つ特別なクイズを作成しました。彼らは、物語に基づいて正しい意味を選べるかどうかを確認するために、このテストで AI を試しました。
- 「コードミックス」コレクション: 彼らは、英語とシンハラ語を混ぜる人々の例を集めました。これは以前、研究者によって無視されていた非常に一般的な習慣です。
4. 結果:誰がレースに勝ったか
チームは、Google のツールや古い規則ベースのシステムなど、他の手法に対して彼らのツールをテストしました。
- 古い方法: 古い規則ベースのシステムは、硬直した教師のようでした。生徒が規則を破ると失敗しました。
- 新しい方法: 新しい「スーパーリーダー」(BERT ベース)モデルは、賢いメンターのようでした。彼らは文脈を理解し、ほぼ毎回正解しました。
- スコア: テストでは、彼らの最良のモデルは91%(BLEU スコア)のスコアを獲得し、非常に少ない間違いしか犯しませんでした。一方、古いモデルははるかに多くのエラーを犯しました。
5. 次は何が?
チームは現在、予測入力機能に取り組んでいます。あなたがタイプしたものを翻訳するだけでなく、散漫で個人的なスタイルでタイプしていても、次に何をタイプしようとしているかを推測するキーボードを想像してください。彼らは、メタラーニングと呼ばれる特別な学習技術を使用しており、これによりキーボードはあなたの特定のタイプ習慣を、あなたの個人データをサーバーに保存することなく、素早く学習できます。
まとめ
Swa-bhasha チームは、スリランカ人が英語のキーボードでタイプする散漫で非公式な方法と、公式で美しいシンハラ語の文字の間に橋を架けました。彼らは単純な規則ブックから始め、統計的探偵へと移り、最終的に文脈を理解する「スーパーリーダー」AI を構築しました。また、これらの AI を教育するために必要な膨大なデータ図書館も構築しました。彼らの仕事は、適切なツールがあれば、スリランカ語のような低リソース言語であっても、人々が急いでタイプした場合でも、コンピュータによって完全に理解できることを証明しています。
重要なお知らせ: この論文は、テキスト翻訳の技術とそれを訓練するために使用されたデータに厳密に焦点を当てています。医療応用、臨床利用、または彼らがリリースした研究ツールとオープンソースコードを超えた特定の将来の製品を主張するものではありません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。