Wiki Dumps to Training Corpora: South Slavic Case
本論文は、複数のウィキプロジェクトからテキストを体系的に抽出し、品質が低く反復的な記事を除去するために n-gram ベースのフィルタリングを採用することで、7 つの南スラヴ語向けの高品質で言語的に豊かな学習コーパスを生成するための言語に依存しない手法を提示する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
壮大な物語、詩、ニュース記事の図書館を構築し、ロボットにセルビア語、クロアチア語、ブルガリア語など、7 つの南スラヴ語を話させ、理解させることを想像してみてください。素材として、無料でテキストに満ちているウィキペディアとその姉妹サイト(ウィキソースやウィキニュースなど)を使用することにします。
しかし、これらのウェブサイトから生データをそのまま取得しても、物語の図書館は手に入りません。手に入るのは、以下のような混沌とした倉庫です。
- 建設廃材: ウェブサイトの外観を指示するが物語の一部ではない、隠されたコンピュータコード、書式設定指示、そして「設計図」。
- 割れたガラス: 壊れたリンクと空のセクション。
- 工場製のクローン: 人間が執筆したのではなく、データベースから自動生成されたため、ほぼ同一に見える何千もの記事。
この論文は、その散らかった倉庫を掃除し、完璧な図書館へと変える方法に関するガイドです。著者のミハイロ・スコリッチは、このプロセスを「大掃除」と「品質フィルター」の 2 つの主要なフェーズに分けて説明します。
フェーズ 1: 大掃除(テキスト抽出)
生データのウィキペディアデータを、まだ建設中の家だと考えてください。足場、塗料の缶、設計図が至る所にあります。まだ住むことはできません。
著者は、その家を住める裸の壁まで剥き出しにするための専門的な「建設チーム」(コンピュータプログラム)を構築しました。
- 足場の撤去: プログラムは
mwparserfromhell(ウィキペディアの秘密の言語を理解するツールの洒落た名前)というツールを使用して、すべてのコンピュータコード、テンプレート、書式設定タグを剥ぎ取ります。 - ノイズの除去: 「カテゴリ」リスト(ファイルキャビネットのタグのようなもの)を削除し、画像の説明を取り除き、脚注のように見えるが主要な物語の一部ではない「参考文献」セクションを除去します。
- 表の平坦化: ウィキペディアはデータを整理するために表をよく使用します。このプログラムは、これらの複雑なグリッドを、ロボットがグリッド線に混乱しないように、シンプルで読みやすい文に変換します。
- 結果: このフェーズの後、手元にはクリーンなプレーンテキストの山が残ります。それはもはやウェブサイトではなく、単なる言葉です。
フェーズ 2: 品質フィルター(クローンの除去)
クリーンなテキストが手に入った今、新たな問題が発生します。記事の中には「ゾンビ」テキストと呼ばれるものがあります。これらは人間が執筆したように見えますが、実際にはコンピュータによって自動生成されたものです。これらは反復的で退屈であり、わずかに異なる方法で同じことを繰り返し述べています。
これらの「ゾンビ」記事をロボットに与えると、ロボットは機械的で反復的なループで話すことを学習してしまいます。これを修正するため、著者は探偵戦略を使用します。
- 近隣によるグループ化: プログラムは記事を投稿ごとにグループ化します(例:「歴史」に関するすべての記事を 1 つの部屋に、「スポーツ」に関する記事を別の部屋に)。リンゴとリンゴだけを比較すれば、重複を見つけやすくなります。
- 「指紋」スキャン: プログラムは、すべての記事を数学的な「指紋」(ベクトル)に変換します。記事の最初の数語を見て、それがテンプレートのパターンに一致するかどうかを確認します。
- 類似性テスト: 数学的なトリックであるMinHashingを使用して、これらの指紋を互いに比較します。2 冊の本を持っていると想像してください。もしそれらが同じ順序で同じ文をあまりにも多く共有しているなら、それらはおそらくクローンです。
- カットオフ: プログラムは「類似性スコア」を計算します。ある記事が他の記事とあまりにも似ている場合(一定の閾値を超えている場合)、それは図書館から追い出されます。クラブのボーダーが「あなたは列にいる全員と全く同じに見える。入れない」と言うようなものです。
結果
この論文は、この方法を 7 つの南スラヴ語でテストしました。結果は劇的でした。
- セルビア語: 掃除すべき最大の混乱を抱えていました。フィルタリング前には 50 万を超える記事がありましたが、「ボーダー」が作業を行った後、重複または自動生成されたため、ほぼ半分が除去されました。単語数は約 60% 減少しました。
- ブルガリア語とスロベニア語: これらはもともと非常にクリーンだったため、除去された記事は少なかったです。
- 見返り: 最終結果は、より小さく、はるかに高品質な図書館です。これらの新しい図書館の言葉は、データベースがテキストを生成する方法ではなく、実際の人間が実際に話す方法に合致しています。
なぜこれが重要なのか
著者は、ロボットが言語を上手に学ぶためには、コンピュータが生成した埋め合わせではなく、実際の人間の執筆を読む必要があると主張しています。この 2 段階のプロセス(コードの掃除、次にクローンのフィルタリング)を行うことで、この論文は南スラヴ語の AI モデルのトレーニングに信頼性が高く、高品質な書籍セットを提供します。
要約すると: この論文は、コードで埋め尽くされた散らかったウィキペディアのダンプを、コンピュータのゴミからきれいに洗い流し、次に「コピー&ペースト」された記事を捨て去る方法を教えてくれます。残るのは、ロボットが学ぶための純粋な人間の言葉のコレクションです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。