PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing
本論文では、Universal DependenciesのPOSタグが付与された、初の大規模なペルシャ語・英語コードミックス・コーパスであるPERCEPT、およびLLMを活用したアノテーション・フレームワーク、そしてソーシャルメディアにおけるコードミックスのプラットフォーム固有のパターンを明らかにする包括的な言語学的分析を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、世界中の人々が叫んだり、ささやいたり、おしゃべりをしたりして、一斉に騒いでいる巨大で混沌とした遊び場だと想像してみてください。この遊び場では、多くの人々が単一の言語を話すだけでなく、まるでスムージーの材料を混ぜ合わせるように、複数の言語を混ぜ合わせています。これは「コードミキシング(言語混在)」と呼ばれます。これは、自分の母国語で文章を始め、ある単語がしっくりきたり、あるいは新しいガジェットの名前を知っているのがその単語だけだったりする場合に、突然英語の単語を投げ入れるような現象のことです。コンピュータにとって、これは悪夢です。コンピュータが文章を理解しようとする際、言葉は厳格なルールに従うことを期待しています。しかし、言語が混ざり合ってしまうと、コンピュータは混乱してしまいます。それはまるで、ケーキを焼いている途中で、レシピが突然メートル法のカップからヤード・ポンド法のオンスに切り替わるのを目の当たりにしたシェフのようなものです。こうした、乱雑で楽しい現実をコンピュータに扱わせる方法を教えるために、科学者たちは特別な辞書と、これらの混ざった言葉が実際にどのように機能するかを示す一連のルール、すなわち「コーパス」を必要としています。
ここで、PERCEPTという新しいプロジェクトが登場します。これは、英語を投稿に混ぜることを好むペルシャ語話者のための、巨大で整理された図書館のような役割を果たします。イランの言語学者とコンピュータ科学者のチームである研究者たちは、他の混合言語のペアには地図が存在する一方で、ペルシャ語と英語の混合は暗く、未開の森であることを気づきました。彼らは、そこで何が起きているのかを見るための懐中電灯を作りたいと考えました。そこで、彼らは3つの人気のデジタル集会場であるX(旧Twitter)、Instagram、そしてDigikala(大規模なオンラインショッピングサイト)から6,800件の投稿を収集しました。彼らは単に言葉を集めただけではありません。超スマートなAIアシスタントであるGeminiを名探偵として使い、すべての英語の単語(またはペルシャ文字で書かれた英語の単語)に対して、文の中でのその「役割」をタグ付けしました。文法において、この役割は「品詞(POS)」と呼ばれます。その単語は名詞(もの)ですか?動詞(動作)ですか?それとも形容詞(描写)ですか?チームはまた、AIに対し、その投稿が何について話しているのか(例えば「ショッピング」、「政治」、「面白いミーム」など)を推測するように求めました。
ここからがエキサイティングな部分です。チームはただ図書館を構築しただけでなく、その中に入り込み、どのようなパターンが見つかるかを確認するために本を読み始めました。彼らは、ペルシャ語話者が英語を混ぜる際、主に名詞(もの)として使用することを発見しました。それは、英語から「物体」を借りてくる一方で、「動作」や「描写」はペルシャ語のままにする、というようなものです。例えば、「I bought a new laptop(新しいノートパソコンを買った)」と言う場合、「laptop」は借りてきた名詞ですが、残りの文章はペルシャ語のままです。しかし、この混ざり具合の「風味」は、どこにいるかによって変化します。ショッピングサイトであるDigikalaでは、ブランド名や製品モデル(これらは固有名詞と呼ばれる特別な名前です)が多く混じっていました。Xでは、より多くの動詞(動作)が混じっており、Instagramでは形容詞(描写)に傾倒していました。
研究者たちはまた、これらの混ざった言葉が文章の「どこ」に隠れているかも調査しました。彼らは驚くべき一貫性を見出しました。どのプラットフォームを使用しているとしても、混ざった言葉は文の最初か中間に現れる傾向があり、文の最後にはめったに現れません。それはまるで、話し手が英語の単語を早い段階で置いてシーンを設定し、その後、ペルシャ語で思考を完結させるかのようです。しかし、最も興味深い発見は「トリガー(誘発)」についてでした。Digikalaでは、もし誰かが一つの英語の単語を使えば、その直後に別の英語の単語を使う可能性が非常に高いことがわかりました。それは、特定のブランドや製品について話し始めると、英語の言葉が次々と流れ込んでくるようなものです。これはInstagramやXではそれほど起こりませんでした。
最後に、彼らはどのトピックが最も多くの混合を引き起こしているかを確認しました。予想通り、「産業・商業」および「ブランド・ビジネス」のトピックが最も高いコードミキシングを示していました。人々がショッピング、テクノロジー、またはビジネスについて話すとき、彼らは自然と英語の用語を散りばめずにはいられないのです。チームは、人間の専門家にサンプルをダブルチェックさせることでAIの作業を確認し、人間はほとんど常にAIと一致したため、彼らの新しいライブラリが信頼できるものであることが証明されました。
要約すると、この論文は単に新しいデータセットを提供しているだけではありません。それは、ペルシャ語話者が自然にどのように言語をブレンドしているかについての明確な姿を描き出しています。言葉を借りる「種類」はプラットフォームによって変わるものの、混ぜる「方法」は一定のリズムに従っていることを示唆しています。この地図は今や誰でも利用可能であり、より優れた翻訳ツール、よりスマートなチャットボット、そして言語が絶えず共に踊っている世界における私たちのコミュニケーションへのより深い理解を築く助けとなります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。