Exploring Functional Shifts in Pos Tagging Across Various NLP Libraries: A Study of NLTK, spaCy and Textblob
本研究は、機能シフトによって引き起こされるガーデンパス文の処理におけるNLTK、TextBlob、およびspaCyの性能を比較しており、spaCyが構文的正確さにおいて他の2つのライブラリを大幅に上回っていることを見出し、アフリカ諸語向けのツールを含むNLPツールの改善に向けた知見を提供している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに物語の本を読ませる方法を教えていると想像してみてください。あなたは、単に言葉を理解させるだけでなく、その言葉が文の中でどのように振る舞っているのかまで理解させたいと考えています。「run」は「速く動け」という命令なのか、それとも「長い期間」を表す名詞なのか?コンピュータサイエンスの世界では、この作業は品詞(POS)タグ付けと呼ばれています。これは、文章内のすべての単語に、それが名詞なのか、動詞なのか、形容詞なのか、あるいは他の何かであるかを示すために色を塗る、デジタルなハイライトのようなものです。私たち人間には簡単に思えますが、コンピュータにとっては、単語が文の途中で「着せ替え」をする時に非常に難しくなります。これは**機能シフト(functional shift)**と呼ばれます。俳優が劇の中で、名前を変えることなく、王様として登場したかと思えば、突然シェフの帽子を被って料理を始めるようなものだと考えてください。コンピュータは、周囲にある他の言葉に基づいて、その新しい役割を推測しなければなりません。
さらにトリッキーなのが、ガードン・パス(garden path)文です。これらは、ある考えへとあなたを誘い込み、最後に足元をすくわれるような文章のことです。例えば、「The old man the boat(老人がボートを操る)」という文があります。あなたの脳は「old man」を「老人」という人物として読みたくなりますが、実際にはこの文は「高齢の人々がボートを操る」という意味なのです。ここで、「man」は名詞ではなく動詞として機能しています!コンピュータがこうしたひねりに混乱してしまうと、文章全体を誤解してしまう可能性があり、それは翻訳アプリや検索エンジンにとって大きな問題となります。そのため、科学者たちは、どのプログラムがこうした巧妙な言葉の変化を見抜くのに最も優れているかを、常にテストしています。
この研究では、カヨデ・ヴィクター・アムサンという研究者が、3つの有名なコンピュータプログラム――NLTK、TextBlob、そしてSpaCy――をテストすることに決めました。これら3つのプログラムを、言語クラスの異なる生徒たちだと想像してみてください。先生(研究者)は、彼らを混乱させるために設計された56個のトリッキーな文章の束を渡しました。これらの文章には、ガードン・パスのパズルや、言葉が名詞へと変化したもの(例えば「singing」が「歌うこと」という概念になった場合など)、そして意味を変えるために位置を変えた言葉が含まれていました。目的はシンプルでした。どの生徒が、文の中で各単語がどのような役割を果たしているかを正しく特定できるかを見極めることです。
結果は、一人のランナーが明らかに引き離していくレースのようでした。56個のトリッキーな文章のうち、SpaCyは32個を正解しました。NLTKとTextBlobは21個ずつ正解し、同点で2位となりました。これは、SpaCyが複雑な文章における言葉の「着せ替え」を見抜くことに、著しく長けていたことを意味します。
研究では、プログラムがどこでつまずいたのかを知るために、具体的な例を詳しく調べました。例えば、「round」という言葉を見てみましょう。これは名詞(円)、形容詞(丸い形)、動詞(回転する)、あるいは副詞(円を描いて動く)になり得ます。「The earth turns round once(地球は一度、円を描いて回る)」のような文において、SpaCyは「round」を副詞として正しく識別しました。しかし、NLTKとTextBlobは混乱して、それを名詞だとラベル付けしてしまいました。同様に、「that」という言葉についても、代名詞、接続詞、あるいは形容詞になり得ますが、SpaCyはほぼすべての文脈でその違いを判別できることを示しましたが、他の2つのライブラリはしばしば的を外しました。
研究者は、3つのプログラムすべてが、最も混乱を招くガードン・パス文(例えば「The complex houses married and single students(その複合施設は、既婚者や独身の学生に住居を提供している)」のような文)に対して苦戦したことを発見しました。しかし、それでもSpaCyは他のプログラムよりも多くの正解を導き出しました。例えば、「houses」が(住居を提供する、という意味の)動詞として機能している文において、SpaCyはそれが建物ではないことを見抜く可能性がより高かったのです。この研究は、NLTKやTextBlobが一般的なタスクには適している一方で、言葉が役割を変え始めるような複雑な状況においては、SpaCyがより強力なツールであることを示唆しています。
この論文は、SpaCyが完璧であるとか、問題が解決したと主張しているわけではありません。実際、SpaCyであっても56個中24個の文章を間違えたことを指摘しています。ただ、もしあなたがコンピュータにトリッキーで複雑な文章を扱わせたいのであれば、現時点ではSpaCyがこれら3つの中で最も信頼できる選択肢であることを示唆しています。研究者は、この情報が教師、学生、あるいは他の科学者たちがより優れた言語理解ツールを構築する助けとなり、さらには将来のプログラムがアフリカの言語を同じような容易さで話せるようになることを願っています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。