← 最新の論文
💬 NLP

Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content

本論文は、言語モデルがこの過小評価されているコミュニティ特有の言語を正確に理解し定義できる能力を評価するために、手作業で精査された118語のクィア・スラングのデータセットおよび分類体系であるSlang-Qを導入するものである。

原著者: Arianna Denitto, Beatrice Savoldi

公開日 2026-08-06
📖 1 分で読めます☕ さくっと読める

原著者: Arianna Denitto, Beatrice Savoldi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、それぞれの近隣地域が独自の合言葉や内輪ネタ、特別な語彙を持つ、巨大で賑やかな都市だと想像してみてください。科学の世界には、自然言語処理(NLP)と呼ばれる分野があり、そこでは大規模言語モデル(LLM)として知られる「デジタルな脳」を構築して、この都市を読み解き、理解しようとしています。これらのモデルを、これまでに書かれたほぼすべての本やウェブサイトを読んできた超スマートな観光客だと考えてみてください。しかし、彼らは時として、特定の地域のローカルなスラングを理解するのに苦労することがあります。そのような一つの地域が、LGBTQIA+コミュニティです。そこには、言葉の意味が誰によって、どこで発せられるかによって大きく変わり得る、豊かで創造的、かつ急速に変化する言語が存在します。もしこれらのデジタル観光客がスラングを間違えて理解してしまうと、親愛の情を込めた挨拶を侮辱だと誤解したり、ジョークの意図を見逃したりしてしまうかもしれません。これは重要なことです。なぜなら、これらのモデルは人々が情報を探し、友人とチャットし、ウェブ上をナビゲートするのを助けるためにますます利用されているからです。もし彼らが疎外されたコミュニティの言語を理解できないのであれば、すべての人に対して公平にサービスを提供することはできません。

そこで、研究者チームは、これらのデジタル観光客がどれほど「クィア・スラング(Queer Slang)」という近隣地域に精通しているかをテストすることにしました。彼らは、Slang-Qと呼ばれる特別な評価場を構築しました。これは、118個の特定のクィア用語と、それらが実際に使われている1,024個の実生活の文章を組み合わせた、非常に緻密に整理された辞書のようなものです。決定的なのは、モデルが答えを単に暗記してしまわないように、この単語リストは文章とは独立して作成されたという点です。彼らは単にモデルに推測させるだけでなく、モデルがこれらの単語を正しく定義できるかどうかを確認するために、一連のチャレンジを用意しました。研究者は、モデルへの問いかけ方として4つの異なる方法をテストしました。単に単語だけを与える場合(例:「『tea』とは何か?」と尋ねる)、あるいは単語に加えてその使い方の例となる文章を与える場合(例:「私はパーティーについて『tea』をこぼしている(暴露している)」と示す)がありました。また、モデルに対して2種類の「マスク(役割設定)」も試しました。一つはモデルに一般的な言語のエキスパートとして振る舞わせるもの、もう一つはモデルに対して「あなたはクィア・スラングの専門家です」と具体的に指示するものでした。

結果は、まるで適切な教科書で勉強せずにテストを受けている学生を見ているかのようでした。文脈や特別な指示なしにスラングの定義を求められたとき、モデルはしばしばつまずきました。彼らは、単語の特定のクィア的な意味ではなく、最も一般的で日常的な意味を選んでしまう傾向がありました。例えば、「bear(クマ)」について尋ねると、モデルはゲイコミュニティにおける特定のタイプの人々ではなく、毛深い動物のことを考えてしまうかもしれません。しかし、研究者が少し助けを与えると、物語は変わりました。使用法を示す文章を提供したり、「あなたはクィア・スラングのエキスパートです」と伝えたりすると、モデルは正しい意味を当てるのがずっと上手くなりました。それはまるで、モデルが単語の辞書的な定義は知っているものの、パーティーで友人が実際にどのようにその言葉を使うのかを思い出すために、少しの文脈の手がかりを必要としている人のようでした。

研究者たちは、モデルは賢くなりつつあるものの、まだ完璧ではないことを発見しました。最善の手がかりを与えられたとしても、モデルは、そのコミュニティの中で育った人間のエキスパートのレベルには到底及びませんでした。モデルは、ある言葉がもともと侮辱的な言葉であったものがコミュニティによって肯定的な意味へと取り戻された(リクレイムされた)ものなのか、あるいは特定の文化グループとの関連があるのかといった、微妙な文化的ニュアンスを見落とすことがよくありました。興味深いことに、この研究では、モデルがトレーニングデータから答えを単に暗記してしまったかどうかについても検証しました。彼らは、一部のモデル、特に商用モデルは、これらの特定の文章を以前に「見た」ことがあるようですが、オープンソースのモデルはそうではなかったことを発見しました。しかし、答えを暗記していなかったモデルであっても、適切な文脈を与えられれば、それらを理解することができました。

結局のところ、この論文は、私たちのデジタルな脳は強力ではあるものの、活気に満ち、変化し続けるクィア・コミュニティの言語を真に理解するためには、もう少しの導きが必要であることを示唆しています。彼らは単なる一般的な辞書に頼ることはできません。「これは特別な近隣地域であり、地元の住民はこのように話すのだ」と教えられる必要があるのです。この研究は、この問題を永遠に解決したと主張するものではありませんが、適切な文脈を与え、枠組みを設定することが大きな違いを生むことを示しています。これは、真に役立つAIを構築するためには、単に言葉を教えるだけでなく、その背後にある文化や物語を教える必要があるということを思い出させてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →