← 最新の論文
💻 computer science

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

本論文は、20のサブコミュニティにわたる500語以上の英語のクィア・スラングを含む、初のコミュニティ検証済みデータセットである「SLAyiNG」を紹介するものであり、これは、多くの言語モデルがクィアのアイデンティティに対する表現のバイアスは欠いているものの、クィア特有の語彙、特にアフリカ系アメリカ人やラティーノのコミュニティのスラングを処理することには依然として苦慮していることを明らかにしており、NLPシステムを改善するための多様な言語リソースの必要性を浮き彫りにしている。

原著者: Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューターが、これまでに書かれたほぼすべての本、ウェブサイト、会話を飲み込んだ巨大で貪欲な読者のような世界を想像してみてください。これらの機械は「大規模言語モデル(LLM)」として知られ、今日私たちが使っているチャットボットやAIツールの背後にある頭脳となっています。彼らは言葉の中にあるパターンを見つけ出し、文章の次に何が来るかを予測することで学習します。しかし、ここに落とし穴があります。もしコンピューターがある特定の話し方を一度も聞いたことがなければ、混乱してしまうのです。親しみのあるジョークを侮辱だと勘違いしたり、文化的なリファレンスを全く理解できなかったりすることがあります。これは「ソシオレクト(社会方言)」、つまりティーンエイジャー、ゲーマー、あるいはLGBTQ+コミュニティといった特定のグループによって使われる専門的な言語にとって大きな問題です。AIがこれらのグループを理解できないとき、意図せず失礼な態度を取ったり、人々を誤認したり、あるいは単に適切に会話できなかったりすることがあります。研究者たちが問いかけているのは、「どうすれば、これらのデジタルな脳に、クィア・コミュニティの豊かで色彩豊かな、そして進化し続けるスラングを、間違いなく理解させるように教えられるのか?」ということです。

ここで、「SLAYING」と呼ばれる新しいプロジェクトが登場します。これは、クィアのスラングに特化した、コミュニティによって承認された大規模な辞書であり、物語集のようなものだと考えてください。研究者たちは、AIが多くの種類の言語を理解することには長けてきている一方で、クィアの語彙(バーナキュラー)についてはしばしばつまずくことに気づきました。時には、AIがあまりに混乱しすぎて、無害で祝福的なフレーズをヘイトスピーチだと勘違いしたり、ユーザーが特定の言葉を使ったというだけで、失礼な返答を生成したりすることさえあります。これを解決するために、チームは500以上のクィアのスラング用語と、それらが実際に文章の中でどのように使われているかを示す3,405の例文を含む、初の現実世界のデータセットを構築しました。彼らは単に教科書からこれらの言葉を抜き出したのではありません。映画、ポッドキャスト、ソーシャルメディアから収集し、さらに、その言葉が正しく使われているか、また有害ではないかを、クィア・コミュニティの実際のメンバーに一つひとつ確認させたのです。

チームはこの新しいデータセットを使用して、いくつかの人気のあるAIモデルをテストし、驚くべき発見をしました。コンピューターは、クィアの人々に対して「親切」であること(つまり、ステレオタイプを持ったり、彼らを嫌悪したりしないこと)はできても、彼らの言語については「無知」である場合があることを発見したのです。それは、あなたのことが大好きだけれども、あなたの好きな身内ネタを理解できない友人のようなものです。彼らは意地悪をしているのではなく、単にそのリファレンスを理解できていないだけなのです。研究は、この新しいデータセットを用いてAIモデルに学習させたところ、モデルは単に言葉を理解するだけでなく、クィアの人々全般を理解することについても向上したことを示しました。

しかし、研究者たちは、AIがすべての人を平等に扱っているわけではないことも発見しました。モデルは、特定のグループ、特にアフリカ系アメリカ人やラティーノのクィア・コミュニティのスラング、およびドラァグやノンバイナリーのアイデンティティに関連する用語に対して最も苦戦しました。それはまるで、AIが、学ぼうとしているスラングを生み出したまさにそのコミュニティに対して、盲点を持っているかのようです。さらに、研究によれば、「有害な(トキシックな)」言語を検知するために設計された自動システムは、たとえそれらのクィアの用語が肯定的、あるいは再定義された形で使われていたとしても、しばに危険なものとしてフラグを立ててしまうことが分かりました。これは、インターネットを安全に保つためのツールそのものが、意図せずしてクィアの声を検閲している可能性があることを示唆しています。論文は、より多様で現実世界のクィアの言語の例をこれらのモデルに提供することで、彼らがコミュニティをより良く理解できるようにし、混乱と、無実の会話を有害なものとして誤ってフラグを立てる傾向の両方を軽減できると提案しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →