✨ 要約🔬 技術概要
コンピューターが、これまでに書かれたほぼすべての本、ウェブサイト、会話を飲み込んだ巨大で貪欲な読者のような世界を想像してみてください。これらの機械は「大規模言語モデル(LLM)」として知られ、今日私たちが使っているチャットボットやAIツールの背後にある頭脳となっています。彼らは言葉の中にあるパターンを見つけ出し、文章の次に何が来るかを予測することで学習します。しかし、ここに落とし穴があります。もしコンピューターがある特定の話し方を一度も聞いたことがなければ、混乱してしまうのです。親しみのあるジョークを侮辱だと勘違いしたり、文化的なリファレンスを全く理解できなかったりすることがあります。これは「ソシオレクト(社会方言)」、つまりティーンエイジャー、ゲーマー、あるいはLGBTQ+コミュニティといった特定のグループによって使われる専門的な言語にとって大きな問題です。AIがこれらのグループを理解できないとき、意図せず失礼な態度を取ったり、人々を誤認したり、あるいは単に適切に会話できなかったりすることがあります。研究者たちが問いかけているのは、「どうすれば、これらのデジタルな脳に、クィア・コミュニティの豊かで色彩豊かな、そして進化し続けるスラングを、間違いなく理解させるように教えられるのか?」ということです。
ここで、「SLAYING」と呼ばれる新しいプロジェクトが登場します。これは、クィアのスラングに特化した、コミュニティによって承認された大規模な辞書であり、物語集のようなものだと考えてください。研究者たちは、AIが多くの種類の言語を理解することには長けてきている一方で、クィアの語彙(バーナキュラー)についてはしばしばつまずくことに気づきました。時には、AIがあまりに混乱しすぎて、無害で祝福的なフレーズをヘイトスピーチだと勘違いしたり、ユーザーが特定の言葉を使ったというだけで、失礼な返答を生成したりすることさえあります。これを解決するために、チームは500以上のクィアのスラング用語と、それらが実際に文章の中でどのように使われているかを示す3,405の例文を含む、初の現実世界のデータセットを構築しました。彼らは単に教科書からこれらの言葉を抜き出したのではありません。映画、ポッドキャスト、ソーシャルメディアから収集し、さらに、その言葉が正しく使われているか、また有害ではないかを、クィア・コミュニティの実際のメンバーに一つひとつ確認させたのです。
チームはこの新しいデータセットを使用して、いくつかの人気のあるAIモデルをテストし、驚くべき発見をしました。コンピューターは、クィアの人々に対して「親切」であること(つまり、ステレオタイプを持ったり、彼らを嫌悪したりしないこと)はできても、彼らの言語については「無知」である場合があることを発見したのです。それは、あなたのことが大好きだけれども、あなたの好きな身内ネタを理解できない友人のようなものです。彼らは意地悪をしているのではなく、単にそのリファレンスを理解できていないだけなのです。研究は、この新しいデータセットを用いてAIモデルに学習させたところ、モデルは単に言葉を理解するだけでなく、クィアの人々全般を理解することについても向上したことを示しました。
しかし、研究者たちは、AIがすべての人を平等に扱っているわけではないことも発見しました。モデルは、特定のグループ、特にアフリカ系アメリカ人やラティーノのクィア・コミュニティのスラング、およびドラァグやノンバイナリーのアイデンティティに関連する用語に対して最も苦戦しました。それはまるで、AIが、学ぼうとしているスラングを生み出したまさにそのコミュニティに対して、盲点を持っているかのようです。さらに、研究によれば、「有害な(トキシックな)」言語を検知するために設計された自動システムは、たとえそれらのクィアの用語が肯定的、あるいは再定義された形で使われていたとしても、しばに危険なものとしてフラグを立ててしまうことが分かりました。これは、インターネットを安全に保つためのツールそのものが、意図せずしてクィアの声を検閲している可能性があることを示唆しています。論文は、より多様で現実世界のクィアの言語の例をこれらのモデルに提供することで、彼らがコミュニティをより良く理解できるようにし、混乱と、無実の会話を有害なものとして誤ってフラグを立てる傾向の両方を軽減できると提案しています。
テクニカル・サマリー:SLAyiNG – 多様でコミュニティによって検証されたクィア・スラングのデータセット
問題提起
他の社会方言や非公式な言語に対する自然言語処理(NLP)が進歩している一方で、クィアの語彙は評価ベンチマークやリソースにおいて著しく過小評価されたままです。現在のNLPシステムは、クィアの言語を誤って処理することが多く、その結果、ヘイトスピーチへの誤分類、否定的な応答の生成、ミスジェンダリング、およびステレオタイプ化を招いています。クィアの言語に関する既存の文献は限定的であり、単一の特徴(例:奪還された蔑称)に焦点を当てているか、あるいは小規模で合成的な用語リストを利用していることが多いのが現状です。AIシステムにおける反クィア的な言語バイアスを評価し緩和するために必要な、多様で非合成的、かつコミュニティによって検証されたリソースが決定的に不足しています。
メソドロジー
著者らは、厳格な多段階のキュレーションおよびアノテーション・パイプラインを通じて構築された、英語のクィア・スラングに関する初の現実世界のデータセットであるSLAyiNG を紹介します。
データ収集とソーシング
用語のソーシング: 著者らは、Gender, Sex, and Sexual Orientation Ontology (GSSO)、lgbtDB、Chew Inclusive Terminology Glossary、およびWiktionaryの4つの主要なソースからスラング用語を集約しました。これにより、初期段階で695個の一意の用語と90個のバリアントが得られました。
生データの取得: 現実世界での使用法を捉えるため、チームはOpenSubtitles(映画/テレビの字幕)、Reddit(フォーラムの投稿)、Podscripts(ポッドキャストのトランスクリプト)の3つのソースから197,958個の文レベルの例をスクレイピングしました。
事前フィルタリング: 多くのスラング用語には曖昧さがあるため(例:「mother」や「read」は非クィアの意味を持つ)、著者らは意味の曖昧性解消のためにGPT-5 Miniを事前フィルタリングモデルとして採用しました。このモデルは、3人の著者によってアノテーションされたゴールドスタンダード・セットに対して検証され、マイクロF1スコア0.78を達成しました。
アノテーション・パイプライン
データセットは、内部の著者と33人の多様なボランティアからなるクラウドソーシング・コホートによる3つのタスクによるアノテーションプロセスを経ました。
意味の曖昧性解消: 特定の定義が、与えられた文における用語の使用に適用されるかどうかを判断する。
有害な発言の検出: 文が有害であるかどうかを特定し、蔑称的な使用と、奪還された(reclaimed)またはイングループ(内集団)的な使用を区別する。
著者のアイデンティティ特定: 文の著者が「イングループ」(その用語が参照するコミュニティ)に属するか「アウトグループ」(外集団)に属するかを判断する。これは、蔑称の知覚される害に大きく影響します。
検証とリリース:
内部アノテーション: 5,973個の例を手動でアノテーションしました。「サニティチェック」バッチにより、ガイドラインの安定性を確保しました。
クラウドソーシング・アノテーション: 正確性と安全性を検証するため、データセットの12%をコミュニティのボランティアによってアノテーションしました。
データセットのバージョン: 最終的な公開用 バージョンには、無害であるとラベル付けされた3,405のエントリが含まれています。悪用を防ぎつつ言語的なニュアンスを保持するために、リクエストに応じて入手可能な、121個の追加エントリ(「不確かな有害性」があるがイングループの発言であることが確認されたもの)を含むプライベート バージョンも用意されています。
主な貢献
SLAyiNGデータセット: 3,405個の文脈で使用される500以上のクィア・スラングを含む、手動アノテーションされた非合成のデータセット。これには、ドラッグ(drag)、ノンバイナリー、アフリカ系アメリカ人、ラティーノ・コミュニティを含む20以上のクィア・サブコミュニティが含まれます。
表現と言語バイアスの分離: 著者らは、言語モデルが表現 (アイデンティティのステレオタイプ化)については偏りがない(unbiased)一方で、依然として言語的バイアス (コミュニティの言語に対する性能の低さ)を示す可能性があることを実証しました。彼らは、モデルのクィア・スラングに対する性能(Bits Per Byteで測定)と、WinoQueerベンチマークにおけるバイアス・スコアとの間に負の相関があることを示しています。
インターセクショナルなバイアス分析: 本研究は、NLPモデルが特定のサブコミュニティ、特にノンバイナリーおよびドラッグ・コミュニティに関するスラングに対して著しく性能が低下することを明らかにしています。さらに、モデルは、民族指定のない用語と比較して、アフリカ系アメリカ人およびラティーノ・コミュニティに関連するスラングに対して、高いエラー率と毒性分類の偽陽性を示します。
実験結果
著者らは、SLAyiNGを用いて、DATADECIDE 1Bモデル・スイートと様々なデータ・レシピを用いた2つのケーススタディを実施しました。
言語的バイアス vs 表現的バイアス: 25種類の異なるデータ・レシピの分析により、モデルのクィア・スラングへの適合度(低いBPB)と、反クィア的バイアス・スコア(低いほど良い)との間に負の相関(r = − 0.34 , p = 0.09 r = -0.34, p = 0.09 r = − 0.34 , p = 0.09 )が見られました。この相関は0.05レベルでは統計的に有意ではありませんでしたが、著者らは、クィアなコンテンツを含むコーパスが、意図せずしてクィア恐怖症的なステレオタイプを強化してしまう可能性がある(有害なコンテンツまたはアウトグループの著者によるもの)という仮説を立てており、これは表現と言語的バイアスが部分的にデカップル(分離)されている可能性を示唆しています。
継続的な事前学習による緩和: 著者らは、OLMo-1BモデルをSLAyiNGを用いてファインチューニングしました。その結果、すべてのコミュニティ・サブセットにおいてWinoQueerバイアス・スコアが減少し、BPBも減少(言語への適合性が向上)しました。これは、無害なイングループのクィア言語に言語モデルをさらすことが、表現的バイアスと言語的バイアスの両方を緩和する可能性があることを示唆しています。
サブコミュニティ間の性能格差: パフォーマンス指標(BPB)は、ノンバイナリーおよびドラッグのスラングを含むテキストにおいて一貫して劣っていました。同様に、黒人、アフリカ系アメリカ人、およびラティーノ・コミュニティに関連するスラングは、民族指定のない用語よりも高いBPB(性能の低さ)を示しました。
毒性分類のエラー: ヘイトスピーチ・クラシファイア(DOLMAおよびTOXIGENのHateBERT)は、SLAyiNGの例の相当部分を毒性があると誤ってラベル付けしました(それぞれ7.81%および31.16%)。この偽陽性率は、ドラッグ・スラングや、意味的な拡張を持つ用語(例:「cunty」)において特に高く、これらの分類器が、それらの用語を、主流派の女性蔑視的な定義としてではなく、奪還されたクィア的な意味としてではなく解釈してしまう傾向があることを示しています。
意義と主張
本論文は、SLAyiNGがクィアのステークホルダーにとってNLPシステムの公平性と有用性を向上させるための必要な基礎を提供すると主張しています。著者らは以下のことを主張しています。
生態学的妥当性: 合成データセットとは異なり、SLAyiNGは、単一の特徴分析を超えて、言語的バイアスがどのようにクィアのユーザーに影響を与えるかを分析するための現実的なテストベッドを提供し、インターセクショナルな評価を可能にします。
バイアスのニュアンス: 本研究は、バイアスのないモデルが、当然ながら多様な言語を処理できるわけではないという仮定に異議を唱えています。表現的バイアスと言語的バイアスは異なる現象であり、異なる緩和戦略を必要とします。
コミュニティ中心の開発: クィア・コミュニティをアノテーションおよび検証プロセスに関与させることで、本データセットは、害やアイデンティティの定義が外部の仮定ではなく、ステークホルダーの生きた経験に基づいていることを保証しています。
著者らは、SLAyiNGは重要な一歩ではあるものの、現在利用可能なリソースの「スナップショット」であると結論付けています。彼らは、進化し続けるクィアの語彙に対応し、大規模なAIシステムへの外挿における小規模モデルの限界に対処するために、継続的な改訂と拡張の必要性を強調しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×