MemeScouts@LT-EDI 2026: Asking the Right Questions -- Prompted Weak Supervision for Meme Hate Speech Detection
本論文は、量子化されたQwen3-VLMを用いたプロンプト型弱教師あり学習フレームワークを提案し、ミームのヘイトスピーチ検出をターゲットとした質問ベースのラベリング関数に分解することで、多モーダル、文化的に微妙なニュアンスを持つ、多言語のヘイトスピーチという課題に効果的に取り組むことにより、LT-EDI 2026 共有タスクにおいて英語、中国語、ヒンディー語で最高位を達成した。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
特定の種類の悪意あるジョーク(ヘイトスピーチ)をインターネット・ミームの集合体から見つけ出そうと想像してみてください。ミームはトリッキーです。なぜなら、それらは二重構造のパズルのようなものだからです。画像とテキストを持ち、しばしば皮肉、逆説、あるいは文化的文脈を知っている場合にのみ意味をなす「内輪ネタ」を使用します。
この論文の著者たちは、これらのパズルを解き、特に同性愛嫌悪やトランス嫌悪的なジョークを見つけるコンピュータ・システムを構築しようと試みました。彼らがどのように行ったか、簡単に説明します。
問題:「大きな質問」を投げかけても機能しなかった
研究者たちはまず、超スマートな AI(ビジョン・ランゲージ・モデル)に、単一の巨大な質問を投げかけることを試みました。「このミームは差別的か?」と。
これは、学生に複雑な数学の問題を解き、論文を書き、絵を描くことを、たった一つの文で要求するようなものです。AI はしばしば混乱しました。ターゲット、トーン、皮肉、そして最終的な判断をすべて同時に推測しようとし、誤りを犯しました。これは、ミームが異なる言語(英語、ヒンディー語、中国語)で書かれている場合に特に困難です。なぜなら、「内輪ネタ」は文化によって変わるからです。
解決策:「取り調べ室」アプローチ
単一の大きな質問を投げかける代わりに、チームは戦略を変更しました。彼らは問題を、取り調べやチェックリストのような、一連の小さく具体的な質問に分解することにしました。
彼らは「プロンプト付きの弱い教師あり学習」システムを作成しました。容疑者が有罪かどうかを単に推測するのではなく、証拠について 89 の具体的な質問をする探偵(AI)を想像してください。
- 「そのジョークは特定のグループを標的にしているか?」
- 「トーンは皮肉か?」
- 「テキストは表面的に見えることと実際には逆のことを言っているか?」
- 「画像はステレオタイプを示しているか?」
AI はこれらの質問に、単純な「はい/いいえ」または短いカテゴリで答えます。これらの答えは最終的な判断ではなく、手がかりです。
組み立てライン
AI がミームに対して 89 のすべての質問に答えたら、チームはその答えを取り、より単純で古典的なコンピュータ・プログラム(ランダム・フォレスト分類器)に投入します。このプログラムは、探偵からのすべての手がかりを聞く裁判官のようなものです。
- 探偵(AI): 「そのジョークは性同一性に関するもので、皮肉であり、特定の個人を標的にしている。」
- 裁判官(分類器): 「わかった、それらの具体的な手がかりに基づけば、これは 90% の確率でヘイトスピーチだ。」
彼らが発見したもの
結果はマジックのようでした。
- 精度の向上: この「チェックリスト」方式は、AI に単一の大きな質問を投げかけるよりもはるかに優れていました。文化的ニュアンスが非常に微妙なヒンディー語と中国語のミームにおいて特に効果的でした。
- 「剪定」ステップ: 当初、彼らは質問が多すぎました(いくつかは反復的または混乱を招くものでした)。彼らは「剪定」ツールを使用して、悪い質問を切り取り、最も有益な手がかりだけを残しました。これにより、システムはさらに鋭敏になりました。
- ランキング: 彼らが参加したコンペティションにおいて、彼らのシステムは英語で 1 位、中国語で 2 位、ヒンディー語で 3 位を獲得しました。
注意点(限界)
著者たちは、システムの問題点について率直に述べています。
- 西洋中心主義: 質問は主に西洋の視点から書かれました。インドや中国における、西洋版とは見かけが異なるヘイトスピーチの特定の文化的兆候を見逃す可能性があります。
- 画像内のテキストの読み取り: AI は画像内のテキストを読み取る必要があります。時には単語を見落としたり、誤って読んだりして、手がかりが狂ってしまいます。
結論
この論文は、ミームにおける微妙で悪意あるジョークを捕まえる際に、超コンピュータに一度に全体の答えを推測させるのではなく、問題を小さく管理可能な質問に分解し、システムに答えを重み付けさせる方がよいことを示しています。これは、学生に「答えは何か?」と尋ねるのと、彼らに段階的に解き方を示させることの違いです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。