← 最新の論文
💬 NLP

Lingo_Research_Group at SemEval-2026 Task 9: Evaluating Prompt Variants for Polarization Detection

Lingo_Research_Groupの論文は、SemEval-2026 Task 9に向けてGemma3-27Bモデルを用いた12種類のプロンプト・バリアントの系統的な評価を提示しており、プロンプトベースのアプローチが22言語にわたる粗粒度な極性化の検出には効果的である一方で、細粒度かつマルチラベルの社会言語学的分類においては課題が増大することを示している。

原著者: Pritam Kadasi, Anuj Tiwari, Mayank Singh

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Pritam Kadasi, Anuj Tiwari, Mayank Singh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、世界22の言語で起こるミステリーを解決しようとしている探偵だと想像してください。このミステリーは盗まれた宝石についてではなく、「ポラリゼーション(極性化/分断)」と呼ばれるものについての物語です。簡単に言えば、ポラリゼーションとは、ソーシャルメディア上で人々が互いに怒鳴り合い、「私たち」と「彼ら」という明確な境界線を引き、相手の意見を聞こうとしなくなる現象のことです。

この論文のチームである「Lingo Research Group」は、コンピューター(AI)にこの「争い」を見つけ出し、誰に対して、どのように争っているのかを教えることができるかどうかを検証するため、世界的なコンテスト(SemEval-2026)に参加しました。

彼らがどのように取り組んだのかを、日常的な例えを用いて説明します。

ミステリーの3つのレベル

このコンテストには、ビデオゲームのように3つの難易度レベルがありました。

  1. レベル1(「起きているか?」のチェック): AIは単に「はい」か「いいえ」で答えるだけです。この投稿は怒りに満ち、分断を煽るものか、それともただの普通の投稿か?
    • 例え: 煙探知機のようです。単に「煙が出ていますか?」と答えるだけでよいのです。
  2. レベル2(「誰についてか?」のチェック): もし投稿がポラライズされている場合、彼らは誰について争っているのでしょうか?政治家ですか?特定の民族ですか?宗教ですか?ジェンダーですか?
    • 例え: 探偵が「容疑者は誰だ?」と尋ねるようなものです。AIは、ラインナップの中から一人または複数の容疑者を選び出さなければなりません。
  3. レベル3(「どのように争っているか?」のチェック): これが最も難しいレベルです。憎しみはどのように表現されているのでしょうか?ステレオタイプを使っているのか?名前で呼んで侮辱しているのか?あるいは、他人の感情を無視するような態度を取っているのか?
    • 例え: 争いの「スタイル」を分析することです。ナイフを使っているのか、鈍器を使っているのか、あるいはただ叫んでいるだけなのか?これには、巧妙でトリッキーな振る舞いを見抜く力が必要です。

ツール:レシピとしての「プロンプト」

コンピューターに何千もの例を見せて教える(これは学生に教科書を丸暗記させるようなものです)代わりに、チームは「プロンプト」を使用しました。プロンプトとは、非常に有能だが融通の利かない料理人(AI)に与えられるレシピ指示書のようなものです。

チームは12種類の異なるレシピを試しました。

  • 非常に短いレシピ:「これは怒っていますか?」
  • 詳細なレシピ:「人々をグループ分けする言葉を探してください。もし皮肉があれば、それが意地悪なものかどうか確認してください。これがその例の3つです……」

彼らはこれらのレシピを2つの異なる「シェフ」(AIモデル)でテストしました:aya-101Gemma3-27B です。結果、Gemma3-27B の方が優れたシェフであることがわかったため、最終的なコンテストにはこちらを採用しました。

結果:基礎には強いが、ニュアンスには苦戦

チームの結果は、成功と苦戦が入り混じったものであり、興味深い物語を伝えています。

  • レベル1(煙探知機): AIはこれに非常に長けていました。平均して76%の確率で、ポラライズされた投稿を正しく特定できました。これは、火災を見逃すことがほとんどない煙探知機のようです。
  • レベル2(容疑者): スコアは59%程度に低下しました。誰が攻撃されているのかを正確に特定するのはより困難でした。
  • レベル3(争いのスタイル): スコアはさらに下がり、約44%になりました。これが最も難しい部分でした。

なぜ難しくなったのか?
著者は、タスクが具体的になるにつれて、AIが混乱してしまうと説明しています。

  • 「保守的なシェフ」問題: AIは非常に慎重になるよう訓練されていました。非常に明白な証拠(例えば、罵詈雑言を叫んでいるなど)がない限り、AIは「はい、これはポラライズされています」とは答えませんでした。
  • 「皮肉の罠」: 英語では、人々は皮肉、アイロニー、あるいは巧妙な言葉遊びを使って争うことがよくあります(例:「ああ、素晴らしい。イエスの名の下にまた社会主義者が現れた」)。あまりに文字通りに受け取ってしまうAIは、明らかな「喧嘩の言葉」がないために、これらを見逃してしまいました。AIは「直接的な侮辱がない?なら、安全に違いない」と考えてしまったのです。
  • 「直接的 vs 間接的」のギャップ: ヒンディー語や中国語など、他の多くの言語では、人々はより直接的に議論を行う傾向があります。AIはそれらの直接的な一撃を捉えるのは得意でしたが、英語の微妙で間接的な議論には苦戦しました。

言語のパズル

AIのパフォーマンスは、言語によって異なりました。

  • ネパール語と中国語は、ポラリゼーションが非常に明確で直接的であったため(例:「グループA 対 グループB」)、AIにとって簡単でした。
  • 英語は驚くほど困難でした。英語の話し手は皮肉や文化的ショートハンド(簡略表現)を多用するため、AIは争いを見逃し続けてしまいました。それは、その言語を完全には理解していない人がジョークを理解しようとするようなものです。言葉は聞こえていても、オチを見逃してしまうのです。

大きな教訓

この論文は、AIは「騒がしい」争いを見つけるのは得意ですが、「静かな」あるいは「巧妙な」争いには苦戦するという結論を下しています。

チームは、単に指示を与えるだけでは、22の異なる文化における複雑な人間の感情をAIに理解させることはできないということを学びました。AIにニュアンス(「どのように」「誰が」)を分析させようとすればするほど、特に人々が皮肉を言ったり間接的な表現を用いたりする場合、AIは微妙な兆候を見逃す傾向があるのです。

要約すると: AIは明らかな犯罪を見つけるための優れた探偵ですが、オンラインでの議論における、より巧妙でトリッキー、かつ皮肉な方法を理解するには、さらなる訓練が必要です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →