PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation
PSK チームは、開発セットでは好成績を収めたもののテストセットでは失敗したアーキテクチャよりも汎化の重要性を実証しつつ、GPT-4o-mini によって生成された合成データと言語ごとの閾値調整を備えた LoRA 微調整済み Gemma 3 モデルのアンサンブルを採用することで、SemEval-2026 タスク 9 において平均マクロ F1 0.811 という成績で総合 2 位を達成しました。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
22 人の異なる学生(22 言語を表す)に、ソーシャルメディアの投稿において「熱い議論」と「冷静な会話」を見分ける方法を教えることを想像してみてください。これが「SemEval-2026 タスク 9」の課題でした。独立研究者であるスリカル・カシュヤップ・プーリパカが率いるチーム「PSK」は、これを解決するシステムを構築しました。
以下に、彼らがどのように行ったかを簡潔に説明します。
1. 目標:「熱気」の検出
このタスクは、英語からアムハラ語まで 22 言語のソーシャルメディア投稿を読み、その投稿が偏見(ステレオタイプ、憎悪、不寛容に満ちている)なのか、それとも中立的なのかを判断することでした。
- 課題: 一部の言語には学習するための例が非常に少なく、「偏極化」は文化によって異なって現れます。これは、ある国で雨しか見たことがない人に「嵐」を見分けさせるようなものです。
2. 教師たち:「Gemma」モデル
全員に一人の巨大な教師を使う代わりに、チームは各言語に対して 2 人の特定の「チューター」を雇いました。
- 12B チューター: 賢く効率的なモデル(120 億パラメータ)。
- 27B チューター: さらに賢く強力なモデル(270 億パラメータ)。
彼らは LoRA という手法を用いました。これは、チューターたちの脳全体を書き換えることなく、特定の言語を学習するための小さく専門的な「カンニングペーパー」を与えるようなものです。
3. 勉強仲間:合成データ
チームは、一部の学生には練習問題が不足していることに気づきました。そこで、彼らは AI(GPT-4o-mini)を使って 架空の練習問題(合成データ) を作成しました。
- 直接生成: AI がゼロから新しい架空の議論を作成しました。
- 言い換え: AI は実際の例を取り、別の言葉で書き直しました(学生が宿題の問題文を言い換えるようなものです)。
- 対照ペア: AI は「双子」のような例を作成しました。一つは偏極化したもので、もう一つは冷静なもので、モデルが正確な違いを見られるようにしました。
- フィルター: 彼らはこの架空のデータをただ放り込んだわけではありません。重複や無意味なものを除去する厳格な「品質管理」フィルターを通過させ、学生が高品質な教材のみを学習するようにしました。
4. 戦略:「音量ノブ」の調整
学習後、モデルは最終的な判断を下す必要がありました。通常、AI は 50% 以上確信があれば「はい」と言います。しかし、チームは一部の言語では 50% という基準が高すぎたり低すぎたりすることに気づきました。
- 対策: 彼らは決定閾値を 音量ノブ のように扱いました。一部の言語ではノブを 30% まで下げて(より多くの議論を捉えるため)、他の言語では 70% まで上げました(誤報を避けるため)。この単純な微調整により、追加の学習なしでスコアが 2〜4% 向上しました。
5. 「アンサンブル」:審査員パネル
最終的な判断では、彼らは一人のチューターの意見だけを聞いただけではありませんでした。彼らは アンサンブル を使用しました。
- 12B と 27B の両方のチューターに投票させました。
- 時には投票を平均化し、他の時にはより賢いチューターの票に重み付けをしました。
- 各言語について、練習テストで最も機能した投票戦略を選択しました。
6. 結果:誰が勝ったか
- 勝者: チームは 60 チーム中 総合 2 位 となりました。
- スコア: 彼らは 0.811 のスコア(精度の尺度)を達成しました。3 つの言語で 1 位 を、さらに 8 つの言語で トップ 3 を獲得しました。
- 驚き: 彼らは他の有名な AI モデル(XLM-RoBERTa と Qwen3)を試しました。これらのモデルは練習テストでは素晴らしい成績を収めましたが、本番テストでは 失敗 し、精度が 30〜50% 低下しました。
- 教訓: 練習問題の答えを暗記するモデルよりも、偏極化の「概念」を学習して汎化能力が高いモデルの方が優れています。Gemma モデルだけが、テストが始まっても「忘れる」ことはありませんでした。
7. 唯一の弱点:イタリア語の「欠落した章」
このシステムは イタリア語 で最も苦労しました。なぜでしょうか?
- イタリア語の学習データには、「政治」や「その他」の問題など、トピックの全カテゴリが欠落していました。
- しかし、最終テストには、その欠落したトピックに関する質問が多数含まれていました。
- これは、足し算だけを勉強して数学のテストに臨んだのに、最終試験に割り算の大きなセクションが含まれていたようなものです。モデルはその特定の種類の議論を以前に見たことがなかったため、正しく推測できませんでした。
まとめ
チームは、22 言語のオンライン議論を検出するために、専門的な AI チューター、AI 生成の練習問題、そしてカスタム調整された決定ルールを使用するシステムを構築しました。彼らの秘密の武器は、単に最大の AI を使うことではなく、答えを暗記するのではなく偏極化の概念を実際に 学習 できるものを選び、その後、各言語ごとにルールを微調整することでした。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。