UCSC NLP at SemEval-2026 Task 10: Boundary-Aware Span Extraction and RoBERTa Classification for Conspiracy Detection
UCSCのNLPチームによるSemEval-2026 Task 10 (PsyCoMark) 用のシステムは、陰謀論的なマーカーおよび文書を検出するために、ハードネガティブサンプリングを用いた境界認識型スパン抽出とRoBERTaベースの分類を採用しており、エンティティのような役割の堅牢な検出と抽象的な役割の境界における感度の高さを浮き彫りにしながら、それぞれ7位および11位の順位を獲得した。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、指紋を探す代わりに、ある物語が「陰謀論」のように感じさせる特定の「材料(成分)」を探し出す探偵だと想像してください。この論文は、UCサンタクルーズのチームが、SemEval-2026というコンペティションのために、まさにそれを行うコンピュータプログラムをどのように構築したかを説明しています。
以下は、彼らの研究内容を簡単な比喩を用いて分解したものです。
2つの主要な任務
このコンペティションには2つの明確な課題があり、チームは2人の別々の「探偵エージェント(AIモデル)」を用いてこれに取り組みました。
1. 材料ハンター(サブタスク1)
- 目標: 文の中で陰謀論の役割を果たす特定のパーツを見つけ出すこと。その役割とは以下の通りです:
- アクター(実行者): 誰が悪事を働いているのか?
- ヴィクティム(犠牲者): 誰が被害を受けているのか?
- アクション(行動): 何という悪事が行われているのか?
- エビデンス(証拠): 何が「証拠」として提示されているのか?
- エフェクト(影響): どのような恐ろしい結果が生じているのか?
- 課題: 単に「ジェフリー」という単語を見つけるだけでは不十分です。コンピュータは、そのフレーズがどこで始まり、どこで終わるのかを正確に知る必要があります。例えば、「アクション」は単に「ネタを明かした(spilled the beans)」だけなのか、それとも「モサドの作戦に関するネタを明かした(spilled the beans on the Mossod operation)」というフレーズ全体なのか、といった具合です。
- トリック: チームは、コンピュータに「境界線の完璧主義者」になるよう教えました。彼らはこう指示しました。「もしフレーズの始まりや終わりを少しでも間違えたら、それはカウントしない」。また、**ハード・ネガティブ・マイニング(Hard-Negative Mining)**という手法も使用しました。これは、先生が生徒に猫の写真を見せて「これは猫です」と言った後、猫に似た非常にふわふわした犬の写真を見せて「これは猫ではありません」と言うようなものです。これにより、コンピュータは、真の陰謀論のマーカーと、一見それらしく見えるものの実際にはそうではないフレーズとの間の微妙な違いを見分ける方法を学びました。
2. ストーリー判事(サブタスク2)
- 目標: ドキュメント全体を読み、それが「陰謀論であるか」「間違いなくそうではないか」、あるいは「判断不可能か」を判定すること。
- トリック: このモデルは、最初の探偵が見つけた特定の材料は見ません。代わりに、人間の読者のように物語全体を読み、全体の「雰囲気」やトーンを探ります。このモデルは、批判的なニュース報道(アクターやヴィクティムに言及することもありますが、陰謀論ではありません)と、真の陰謀論のナラティブ(同じ役割を用いながらも、疑わしく秘密めいたトーンを持っているもの)を区別することを学びました。
彼らがどのように行ったか
チームは、RoBERTaという強力なAIの脳を使用しました。これは、インターネット上のほぼすべての文章を読み、言葉がどのように組み合わさるかを理解している、非常に博識な司書のようなものだと考えてください。
- 材料ハンターに対して: 彼らは単に司書に単語を一つずつラベル付けするよう求めたのではありません。代わりに、あらゆる可能なテキストの塊(最大32単語まで)をチェックし、「この塊は『エビデンス』の定義に合致するか?」と問いかけました。彼らは、司書がこれらの塊の開始地点と終了地点に対して極めて厳格になるよう訓練しました。
- ストーリー判事に対して: 彼らは物語全体を司書に読み込ませ、「はい」「いいえ」「おそらく(Maybe)」のいずれかの判定を下すよう求めました。
結果
チームが公式コンペティションに彼らの探偵たちを投入した結果:
- 材料ハンターは、全チームの中で7位となりました。名前のような「アクター」や「ヴィクティム」を見つけることには非常に長けていましたが、「アクション」や「エフェクト」のような、より抽象的で境界線が曖昧な部分については苦戦することがありました。
- ストーリー判事は12位でした。これは、陰謀論の物語と通常のニュースの物語の違いを見分けることにかなり優れていました。
彼らが学んだこと(「アハ!体験」)
- 精密さは困難である: コンピュータが犯した最大のミスは、フレーズの始まりや終わりをわずかに間違えることでした。例えば「エビデンス」が「report(報告)」という単語であった場合、コンピュータは時として「a report」や「according to a report」と予測してしまいました。コンペティションのルールは厳格であり、正確な単語が得られなければ、得点はゼロとなります。
- 二人の頭は、別々に機能する方が良い(分離の利点): チームは、二人の探偵が作業中に互いに情報をやり取りしないように決定しました。彼らは、「もし最初の探偵がミスをした場合、二番目の探偵がそのミスによって混乱してしまうことを防ぎたい」と考えたのです。彼らは両者を分離させ、最後に回答を統合することにしました。
- 「判断不能」の問題: コンペティションには「判断不能(Can't tell)」という第3の選択肢がありました。しかし、最終的な採点ルールではこのカテゴリーは無視されました。このため、決勝戦でのルールが練習時とわずかに異なっていたため、テスト当日のコンピュータのパフォーマンスの見え方は、練習時とは異なるものとなりました。
まとめ
UCサンタクルーズのチームは、非常に精密な編集者であり、かつ鋭い観察者として機能するシステムを構築しました。彼らは、コンピュータが陰謀論の「材料」を特定することには長けてきているものの、それらの材料の正確な「境界線」を捉えることには依然として苦労していることを示しました。しかし、物語が陰謀論であるかどうかを判断するために、物語全体の「ムード」を感じ取る能力については、かなり優れていると言えます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。