ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification
ZeroR@CHiPSAL 2026チームは、OCRへの依存を排除し、低リソースのマルチモーダルなヘイトスピーチおよび感情検出を効果的に処理するために、対照学習とLoRAファインチューニングを用いたQwen3-VL-8B-Instructによる2段階のビジョン・ランゲージ適応パイプラインを採用することで、ネパール語ミーム分類において上位ランクを獲得しました。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、誰もが叫び、ささやき、壁に絵を描いている、巨大で混沌としたデジタルな街の広場だと想像してみてください。この街では、「ミーム」が最も人気のあるコミュニケーション手段です。それらは、面白い画像と巧妙なキャプションを組み合わせた、内輪ネタのようなものです。しかし、時としてこれらのジョークは武器へと変わり、笑いの中にヘイトスピーチやいじめを隠してしまうことがあります。厄介なのは、画像自体は無害に見えても、テキストによって恐ろしい意味を持つ場合があったり、あるいはその逆があったりすることです。これを防ぐために、コンピュータは画像とテキストの両方を同時に「読み」、パーツだけでなく物語全体を理解する方法を学ぶ必要があります。これはコンピュータにとって非常に大きな挑戦であり、特にネパール語のように、文字(デヴァナガリ文字)が画像の上に直接描かれている言語においてはなおさらです。
科学者たちは、こうした有害なミームを見つけ出すための、より優れた「デジタル探偵」を構築しようと試みてきました。通常、彼らは長い組み立てラインを作ろうとします。まず、機械が画像からテキストを読み取り(スキャナーのように)、次に別の機械がそれを翻訳し、最後に3番目の機械がそれが悪いものかどうかを判断するという仕組みです。しかし、これはパズルをバラバラに分解してから解こうとするようなもので、全体の絵を見失ってしまう可能性があります。この論文は、組み立てラインを必要としない、新しい探偵チームを紹介しています。その代わりに、彼らは人間と同じように、画像とテキストを同時に見ることができる、超スマートでオールインワンの脳を使用しています。研究者たちは、この脳をネパール語のミームでテストし、ヘイトスピーチを検知できるか、そしてそのムードが「喜び」「悲しみ」「中立」のどれであるかを判別できるかを検証しました。
論文のストーリー:2段階の探偵トレーニング
研究者のニティズ・カーナル氏とそのチームは、CHiPSAL 2026と呼ばれるコンペティションに参加しました。このコンペの目的は、ネパール語のミームにおけるヘイトスピーチの検出と感情分析において最高のシステムを構築することです。彼らは単にコンピュータを問題に投げ込んだわけではありません。彼らは、AIモデルのための巧妙な「2段階トレーニングキャンプ」を設計しました。
スタープレイヤー:Qwen3-VL
彼らのシステムの核となるのは、Qwen3-VL-8B-Instructという大規模な学習済みAIです。このモデルを、すでに世界中の何百万もの本を読み、何百万もの画像を見てきた天才的な学生だと考えてください。決定的なことに、この学生はすでにネパールで使用されるデヴァナガリ文字の読み方を知っているため、研究者たちはゼロから読み方を教えたり、テキストをスキャンするための別個のツールを使用したりする必要はありませんでした。モデルはミームを見れば、画像に書かれた言葉を即座に「見る」ことができたのです。
第1段階:クリエイティブ・ライター(創造的な書き手)
第1段階のトレーニングでは、チームはAIにクリエイティブ・ライターとして振る舞うよう教えました。彼らはAIに何千ものミームを見せ、「ヘイト(憎悪)」または「セーフ(安全)」、あるいは「ネガティブ」「ニュートラル」「ポジティブ」といった答えを書き出すよう求めました。コンピュータに負荷をかけすぎないために、彼らはLoRA(Low-Rank Adaptation)という技術を用いました。AIを、何百万冊の本がある巨大な図書館だと想像してください。ネパール語のミームについて教えるために、すべての本を書き換えるのではなく、研究者は単に棚にいくつかの付箋(学習可能な小さな層)を貼っただけです。これにより、AIは新しいタスクを迅速かつ効率的に学習することができました。
しかし、彼らが持っていたデータはバラバラでした。「セーフ」なミームは「ヘイト」なものよりも圧倒的に多く、「ニュートラル」なミームは「ポジティブ」や「ネガティブ」なものよりもはるかに多かったです。それは、トラの写真を1枚しか持っていないのに、猫の写真を1,000枚持っている状態で、珍しい動物を識別することを学ぶようなものです。これを修正するために、チームはオーバーサンプリング(希少なミームのコピーを増やすこと)と、画像拡張(画像の反転、回転、明るさ調整など)を行い、AIが単に画像を暗記するのではなく、実際にパターンを学習できるようにしました。3クラスの感情分析タスクに対しても、彼らはFocal Lossという特別な数学的トリックを使用しました。これは、AIが間違え続けている難しい例に対して、より注意を払うよう指示するものです。
第2段階:厳格なコーチ
第1段階は良好でしたが、研究者たちはAIをさらに鋭くしたいと考えました。第2段階では、「コントラスティブ学習(対照学習)」というコーチを追加しました。これは、「違いを見つける」ゲームのようなものです。コーチはAIに、どちらも「ヘイト」である2つのミームを見せ、「これらは仲間だ!」と言います。次に、「ヘイト」のミームと「セーフ」のミームを見せ、「これらは全く別物だ!引き離せ!」と言います。これにより、AIは似た概念を思考の中で密接にグループ化し、異なる概念を遠ざけることを学びました。この段階は単に答えを求めるだけでなく、AIにデータの「形」を理解させることで、その判断をより強固なものにしました。
最終判定:スコアの混合
最終試験の時、チームは第1段階か第2段階のどちらかの答えを選ぶだけではありませんでした。彼らは「チームの作戦会議(チーム・ハドル)」を作成しました。彼らは「クリエイティブ・ライター」(第1段階)からの確率スコアと、「厳格なコーチ」(第2段階)からのスコアを取り出し、特別な重みを用いてそれらを混ぜ合わせました。彼らは、最高のスコアが得られる完璧なバランスを見つけるために、練習セットでさまざまな混合比率をテストしました。
彼らが発見したこと
結果は素晴らしいものでした。チームのシステムは、ヘイトスピーチ検出タスクの公式リーダーボードで第2位を獲得し、スコア(Macro F1)は0.797に達しました。これは、クラスの不均衡という難しい問題がある中で、システムが有害なコンテンツを非常にうまく特定できたことを意味します。感情分析タスク(ミームがポジティブ、ネガティブ、またはニュートラルかを判断するタスク)では、スコア0.518でリーダーボードの4位に入りました。
研究者たちは、この2段階のアプローチこそが「秘伝のソース」であったことを見出しました。もし彼らが第1段階(単に答えを書くだけ)のみを使用していたら、スコアはもっと低くなっていたでしょう。第2段階(コントラスティブ学習)を加えることで、パフォーマンスが大幅に向上しました。また、彼らはこれら2つのタスクには異なるトレーニング・スタイルが必要であることも発見しました。ヘイトスピーチのタスクは比較的単純でしたが、感情分析のタスクは、特にユーモアが含まれる場合、「ニュートラル」と「ポジティブ」あるいは「ネガティブ」の境界線が曖昧であるため、学習がはるかに困難でした。感情モデルには、混乱を防ぐために、より厳格なルール(正則化)が必要でした。
なぜこれが重要なのか(そして、何がそうでないのか)
この論文は、ネパール語のようなリソースの少ない言語にとって、デヴァナガリ文字をネイティブに理解する強力なオールインワンの視覚言語モデルを使用することが、ゲームチェンジャーであることを示唆しています。複雑なツールの連鎖(個別のテキストスキャナーや翻訳機など)を使わなくても、単一のスマートなモデルがエンドツーエンドで理解できることを証明しています。
しかし、著者は自身のシステムが完璧ではないことも慎重に指摘しています。AIは時として深い文化的文脈を見逃すことがあると認めています。例えば、あるミームには歴史上の人物や特定の文化的ジョークが含まれており、AIには無害に見えても、ネパール人にとっては実は不快である、といったケースです。AIはスマートですが、まだ文化的な実体験を持っていません。また、データセットが比較的小さかった(各タスクにつき約1,000件のミーム)ため、モデルが真に学習したのではなく、トレーニングデータを暗記してしまったリスクがあり、異なるランダムシードでやり直した場合に結果が変わる可能性があることも述べています。
結局のところ、この研究は有望な道筋を示しています。つまり、テクノロジーによって取り残されてきた言語における、混沌として、面白く、時には危険なミームの世界を、大きくてスマートなAIモデルに理解させるという道です。これは、デジタルな街の広場を、すべての人にとってより安全で包括的なものにするための、一歩となります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。