← 最新の論文
💬 NLP

HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization

HABIB_TAZシステムは、合成された三段論法データを用いて学習させたmDeBERTa-v3モデルを採用し、マルチオブジェクティブ最適化を用いることで、複数の言語にわたって形式論理と内容バイアスを効果的に分離することにより、SemEval-2026 Task 11においてトップランキングを獲得した。

原著者: Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いロボットに論理パズルを解く方法を教えているところだと想像してください。あなたは次のようなルールを与えます。「もし全ての鳥が飛べるなら、そしてペンギンは鳥であるならば、ペンギンは飛べる。」人間なら、「待てよ、ペンギンは飛べない!このルールは現実の世界では間違っている」と立ち止まるかもしれません。しかし、「常識」に頼りすぎるロボットは混乱してしまうかもしれません。ロボットは、「おや、ペンギンは鳥であり、鳥は飛ぶのだから、結論は真実であるはずだ」と考えるかもしれません。たとえ、出発点となるルールが間違っていたとしても、論理自体が欠陥していることに気づかずに。これが、科学者たちが大規模言語モデル(LLM)で解決しようとしているトリッキーな問題です。これらはチャットボットや検索エンジンの背後にある強力なAIの脳です。これらは物語を書いたり質問に答えたりすることには長けていますが、「論理的に正しいこと」と「もっともらしく聞こえること」を区別することにしばしば苦戦します。彼らは、言葉の現実世界における意味が、実際の議論の構造から注意を逸らしてしまう「コンテンツ効果」によって騙されてしまうのです。この研究の目標は、たとえ話が馬鹿げた内容であっても、数学的な議論の仕組みが成立しているかどうかをチェックする、厳格な論理学者のように振る舞うAIを構築することです。

このプロジェクトのチームであるHABIB_TAZは、まさにこの能力をテストするために、SemEval-2026 Task 11と呼ばれるコンペティションに参加しました。彼らの使命は、12の異なる言語における三段論法(2つの前提と1つの結論からなる論理的議論の一種)を見て、前提がナンセンスであったり、余計な文章が紛れ込んでいたりしても、結論がルールに従っているかどうかを判断するシステムを作ることでした。

これを解決するために、研究者たちは単にAIに現実世界のデータをより多く読み込ませたのではありません。代わりに、彼らは「合成的」な訓練場を構築しました。想像してみてください。彼らが、現実の動物や物体ではなく、厳格に作られた架空のルールと意味不明な言葉を用いて、何百万もの論理パズルを生成する巨大な工場を作ったところを。これは、AIが現実世界の知識に基づいたショートカット(近道)を学習するのを防ぐためでした。そして、彼らはmDeBERTa-v3と呼ばれる強力な言語エンジンに基づいたAIモデルに対し、特別な3部構成のトレーニングレシピを用いて訓練を行いました。第一に、モデルがより難しくトリッキーな例を無視しないようにするテクニックを用いました。第二に、「バイアス・ペナルティ」を追加しました。これは、ストーリーがいかに「もっともらしい」かということに気を取られるたびに、教師が学生を優しく叱るようなもので、論理だけに集中するように強制するものです。第三に、複雑な文章が単純な文章と同じ論理的な意味を持つことをモデルが理解できるように、一貫性チェックを用いました。

結果は、完璧なスコアと興味深い課題の両方を示しました。より単純なタスク、すなわち英語のみのパズル、邪魔な文章が含まれる英語のパズル、そして邪魔な文章を含まない12言語のパズルにおいて、彼らのシステムは完璧な100.0のスコアを達成しました。彼らは「現実世界」のトリックを完全に無視し、バイアスもゼロで、論理を毎回正しく導き出しました。しかし、最も困難な挑戦は「ノイジー・マルチリンガル(雑音混じりの多言語)」タスクでした。ここでは、AIが12の言語と、同時に邪魔な文章に対処しなければなりませんでした。ここで、システムは6位となりました。89.06%の回答を正解しましたが、依然としてわずかなバイアス(2.89%)が見られました。

研究者たちは、彼らの特別なトレーニングレシピがより簡単なタスクにおいては素晴らしい効果を発揮したこと、つまり、現実世界の乱雑なテキストではなく、合成されたルールベースのデータで訓練すれば、純粋な論理学者としてのAIを教えることができることを証明しました。最も困難なタスクについては、モデルが英語の翻訳よりも元の多言語データに対して苦戦したことに気づきました。これは、モデルが異なる言語を扱う方法がいまだに不安定であることを示唆しています。また、特定の「一貫性」チェック(KLダイバージェンスを使用)を追加することで、モデルが異なる言語間で安定することを発見しましたが、それには膨大な計算能力を必要としました。最終的に、この論文は、驚異的に優れた純粋論理を実現できるAIを構築することは可能である一方で、あらゆる言語やあらゆる種類のノイズに対して堅牢にすることは、依然として進行中の課題であることを示唆しています。チームは、より優れた、より論理的なAIを構築するために他の人々が利用できるよう、彼らのコードとデータ生成ツールを公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →