← Derniers articles
💬 NLP

HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization

Le système HABIB_TAZ a atteint les premiers rangs de la tâche 11 de SemEval-2026 en employant des modèles mDeBERTa-v3 entraînés sur des données syllogistiques synthétiques avec une optimisation multi-objectif afin de démêler efficacement la logique formelle du biais de contenu à travers plusieurs langues.

Auteurs originaux : Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

Publié 2026-07-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot super intelligent comment résoudre des énigmes de logique. Vous lui donnez une règle : « Si tous les oiseaux peuvent voler, et qu'un manchot est un oiseau, alors un manchot peut voler. » Un humain pourrait marquer une pause et dire : « Attendez, les manchots ne peuvent pas voler ! Cette règle est fausse dans le monde réel. » Mais un robot qui s'appuie trop sur son « bon sens » pourrait être confus. Il pourrait penser : « Oh, les manchots sont des oiseaux, et les oiseaux volent, donc la conclusion doit être vraie », même si la logique elle-même est erronée parce que la règle de départ était fausse. C'est le problème délicat que les scientifiques essaient de résoudre avec les Grands Modèles de Langage (LLM). Ces modèles sont les cerveaux d'IA puissants derrière les chatbots et les moteurs de recherche. Ils sont incroyables pour écrire des histoires et répondre à des questions, mais ils ont souvent du mal à séparer ce qui est logiquement vrai de ce qui semble crédible. Ils sont piégés par les « effets de contenu », où la signification réelle des mots les distrait de la structure réelle de l'argument. L'objectif de cette recherche est de construire une IA qui agit comme un logicien strict : un qui vérifie si le calcul de l'argument fonctionne, peu importe si l'histoire semble absurde ou sensée.

L'équipe derrière ce projet, HABIB_TAZ, a participé à une compétition appelée SemEval-2026 Task 11 pour tester précisément cette capacité. Leur mission était de créer un système capable d'examiner des syllogismes (un type d'argument logique avec deux prémisses et une conclusion) dans 12 langues différentes et de décider si la conclusion respectait les règles, même si les prémisses étaient insensées ou s'il y avait des phrases supplémentaires et distrayantes ajoutées.

Pour résoudre cela, les chercheurs n'ont pas simplement nourri leur IA avec plus de données du monde réel. Au lieu de cela, ils ont construit un terrain d'entraînement « synthétique ». Imaginez qu'ils aient créé une immense usine générant des millions d'énigmes de logique en utilisant des règles strictes et inventées ainsi que des mots de charabia, plutôt que de vrais animaux ou objets. C'était pour empêcher l'IA d'apprendre des raccourcis basés sur les connaissances du monde réel. Ils ont ensuite entraîné leur modèle d'IA, basé sur un puissant moteur de langage appelé mDeBERTa-v3, en utilisant une recette d'entraînement spéciale en trois parties. Premièrement, ils ont utilisé une technique pour s'assurer que le modèle n'ignorait pas les exemples les plus difficiles et les plus complexes. Deuxièmement, ils ont ajouté une « pénalité de biais », qui est comme un professeur qui réprimande doucement l'élève chaque fois qu'il est distrait par l'aspect « plausible » d'une histoire, le forçant à se concentrer uniquement sur la logique. Troisièmement, ils ont utilisé une vérification de cohérence pour s'assurer que le modèle comprenait qu'une phrase complexe signifiait la même chose logiquement qu'une phrase simple.

Les résultats ont été un mélange de scores parfaits et de défis intéressants. Sur les tâches plus simples — les énigmes uniquement en anglais, les énigmes en anglais avec des distractions, et les énigmes dans 12 langues sans distractions — leur système a obtenu un score parfait de 100,0. Il a complètement ignoré les pièges du « monde réel » et a trouvé la logique juste à chaque fois, avec un biais nul. Cependant, le défi le plus difficile était la tâche « Noisy Multilingual » (multilingue bruyante), où l'IA devait gérer 12 langues et des phrases de distraction. Ici, le système s'est classé 6e. Il a obtenu 89,06 % de bonnes réponses, mais il présentait encore un léger biais (2,89 %).

Les chercheurs ont constaté que leur recette d'entraînement spéciale fonctionnait à merveille pour les tâches plus faciles, prouvant que l'on peut enseigner à une IA à être un pur logicien si on l'entraîne sur des données synthétiques basées sur des règles plutôt que sur du texte désordonné du monde réel. Pour la tâche la plus difficile, ils ont remarqué que le modèle éprouvait plus de difficultés avec les données multilingues originales qu'avec les traductions anglaises, suggérant que la manière dont le modèle gère les différentes langues est encore un peu fragile. Ils ont également découvert que l'ajout d'une vérification de « cohérence » spécifique (utilisant la divergence KL) aidait le modèle à rester stable à travers différentes langues, bien que cela nécessite beaucoup de puissance informatique pour fonctionner. En fin de compte, l'article suggère que, bien que nous puissions construire des IA qui sont incroyablement bonnes en logique pure, les rendre robustes à travers chaque langue et chaque type de bruit est encore un travail en cours. L'équipe a rendu son code et ses outils de génération de données publics, dans l'espoir que d'autres les utiliseront pour construire une IA encore plus logique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →