UFAL-CUNI at SemEval-2026 Task 11: An Efficient Modular Neuro-symbolic Method for Syllogistic Reasoning
L'équipe UFAL-CUNI présente un système neuro-symbolique modulaire et efficace pour la tâche 11 de SemEval-2026, qui combine un analyseur de LLM léger de 4 milliards de paramètres avec un prouveur de théorèmes symbolique pour atteindre une précision compétitive en raisonnement syllogistique tout en surpassant les modèles de base en zéro-shot, bien qu'il mette en lumière les limites des capacités multilingues des modèles plus petits.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'enseigner à un étudiant très intelligent, mais légèrement distrait (un Modèle de Langage de Grande Taille) comment résoudre des énigmes logiques appelées syllogismes. Ce sont des énigmes comme :
- Prémisse 1 : Tous les chats sont des animaux.
- Prémisse 2 : Certains animaux sont duveteux.
- Conclusion : Par conséquent, certains chats sont duveteux.
Le problème est que cet étudiant a une mauvaise habitude : il laisse ses connaissances du monde réel interférer. Si l'énigme dit « Tous les chats sont duveteux », l'étudiant pourrait répondre « Vrai » simplement parce qu'il sait que les chats sont duveteux, même si la logique de l'énigme ne soutient pas réellement cette conclusion. C'est ce qu'on appelle l'« effet de contenu ». L'étudiant est biaisé par ce qu'il pense être vrai, plutôt que par ce que les règles de l'énigme disent.
Les auteurs de cet article ont construit un « système de tutorat » spécial pour corriger cela. Voici comment leur système fonctionne, expliqué simplement :
1. Le Traducteur (L'Interprète Bilingue)
Tout d'abord, si l'énigme est dans une langue étrangère (comme le portugais ou le russe), le système utilise un modèle de langage de grande taille pour la traduire en anglais. Pensez-y comme à un traducteur qui s'assure que tout le monde parle la même langue avant que le jeu de logique ne commence.
2. L'Expert en Notation (L'Auteur LaTeX)
C'est l'astuce intelligente du système. Au lieu de demander à l'étudiant de résoudre l'énigme directement, le système lui demande de réécrire les phrases dans un « code » spécifique appelé Logique du Premier Ordre (FOL), écrit dans un format appelé LaTeX (qui ressemble à des formules mathématiques).
- Pourquoi LaTeX ? Les auteurs ont réalisé que demander à l'étudiant d'écrire directement dans le « langage natif » de l'ordinateur (la syntaxe Prover9) était comme demander à un humain de parler en code binaire. Cela provoquait trop d'erreurs.
- L'Analogie : C'est comme demander à un étudiant d'écrire un problème mathématique sur un tableau blanc en utilisant des symboles standards (, , ) d'abord, plutôt que d'essayer de le taper directement dans une calculatrice qui ne comprend qu'un code étrange et spécifique. L'étudiant est beaucoup plus à l'aise pour écrire la version « tableau blanc » car il l'a vue dans ses données d'entraînement.
3. Le Traducteur (Le Convertisseur de Code)
Une fois que l'étudiant a écrit la logique au format « tableau blanc » (LaTeX), un simple script informatique (un « transpileur ») agit comme un éditeur strict. Il convertit instantanément ce code LaTeX propre en le code spécifique et rigide dont l'ordinateur a besoin pour exécuter la preuve (syntaxe Prover9). Cette étape est purement mécanique et n'implique pas l'étudiant « distrait », elle fait donc rarement des erreurs.
4. Le Juge (Le Démonstrateur Automatique)
Enfin, le système remet le code rigide à un Démonstrateur de Théorèmes (un logiciel appelé Prover9). C'est un juge robot qui n'a ni émotions ni connaissances du monde réel. Il ne se soucie pas de savoir si les chats sont duveteux ou si la lune est faite de fromage. Il vérifie uniquement : La conclusion découle-t-elle mathématiquement des prémisses ? Si les maths fonctionnent, il dit « Valide ». Sinon, « Non valide ».
5. Le Détective (Trouver les Indices Importants)
Pour les énigmes plus difficiles où il y a des phrases supplémentaires et inutiles mélangées, le système utilise un « algorithme glouton ». Il agit comme un détective qui essaie de retirer un indice à la fois. Si l'énigme a toujours du sens sans un indice spécifique, cet indice est sans pertinence. Si l'énigme s'effondre, cet indice était nécessaire. Cela garantit que le système se concentre uniquement sur les faits qui comptent réellement.
Qu'ont-ils découvert ?
- Petit est Beau : Ils ont utilisé un modèle d'IA relativement petit (4 milliards de paramètres) pour la partie « étudiant ». Même si les petits modèles ont généralement du mal avec la logique complexe, ce système les a rendus très bons en déléguant le raisonnement réel au juge robot.
- Battre le Biais : En forçant l'IA à traduire d'abord en logique, puis en laissant un robot juger le résultat, ils ont réussi à empêcher l'IA d'être biaisée par les faits du monde réel. L'« effet de contenu » a considérablement diminué.
- Le Problème de la Métrique : L'article pointe également un défaut dans la façon dont le concours était noté. Le système de notation était si sensible qu'une toute petite erreur aléatoire pouvait faire chuter le score d'une équipe, rendant difficile de dire si un système était vraiment « bon » ou simplement « chanceux ».
La Conclusion
L'article montre que vous n'avez pas besoin d'une IA géante et super-intelligente pour résoudre des énigmes logiques. Au lieu de cela, vous pouvez utiliser une petite IA comme traducteur pour transformer le langage humain en mathématiques, puis laisser un robot bête mais parfait faire le véritable travail de réflexion. Cette combinaison empêche l'IA de se laisser distraire par ce qu'elle « sait » sur le monde et la force à s'en tenir strictement aux règles de la logique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.