SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation
Dans cette présentation de la participation de SwanNLP à la tâche 5 de SemEval-2026, les auteurs proposent un cadre basé sur les grands modèles de langage (LLM) utilisant un mécanisme de raisonnement structuré et des stratégies de prompting dynamique pour évaluer la plausibilité des sens de mots dans des récits, démontrant que ces modèles peuvent reproduire avec précision les jugements humains.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
🦢 SwanNLP : Le Détective de l'Équivoque
Imaginez que vous racontez une petite histoire à un ami. Vous dites : "Il a pris le banc pour s'asseoir."
Votre ami comprend tout de suite : on parle d'un banc de parc, pas d'une banque d'argent. C'est facile.
Mais imaginez une histoire plus subtile : "Il a pris le banc pour pêcher."
Là, c'est ambigu ! Est-ce qu'il s'assoit sur un banc de bois ? Ou est-ce qu'il utilise un banc (un outil de menuisier) pour réparer sa canne ? Ou peut-être que le mot "banc" fait référence à un banc de poissons ?
C'est exactement le défi que les chercheurs de l'Université de Swansea (Swansea University) ont relevé pour le concours SemEval-2026. Leur mission ? Enseigner aux ordinateurs à comprendre non pas juste le mot, mais le sens probable d'un mot dans une histoire, exactement comme le ferait un humain.
🎯 Le Problème : Les Ordinateurs sont Trop "Bêtes" ou Trop "Intelligents"
Jusqu'à présent, les ordinateurs étaient entraînés sur des phrases isolées, comme des exercices de grammaire.
- L'ordinateur classique : Il regarde les mots voisins. Si le mot "pêche" est proche de "banc", il devine "poisson". Mais si l'histoire est complexe, il perd le fil.
- Le géant (LLM) : Les très gros modèles d'intelligence artificielle (comme GPT-4) sont brillants, mais ils coûtent cher et parfois, ils "rêvent" trop au lieu de suivre la logique de l'histoire.
Les chercheurs voulaient savoir : Comment faire en sorte qu'un ordinateur juge la "plausibilité" (la crédibilité) d'un sens, comme le ferait un humain ?
🛠️ La Solution : Trois Approches Créatives
L'équipe a testé trois stratégies principales, que l'on peut comparer à trois méthodes pour résoudre un mystère :
1. L'Entraînement Intensif (Le "Moulinet" de la Mémoire)
Ils ont pris des modèles d'intelligence artificielle plus petits et économiques (comme des "étudiants") et ils les ont fait lire des milliers d'histoires avec des corrections.
- L'analogie : C'est comme donner à un étudiant un manuel d'exercices corrigés. On lui dit : "Dans cette histoire, le mot 'banc' signifie 'poisson' avec un score de 4/5 de crédibilité."
- Le résultat : Ils ont appris à l'étudiant à raisonner étape par étape (comme un détective qui examine les indices) avant de donner son verdict. Cela a bien fonctionné, mais l'étudiant restait parfois un peu rigide.
2. Le "Copier-Coller" Intelligent (Le "Cheat Sheet" Dynamique)
Pour les modèles géants (les "génies"), ils n'ont pas voulu les réapprendre de zéro. Au lieu de cela, ils ont créé une bibliothèque de cas similaires.
- L'analogie : Imaginez que vous posez une question à un génie, mais avant qu'il ne réponde, vous lui glissez discrètement un petit mot : "Hey, regarde ce cas similaire où 'banc' signifiait 'poisson', ça t'aide ?"
- La magie : Le système cherche automatiquement dans sa mémoire les 1 ou 3 histoires les plus proches de celle qu'il doit analyser. Cela permet au modèle de s'adapter instantanément au contexte, comme un humain qui se souvient d'une anecdote similaire pour mieux comprendre la situation actuelle.
3. Le Jury de 5 Personnes (L'Ensemble)
C'est l'astuce la plus ingénieuse. Dans la vraie vie, si on demande à 5 personnes de noter la crédibilité d'une histoire, elles ne sont pas toujours d'accord. Parfois, l'une dit "4/5", l'autre "3/5".
- L'analogie : Au lieu de demander à un seul robot de répondre, l'équipe a fait travailler 5 robots différents sur la même histoire. Ensuite, ils ont fait une moyenne de leurs réponses (ou un vote majoritaire).
- Le résultat : C'est comme si on avait un jury. Même si un robot se trompe, les autres compensent. Cela donne un résultat beaucoup plus proche de la réalité humaine, car cela capture la nuance et l'incertitude, au lieu de donner une réponse binaire (vrai/faux).
🏆 Les Résultats : Ce qui a marché
- Le "Petit" vs le "Géant" : Les petits modèles entraînés avec soin (méthode 1) sont devenus très bons, mais les géants (méthode 2) qui utilisaient des exemples similaires ont été les plus proches du jugement humain.
- La puissance du Jury : La méthode du "Jury de 5 robots" (méthode 3) a donné les meilleurs résultats. En simulant l'accord (ou le désaccord) de plusieurs humains, le système est devenu plus fiable et plus "humain".
- Le Classement : Grâce à cette combinaison de techniques, l'équipe de Swansea a fini 10ème sur le podium mondial, prouvant que leur approche est solide.
💡 En Résumé
Ce papier nous dit que pour comprendre les histoires, les ordinateurs ne doivent pas seulement "lire" les mots, ils doivent imaginer le contexte et simuler le doute humain.
En utilisant des techniques de "rappel d'exemples" (comme consulter ses notes) et en faisant travailler plusieurs modèles en équipe (comme un jury), on arrive à créer une intelligence artificielle qui ne se contente pas de calculer, mais qui comprend la nuance d'une histoire, un peu comme vous et moi.
C'est un pas de géant vers des IA capables de raconter et de comprendre des histoires avec autant de finesse que des humains ! 📖✨
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.