← Derniers articles
💬 NLP

uva-irlab-conv at SemEval-2026 Task 8: Multi-Turn RAG with Learned Sparse Retrieval and Listwise Reranking

Cet article présente le système uva-irlab-conv pour la tâche 8 de SemEval-2026, qui emploie un pipeline de génération augmentée par récupération multi-tours combinant une recherche parcellaire apprise avec la réécriture de requêtes conversationnelles basée sur les LLM et un reclassement par liste afin de gérer efficacement des domaines diversifiés et des requêtes sans réponse.

Auteurs originaux : Simon Lupart, Kidist Amde Mekonnen, Zahra Abbasiantaeb, Mohammad Aliannejadi

Publié 2026-06-11
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Simon Lupart, Kidist Amde Mekonnen, Zahra Abbasiantaeb, Mohammad Aliannejadi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de trouver une information spécifique dans une bibliothèque immense, mais que vous ne posez pas seulement une question ; vous avez une longue conversation de va-et-vient avec un bibliothécaire. Parfois, vous dites : « Qui est le PDG ? » et la minute suivante, vous dites : « Quelle est son adresse ? ». La deuxième question n'a aucun sens sans la première. C'est le défi de la Recherche Multi-Tours et de la Réponse aux Questions (Multi-Turn Retrieval and Question Answering).

Le document que vous avez partagé décrit une équipe de l'Université d'Amsterdam (appelée uva-irlab-conv) qui a construit un système intelligent pour agir comme ce bibliothécaire. Ils ont participé à une compétition appelée SemEval-2026 Task 8 pour voir comment leur système pouvait gérer ces conversations à travers quatre sujets très différents : la finance, l'informatique en nuage (cloud computing), le gouvernement et Wikipédia.

Voici comment fonctionne leur système, expliqué par des analogies simples :

1. Le Traducteur (Réécriture de la requête)

Le Problème : Les humains utilisent des raccourcis. Si vous demandez : « Qui est le PDG ? » puis « Quel âge a-t-il ? », un ordinateur ne sait pas de qui « il » parle.
La Solution : Le système possède un « Traductur » (une IA) qui écoute tout l'historique de la conversation. Avant d'aller à la bibliothèque, il réécrit votre dernière question sous la forme d'une phrase complète et autonome.

  • Analogie : C'est comme un traducteur qui vous entend dire : « Je veux le bleu », et qui le réécrit pour le vendeur comme : « Je veux la chemise bleue du rayon que nous regardions à l'instant ».

2. L'Éclaireur Rapide (Recherche Sparse Apprise)

Le Problème : La bibliothèque contient des millions de documents. Vous ne pouvez pas tous les lire.
La Solution : Le système utilise un « Éclaireur Rapide » appelé LION-SP. C'est un type spécial de moteur de recherche qui est doué pour comprendre à la fois le sens des mots et les mots exacts utilisés. Il est conçu pour bien fonctionner même si le sujet change, passant de la finance au gouvernement.

  • Analogie : Imaginez un éclaireur qui court dans une immense forêt. Au lieu de lire chaque arbre, il balaie rapidement la zone à la recherche de mots-clés et de concepts spécifiques, extrayant les 1 000 feuilles les plus prometteuses pour les ramener au bureau principal.

3. Le Juge Expert (Reclassement / Reranking)

Le Problème : L'Éclaireur a rapporté 1 000 feuilles, mais vous n'en avez besoin que des 10 meilleures.
La Solution : Le système utilise un processus de jugement en deux étapes :

  • Étape A (Pointwise) : Une IA examine chaque feuille une par une et lui donne un score. Cela réduit la liste aux 20 meilleures.
  • Étape B (Listwise) : Une IA super intelligente (GPT-4.1) examine les 20 feuilles toutes en même temps, tout en se souvenant de l'intégralité de la conversation. Elle les compare entre elles pour décider de l'ordre parfait.
  • Analogie : D'abord, un entraîneur choisit les 20 meilleurs joueurs lors d'un essai. Ensuite, un entraîneur principal regarde ces 20 joueurs jouer ensemble lors d'un match d'entraînement pour décider de la composition finale de l'équipe, s'assurant qu'ils fonctionnent bien ensemble dans le contexte du match.

4. Le Conteur (Génération de la Réponse)

Le Problème : Vous avez maintenant les 10 meilleurs documents. Vous avez besoin d'une réponse claire.
La Solution : Le système prend les 5 meilleurs documents et l'historique complet de la conversation, puis demande à une IA puissante de rédiger la réponse finale.

  • Analogie : Un écrivain s'assoit avec les 5 meilleures notes de recherche et toute l'histoire de votre conversation pour rédiger un résumé court et précis pour vous.

Comment ont-ils réussi ?

L'équipe a participé à trois défis différents de la compétition :

  1. Trouver les documents (Tâche A) : Ils ont fait un travail incroyable, arrivant en 2ème place sur 38 équipes. Leur système était très bon pour trouver les bons documents, même dans des sujets complexes comme la finance.
  2. Répondre avec des documents parfaits (Tâche B) : On leur a donné les documents « corrects » par les juges et on leur a demandé de rédiger des réponses. Ils s'en sont bien sortis, mais pas le mieux.
  3. Répondre avec leur propre recherche (Tâche C) : Ils ont utilisé leurs propres résultats de recherche pour rédiger des réponses. Ils se sont classés 20èmes sur 29.

La grande conclusion :
Le document met en évidence un compromis spécifique. Leur système était excellent pour trouver la bonne information (récupération/retrieval). Cependant, lorsqu'il s'agissait de rédiger la réponse finale, il avait un peu de mal avec les questions qui ne pouvaient pas être répondues (comme « Quel est le mot de passe secret ? » quand le mot de passe ne figure pas dans les documents).

Les auteurs notent que leur système est très « fidèle », ce qui signifie qu'il invente rarement des choses (hallucinations) si l'information n'y est pas. Cependant, comme ils n'ont pas explicitement programmé le système pour dire « je ne sais pas » lorsque l'information est manquante, il tentait parfois de répondre à des questions auxquelles il ne pouvait pas pleinement répondre, ce qui a fait baisser son score dans les tâches de génération.

En bref : Ils ont construit une équipe de spécialistes de l'IA (un traducteur, un éclaireur, un juge et un conteur) qui travaillent ensemble pour gérer des conversations complexes. Ils sont des maîtres pour trouver les bons livres dans la bibliothèque, mais ils apprennent encore à admettre quand un livre ne contient tout simplement pas la réponse.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →