NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track
NightFeats est un système RAG multi-agents optimisé pour le contexte qui a remporté le prix Best Dynamic Evaluation à NeurIPS 2025 en employant un pipeline principled de trois phases de récupération, de curation et de composition pour surpasser les bases de référence propriétaires grâce à une transparence architecturale et un ancrage par preuves vérifiables plutôt que par une optimisation de métriques étroites.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'écrire un rapport parfait et digne de confiance sur un sujet complexe, mais que vous avez une équipe de trois spécialistes travaillant ensemble au lieu d'une seule personne faisant tout toute seule. C'est essentiellement ce qu'est NightFeats : une équipe intelligente de trois agents IA conçue pour répondre aux questions avec précision, vérifier son propre travail et toujours montrer ses devoirs (citations).
L'équipe a récemment participé à une grande compétition appelée MMU-RAGent à NeurIPS 2025. Alors que d'autres équipes tentaient de gagner en faisant simplement en sorte que leurs réponses ressemblent aux réponses « correctes » sur un test informatique, NightFeats a remporté un prix spécial appelé « Best Dynamic Evaluation » (Meilleure évaluation dynamique). Cela signifie que des humains réels ont préféré leurs réponses car elles étaient plus fiables et plus faciles à faire confiance, même si le score automatique de l'ordinateur ne leur donnait pas les points les plus élevés.
Voici comment fonctionne l'équipe NightFeats, décomposée en étapes simples :
1. Les trois spécialistes (Les Agents)
Au lieu d'une seule IA essayant de tout faire à la fois, NightFeats divise le travail en trois rôles distincts, comme une salle de rédaction :
Le Chercheur (ResearchAgent) : C'est le détective. Quand vous posez une question, le Chercheur ne se contente pas de saisir la première chose qu'il trouve. Il part chercher des informations dans deux endroits différents :
- La bibliothèque « Fraîche » : Pour les actualités ou les événements récents, il cherche dans les résultats web les plus récents.
- La bibliothèque « Historique » : Pour les faits fondamentaux anciens, il fouille dans de vastes archives.
- L'astuce : Il utilise une formule spéciale pour équilibrer la pertinence (à quel point la réponse est bonne) et la fraîcheur (à quel point elle est récente). C'est comme un bibliothécaire qui sait qu'un livre de 10 ans peut être parfait pour l'histoire, mais qu'un article de blog datant de 10 minutes est meilleur pour la bourse d'aujourd'hui.
L'Éditeur (GeneratorAgent) : C'est le vérificateur de faits. Le Chercheur envoie une pile de documents à l'Éditeur. L'Éditeur les lit, extrait les faits clés et recherche les conflits.
- La vérification de la « Contradiction » : Si une source dit « Le ciel est bleu » et qu'une autre dit « Le ciel est vert », l'Éditeur ne devine pas. Il signale cela comme un problème. Si le conflit est sérieux, l'Éditeur renvoie le Chercheur chercher plus de preuves pour régler l'argument. Il ne fait cela que quelques fois pour éviter de s'enfermer dans une boucle infinie.
Le Rédacteur (WriterAgent) : C'est le conteur. Une fois que l'Éditeur a une liste de faits propre et vérifiée, le Rédacteur les transforme en une réponse fluide et lisible.
- La règle d'or : Chaque phrase produite par le Rédacteur doit avoir un « reçu » attaché à elle (une citation). On ne peut pas simplement dire quelque chose ; il faut prouver d'où on l'a entendu. Cela rend la réponse finale entièrement traçable.
2. Pourquoi ils ont gagné (Le prix « Dynamic Evaluation »)
Dans la compétition, il y avait deux manières principales de juger les systèmes :
- Le Juge Robot : Un programme informatique qui vérifie si la réponse utilise les mêmes mots que la réponse « parfaite ».
- Le Juge Humain : Des personnes réelles qui lisent les réponses et choisissent celle qu'elles préfèrent.
Le problème avec le Juge Robot :
NightFeats a en réalité obtenu un score plus bas au test du Juge Robot (plus précisément sur une métrique appelée ROUGE-L). Pourquoi ? Parce que NightFeats inclut beaucoup de citations et de références (comme « Source A, Source B »). Le Juge Robot a pensé : « Cette réponse contient trop de mots et de chiffres supplémentaires, elle ne correspond pas exactement à la réponse parfaite ! »
La victoire avec le Juge Humain :
Les humains réels, cependant, ont adoré NightFeats. Ils l'ont préféré à des systèmes coûteux et de haute technologie comme « Claude-SonnetV2 » et « Nova-Pro ». Les humains ont réalisé qu'une réponse avec des sources claires et des faits vérifiés est bien plus digne de confiance qu'une réponse qui a simplement l'air bonne mais qui pourrait être inventée.
3. La philosophie centrale
L'article soutient que construire l'IA ne devrait pas seulement consister à tromper un ordinateur pour obtenir un score élevé. Cela devrait consister à construire un système qui :
- Vérifie son propre travail (comme un vérificateur de faits).
- Sait quand les choses sont anciennes (conscience temporelle).
- Montre ses sources (traçabilité des citations).
Le compromis
L'article est honnête sur un inconvénient : parce que NightFeats doit envoyer le Chercheur vérifier les faits et l'Éditeur vérifier les contradictions, il prend un peu plus de temps pour obtenir une réponse (environ 10 à 15 secondes) par rapport à un système plus rapide et plus simple (6 à 8 secondes).
En résumé :
NightFeats est comme une salle de rédaction haut de gamme qui refuse de publier une histoire avant que trois personnes différentes n'aient vérifié les faits, vérifié les dates et joint des reçus à chaque affirmation. Bien que cela prenne un peu plus de temps et puisse paraître plus « désordonné » pour un scanner informatique, les vraies personnes lui font plus confiance car il est honnête, précis et transparent.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.