← Nieuwste papers
💬 NLP

NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track

NightFeats is een context-geoptimaliseerd, multi-agent RAG-systeem dat de Best Dynamic Evaluation bij NeurIPS 2025 won door een principiële driefasige pijplijn van retrieval, curatie en compositie toe te passen om propriëtaire baselines te overtreffen door middel van architecturale transparantie en verifieerbare bewijsvoering in plaats van smalle metriekoptimalisatie.

Oorspronkelijke auteurs: Quentin Fever, Naziha Aslam

Gepubliceerd 2026-06-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Quentin Fever, Naziha Aslam

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een perfect, betrouwbaar rapport probeert te schrijven over een complex onderwerp, maar je hebt een team van drie specialisten die samenwerken in plaats van één persoon die alles alleen doet. Dat is in essentie wat NightFeats is: een slim team van drie AI-agenten die ontworpen zijn om vragen nauwkeurig te beantwoorden, hun eigen werk te controleren en altijd hun huiswerk te laten zien (citaties).

Het team heeft onlangs deelgenomen aan een grote competitie genaamd MMU-RAGent bij NeurIPS 2025. Terwijl andere teams probeerden te winnen door hun antwoorden er simpelweg zo te laten uitzien als de "correcte" antwoorden op een computertest, won NightFeats een speciale prijs genaamd "Best Dynamic Evaluation." Dit betekent dat echte mensen de voorkeur gaven aan hun antwoorden omdat ze betrouwbaarder en makkelijker te vertrouwen waren, zelfs als de automatische score van de computer hen niet de hoogste punten gaf.

Hier is hoe het NightFeats-team werkt, onderverdeeld in eenvoudige stappen:

1. De Drie Specialisten (De Agenten)

In plaats van één AI die alles tegelijk probeert te doen, verdeelt NightFeats de taak in drie duidelijke rollen, zoals een redactie:

  • De Onderzoeker (ResearchAgent): Dit is de detective. Wanneer je een vraag stelt, zoekt de Onderzoeker niet zomaar de eerste de beste informatie op die hij vindt. Hij gaat op zoek naar informatie uit twee verschillende bronnen:

    • De "Verse" Bibliotheek: Voor nieuws of recente gebeurtenissen kijkt hij naar de allernieuwste webresultaten.
    • De "Historische" Bibliotheek: Voor oude, fundamentele feiten graaft hij in enorme archieven.
    • De Truc: Het gebruikt een speciale formule om de balans te vinden tussen relevantie (hoe goed het antwoord is) en actualiteit (hoe nieuw het is). Het is als een bibliothecaris die weet dat een boek van 10 jaar oud perfect kan zijn voor geschiedenis, maar dat een blogpost van 10 minuten oud beter is voor de aandelenmarkt van vandaag.
  • De Redacteur (GeneratorAgent): Dit is de factchecker. De Onderzoeker stuurt een stapel documenten naar de Redacteur. De Redacteur leest ze, haalt de belangrijkste feiten eruit en zoekt naar conflicten.

    • De "Tegenstrijdigheids"-check: Als één bron zegt "De lucht is blauw" en een andere zegt "De lucht is groen", dan raadt de Redacteur niet gewoon een antwoord. Hij markeert dit als een probleem. Als het conflict ernstig is, stuurt de Redacteur de Onderzoeker weer naar buiten om meer bewijs te vinden om de discussie te beslechten. Hij doet dit slechts een paar keer om te voorkomen dat hij in een eindeloze lus terechtkomt.
  • De Schrijver (WriterAgent): Dit is de verhalenverteller. Zodra de Redacteur een schone, geverifieerde lijst met feiten heeft, verandert de Schrijver deze in een vloeiend, leesbaar antwoord.

    • De Gouden Regel: Elke zin die de Schrijver produceert, moet een "bewijsstuk" (een citatie) bij zich hebben. Je kunt niet zomaar iets beweren; je moet bewijzen waar je het vandaan hebt. Dit maakt het uiteindelijke antwoord volledig traceerbaar.

2. Waarom Ze Wonnen (De "Dynamic Evaluation" Award)

In de competitie waren er twee manieren om de systemen te beoordelen:

  1. De Robot-rechter: Een computerprogramma dat controleert of het antwoord dezelfde woorden gebruikt als het "perfecte" antwoord.
  2. De Menselijke Rechter: Echte mensen die de antwoorden lezen en degene kiezen die zij het beste vonden.

Het Problek met de Robot-rechter:
NightFeats scoorde eigenlijk lager op de test van de Robot-rechter (specifiek op een metriek genaamd ROUGE-L). Waarom? Omdat NightFeats veel citaties en referenties bevat (zoals "Bron A, Bron B"). De Robot-rechter dacht: "Dit antwoord bevat te veel extra woorden en cijfers, het komt niet exact overeen met het perfecte antwoord!"

De Winst met de Menselijke Rechter:
Echte mensen waren echter dol op NightFeats. Ze gaven de voorkeur aan NightFeats boven dure, hoogtechnologische systemen zoals "Claude-SonnetV2" en "Nova-Pro". Mensen realiseerden zich dat een antwoord met duidelijke bronnen en geverifieerde feiten veel betrouwbaarder is dan een antwoord dat er alleen maar goed klinkt maar misschien verzonnen is.

3. De Kernfilosofie

Het paper betoogt dat het bouwen van AI niet alleen moet gaan over het foppen van een computer om een hoge score te krijgen. Het moet gaan over het bouwen van een systeem dat:

  • Zijn eigen werk controleert (zoals een factchecker).
  • Weet wanneer zaken oud zijn (temporeel bewustzijn).
  • Zijn bronnen laat zien (citatie-traceerbaarheid).

De Trade-off

Het paper is eerlijk over een nadeel: Omdat NightFeats de Onderzoeker moet terugsturen om feiten te controleren en de Redacteur om tegenstrijdigheden te controleren, duurt het iets langer om een antwoord te krijgen (ongeveer 10–15 seconden) vergeleken met een sneller, simpeler systeem (6–8 seconden).

Samenvattend:
NightFeats is als een hoogwaardige redactie die weigert een verhaal te publiceren voordat drie verschillende mensen de feiten hebben gecontroleerd, de data hebben geverifieerd en bij elke bewering een bewijsstuk hebben gevoegd. Hoewel dit iets meer tijd kost en er voor een computerscanner misschien "rommeliger" uitziet, vertrouwen echte mensen het meer omdat het eerlijk, accuraat en transparant is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →