← Nieuwste papers
💬 NLP

Benchmarking Real-Time Question Answering via Executable Code Workflows

Dit paper introduceert RT-QA, een dynamisch evaluatiekader dat uitvoerbare code-workflows gebruikt om real-time antwoorden te genereren en aantoont dat zelfs de meest geavanceerde modellen significant falen door gebrek aan diepgaande web-scanning en slecht tijdsbewustzijn.

Oorspronkelijke auteurs: Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

Gepubliceerd 2026-04-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente assistent hebt die alles over de wereld weet. Maar er is een probleem: deze assistent heeft een geheugen dat "bevroren" is op een bepaalde datum. Als je hem vraagt: "Wat is het weer morgen?" of "Wie heeft gisteren gewonnen in de loterij?", kan hij het antwoord niet weten, omdat zijn kennisboekje verouderd is. Hij probeert het antwoord te raden op basis van oude feiten, wat vaak leidt tot fouten.

Dit artikel introduceert RT-QA (Real-Time Question Answering), een nieuwe manier om te testen of deze digitale assistenten écht goed kunnen omgaan met de huidige wereld.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. Het Probleem: De "Oude Krant" vs. De "Live TV"

Tot nu toe werden slimme computers getest met vragen die als een oude krant zijn: de antwoorden staan vast en veranderen nooit.

  • Voorbeeld: "Wie schreef Hamlet?" (Het antwoord is altijd Shakespeare).
  • Het probleem: In het echte leven zijn veel vragen als live televisie. De antwoorden veranderen elke dag. "Wat is de beurskoers van gisteren?" of "Welke concerten zijn er morgen?". Als je een assistent vraagt naar "morgen", en hij denkt dat het nog 2024 is, geeft hij een fout antwoord.

De auteurs zeggen: "We moeten stoppen met testen met oude kranten en beginnen met testen met live nieuws."

2. De Oplossing: Een Robot die Zelf Code Schrijft

In plaats van dat mensen handmatig antwoorden opschrijven voor de test (wat snel veroudert), hebben de onderzoekers een slimme truc bedacht: RT-QA.

Stel je voor dat je geen antwoorden opschrijft, maar een recept schrijft.

  • De oude manier: Je schrijft op: "Het antwoord is 42." (Maar als de werkelijkheid morgen 43 is, is je antwoord fout).
  • De RT-QA manier: Je schrijft een recept (code) op: "Ga naar de website van de beurs, lees het bordje, en schrijf het getal op."

Elke keer als je dit recept uitvoert, krijg je het huidige antwoord. Het is alsof je een robot hebt die elke dag opnieuw de krant leest in plaats van een krant van 2024 te gebruiken.

3. De "Zelf-Reparatie" (De Slimme Tuinman)

Websites veranderen vaak. Een knop verplaatst zich, een menu verandert van naam. Normaal gesproken zou je code dan kapot gaan.
RT-QA heeft een robot-tuinman ingebouwd. Als de code vastloopt omdat de website veranderd is, denkt de robot: "Oh, de bloem is verplaatst. Ik pas mijn gereedschap aan en pluk de bloem opnieuw." Zo blijft het systeem altijd werken, zonder dat mensen handmatig hoeven te ingrijpen.

4. Wat Vonden Ze? (De Teleurstellende Resultaten)

De onderzoekers hebben de beste AI-modellen ter wereld (zoals GPT-5.2 en andere) getest met deze nieuwe methode. Het nieuws is niet zo goed als je hoopt:

  • De Score: Zelfs de slimste modellen haalden maar een 46% slaagkans. Dat is net iets meer dan een muntje gooien.
  • Fout 1: "Luie Zoeken" (Lazy Retrieval):
    • Vergelijking: Stel je vraagt iemand naar het nieuws van gisteren. In plaats van naar de krant te kijken, leest hij alleen de koppen op de voorpagina en raadt hij de rest.
    • Realiteit: De AI's kijken vaak niet diep genoeg. Ze vertrouwen op samenvattingen van zoekmachines in plaats van de echte website te bezoeken.
  • Fout 2: "Tijdsverwarring" (Temporal Confusion):
    • Vergelijking: Stel je vraagt: "Wie won de wedstrijd van gisteren?" De AI zoekt het antwoord, ziet een datum van 2024 in de tekst, en denkt: "Ah, het is 2024, dus het antwoord is X." Maar het is nu 2026!
    • Realiteit: De AI's raken verstrikt in oude data. Ze vergeten hun "tijdsbril" op te zetten en denken dat een gebeurtenis uit het verleden nu gebeurt.

5. De Leerervaring: Waarom is L2 moeilijker dan L3?

Interessant genoeg deden de AI's het soms slechter op middelzware vragen dan op heel moeilijke vragen.

  • Middelzware vragen: De AI denkt dat het makkelijk is, gaat snel, en maakt de "tijdsverwarring"-fout.
  • Zeer moeilijke vragen: Omdat de vraag zo complex is, moet de AI heel lang en zorgvuldig nadenken (een "strategisch plan" maken). Door die extra aandacht, komt de AI er plotseling achter: "Wacht, ik moet eerst de datum controleren!" en maakt hij de juiste keuze.

Conclusie: Wat Moet Er Gebeuren?

De boodschap van dit papier is duidelijk:
We kunnen AI's niet alleen maar betere zoekmachines geven. Ze moeten leren om tijdsbewust te zijn. Ze moeten leren om te zeggen: "Ik heb een datum gevonden, maar is dat nu of toen?"

RT-QA is niet alleen een test, maar een nieuwe infrastructuur. Het is een platform waar iedereen zijn eigen "live vragen" kan toevoegen, zodat we AI's kunnen trainen om niet alleen slimme chatbots te zijn, maar echte, betrouwbare assistenten voor de echte, veranderende wereld.

Kort samengevat: De AI's zijn slim, maar ze zijn vaak te lui om echt te kijken en vergeten vaak welk jaar het is. RT-QA is de test die ze dwingt om wakker te worden en naar de live wereld te kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →