← Nieuwste papers
💬 NLP

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

Het artikel introduceert DR Tulu, een open-source deep research-model dat is getraind via Reinforcement Learning met Evoluerende Rubrieken (RLER) en waarbij evaluatiecriteria co-evolueren met het beleid, waardoor het bestaande open agents overtreft en concurrerende propriëtaire systemen evenaart op het gebied van langformaat onderzoekstaken, terwijl het aanzienlijk kosteneffectiever is.

Oorspronkelijke auteurs: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca So
Gepubliceerd 2026-05-18
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Robot Leren tot Onderzoeker

Stel je voor dat je een robot wilt leren een lang, gedetailleerd onderzoeksrapport te schrijven over een complex onderwerp, zoals "Hoe veroorzaken genetische mutaties zeldzame ziekten?" of "Wat is de geschiedenis van hernieuwbare energie?"

De meeste AI-modellen van vandaag zijn als leerlingen die alleen studeren voor korte toetsen. Ze zijn uitstekend in het beantwoorden van simpele vragen zoals "Wat is de hoofdstad van Frankrijk?", maar ze hebben moeite als ze worden gevraagd om een 20 pagina's tellend rapport te schrijven dat het doorzoeken van honderden websites, het controleren van feiten en het citeren van bronnen vereist.

De auteurs van dit paper hebben een nieuwe AI gebouwd genaamd DR Tulu. Het is het eerste open-source model dat specifiek is getraind om een "Deep Researcher" (diepgaand onderzoeker) te zijn. Het raadt niet zomaar; het plant, zoekt op het web, leest papers en schrijft een lang, goed onderbouwd rapport.

Het Probleem: Hoe Beoordeel Je een Lang Rapport?

Om een AI beter te leren, gebruik je meestal een methode genaamd Reinforcement Learning (Versterkend Leren). Denk hierbij aan het trainen van een hond:

  1. De hond (AI) voert een trucje uit.
  2. Als het goed gaat, krijgt hij een traktatie (een beloning).
  3. Als het fout gaat, krijgt hij geen traktatie.

Het probleem met lange onderzoeksrapporten is dat het moeilijk is om te weten hoe een "goed" rapport eruit ziet.

  • Statische Rubrieken (De Oude Manier): Stel je een leraar voor die de hond een vaste checklist geeft: "Moet 5 alinea's bevatten. Moet het jaar 1990 noemen." Als de hond een briljant rapport schrijft over 1991, zakt de leraar het omdat het de starre checklist niet heeft gevolgd. De checklist weet niet wat de hond echt heeft gevonden.
  • Het "Gesloten Boek"-Probleem: Als je een AI vraagt om de checklist te maken op basis van alleen wat het al weet, kan het nieuwe feiten missen die het zojuist op internet heeft ontdekt.

De Oplossing: "Evolverende Rubrieken" (De Slimme Leraar)

Het paper introduceert een nieuwe methode genaamd RLER (Reinforcement Learning with Evolving Rubrics).

Stel je een Slimme Leraar voor die geen vaste checklist gebruikt. In plaats daarvan kijkt de leraar toe terwijl de student (de AI) zijn onderzoek doet in realtime.

  1. De Student Zoekt: De student gaat eropuit, vindt nieuwe feiten en schrijft een concept.
  2. De Leraar Past Zich Aan: De Slimme Leraar kijkt naar wat de student heeft gevonden. "Oh, ik wist niet dat dat feit bestond! Ik moet een nieuwe regel toevoegen aan mijn checklist: 'Moet dit nieuwe feit uitleggen.'"
  3. De Feedbacklus: De leraar werkt de checklist bij terwijl de student leert. Als de student probeert te valsspelen (zoals tekst kopiëren zonder het te lezen), voegt de leraar direct een regel toe: "Valsspelen is niet toegestaan."

In technische termen noemt het paper dit Evolverende Rubrieken. Het zijn beoordelingscriteria die veranderen en slimmer worden naarmate de AI meer informatie exploreert. Hierdoor kan de AI leren van zijn eigen ontdekkingen in plaats van vast te zitten aan een statische set regels.

Het Resultaat: Een Super-Onderzoeker voor een Goedkope Prijs

De auteurs hebben DR Tulu getraind met deze "Slimme Leraar"-methode. Dit is wat er gebeurde:

  • Het is Slimmer: DR Tulu presteerde met een enorme marge beter dan andere open-source onderzoeksmodellen. Het schreef betere rapporten, vond nauwkeurigere feiten en citeerde bronnen correct.
  • Het Wedijvert met de Reuzen: Het presteerde net zo goed als (en soms beter dan) dure, propriëtaire systemen van grote bedrijven zoals OpenAI en Google.
  • Het is Goedkoop: Dit is de grootste winst. De dure systemen kosten ongeveer $1,80 per vraag. DR Tulu kost ongeveer $0,002 per vraag. Dat is ongeveer 1.000 keer goedkoper.

De "Genetische Ziekte"-Test

Om te bewijzen dat het echt werkt, gaf het team DR Tulu een zeer moeilijke taak: het analyseren van genetische mutaties om te zien of ze behandeld kunnen worden met specifieke medicijnen. Dit is een taak die meestal voorbehouden is aan menselijke medische experts.

  • DR Tulu doorzocht succesvol medische databases, vond relevante papers en synthetiseerde een rapport.
  • Het kon concurreren met de duurste, gesloten-bron AI-systemen bij deze taak.
  • Andere open-source modellen faalden omdat ze de juiste citaten niet konden vinden of de feiten niet konden verifiëren.

De Toolkit: "dr-agent-lib"

Het paper heeft ook een "gereedschapskist" uitgebracht genaamd dr-agent-lib.

  • Denk hierbij aan een Zwitsers zakmes voor AI-onderzoekers.
  • Het laat de AI verschillende tools gebruiken: Google Search, het lezen van specifieke webpagina's en het doorzoeken van academische papers.
  • Cruciaal is dat de AI leert de juiste tool voor de klus te kiezen. Als de vraag over wetenschap gaat, gebruikt het de "Paper Search"-tool. Als het over algemeen nieuws gaat, gebruikt het "Web Search". Het gebruikt niet zomaar blindelings één tool.

Samenvatting

Het paper presenteert DR Tulu, een open-source AI die leert diepgaand, langlopend onderzoek te doen. Het gebruikt een speciale trainingsmethode (Evolverende Rubrieken) waarbij de "beoordelingsregels" van de AI in realtime worden bijgewerkt op basis van wat de AI ontdekt. Dit maakt de AI veel slimmer, nauwkeuriger en aanzienlijk goedkoper dan de huidige state-of-the-art onderzoekstools. De auteurs hebben de code, data en het model gedeeld zodat iedereen het kan gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →