OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis
Het artikel introduceert OpenResearcher, een volledig open en reproduceerbare offline-pipeline die 97.000+ diepe onderzoeks-trajecten synthetiseert om een 30B-parametermodel te trainen, wat leidt tot een aanzienlijke prestatieverbetering op complexe zoekopdrachten zonder afhankelijkheid van dure of onstabiele web-API's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
De Kern: Een Simulatie van een Super-Researcher
Stel je voor dat je een detective wilt trainen om moeilijke mysteries op te lossen. Deze detective moet niet alleen zoeken in een bibliotheek, maar ook door duizenden boeken bladeren, specifieke zinnen vinden, en bewijsstukken aan elkaar knopen om een antwoord te vinden.
Het probleem tot nu toe was dat je deze detective alleen maar kon trainen door hem daadwerkelijk het internet op te sturen. Dat is als een detective die elke dag een taxi moet nemen om naar de bibliotheek te gaan:
- Het is duur: Elke rit kost geld (API-kosten).
- Het is onstabiel: Soms is de bibliotheek dicht, soms is het boek verplaatst, en soms is de weg geblokkeerd (het live internet verandert constant).
- Het is lastig te analyseren: Als de detective faalt, weet je niet of hij dom was, of dat het boek gewoon niet op de juiste plek stond.
OpenResearcher lost dit op door een perfecte, gesloten simulatie te bouwen.
Hoe werkt het? (De Drie Stappen)
1. De Bibliotheek Bouwen (De "Offline Corpus")
In plaats van elke keer het echte internet op te zoeken, bouwen de onderzoekers eerst een enorme, lokale bibliotheek.
- Ze nemen een gigantische verzameling teksten (15 miljoen documenten) die al op hun computer staan.
- Ze doen één keer een "snelle check" op het echte internet om de juiste antwoorden (de "gouden documenten") te vinden en deze aan hun lokale bibliotheek toe te voegen.
- De analogie: Het is alsof je een detectiveopleiding geeft in een nagebouwde stad. Je bouwt de stad na met alle straten en gebouwen, zodat je de detective kunt laten oefenen zonder dat hij echt de stad in hoeft te reizen.
2. De Drie Gereedschappen (Search, Open, Find)
In de echte wereld is zoeken niet zomaar "Google iets". Je zoekt, je klikt op een link, en je scrolt door een lange pagina om de juiste zin te vinden.
OpenResearcher geeft de AI drie simpele gereedschappen:
- Zoeken (Search): Vraagt de bibliotheek om een lijst met mogelijke boeken.
- Openen (Open): Pakt het boek van de plank en leest de hele inhoud.
- Zoeken in tekst (Find): Bladert door het openstaande boek om een specifiek woord te vinden (bijv. "Wanneer werd dit geboekt?").
- De analogie: Een slechte detective zoekt alleen naar de titel van het boek. Een goede detective pakt het boek, leest het, en zoekt de specifieke regel. OpenResearcher leert de AI om echt te lezen, niet alleen te scannen.
3. De Oefening (Trajecten Synthese)
Nu laten ze een heel slimme "meester-detective" (een groot AI-model genaamd GPT-OSS-120B) oefenen in deze gesloten bibliotheek.
- De meester krijgt een raadsel.
- Hij moet zoeken, bladeren, en redeneren tot hij het antwoord heeft.
- Dit gebeurt duizenden keren. Soms lukt het hem in 10 stappen, soms moet hij 100 keer zoeken voordat hij het vindt.
- Het resultaat: Ze krijgen een enorme verzameling van 97.000 "oefensessies" (trajecten).
Wat levert dit op?
Vervolgens nemen ze een kleinere, goedkopere AI (de "leerling") en trainen ze deze met al die oefensessies van de meester.
- Het resultaat: Deze kleine AI wordt een expert. Op een test (BrowseComp-Plus) scoort hij 54,8%, wat veel beter is dan veel dure, gesloten systemen van grote tech-bedrijven.
- De verrassing: Zelfs als de oefensessies van de meester niet perfect waren (hij gaf soms een fout antwoord), leerde de leerling er nog steeds veel van over hoe hij moest zoeken en redeneren.
Waarom is dit belangrijk?
- Het is goedkoop en reproduceerbaar: Omdat alles offline gebeurt, kunnen iedereen dit precies hetzelfde doen. Geen dure internetrekeningen, geen "het werkte gisteren wel" excuses.
- Het is transparant: Omdat de onderzoekers precies weten welke documenten in de bibliotheek zaten, kunnen ze analyseren waarom de AI faalde. Was het omdat hij het boek niet vond? Of omdat hij het boek wel vond, maar de tekst verkeerd las?
- Het werkt ook in de echte wereld: Hoewel ze in een gesloten bibliotheek hebben getraind, blijkt de AI ook heel goed te presteren op het echte, levende internet. De vaardigheid om diep te graven en bewijs te vinden, is overdraagbaar.
Samenvattend
OpenResearcher is als het bouwen van een virtueel trainingskamp voor onderzoekers. In plaats van ze duizenden dollars te laten uitgeven aan echte reizen en onbetrouwbare bibliotheken, bouwen ze een perfecte simulatie. Hierin leren ze de kunst van het diepgraven, het vinden van bewijs en het redeneren. Het resultaat is een slimme, goedkope AI die net zo goed (of zelfs beter) presteert als de dure systemen van de grote bedrijven, en die we allemaal kunnen gebruiken en bestuderen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.