← Nieuwste papers
🤖 AI

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMaster is een self-play framework dat LLM-gebaseerde zoekagenten traint door taken te genereren en op te lossen in een lokale omgeving, gebruikmakend van een Evidence-Chain Generator, Search-Depth Reward en Over-Opening Penalty om hoogwaardige, gegronde data te waarborgen die de prestaties op deep-search benchmarks significant verbetert zonder afhankelijk te zijn van door mensen gelabelde voorbeelden.

Oorspronkelijke auteurs: Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

Gepubliceerd 2026-08-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers niet alleen chatten, maar ook daadwerkelijk het internet op gaan om antwoorden te vinden, net zoals een detective die een bibliotheek afzoekt naar aanwijzingen. Dit is het domein van "zoekagenten", slimme programma's gebouwd op Large Language Models (LLM's) die webpagina's kunnen lezen, op links kunnen klikken en informatie kunnen samenvoegen om complexe puzzels op te lossen. Lange tijd was het aanleren van deze digitale detectives hoe ze hun werk goed konden doen een hoofdpijn. Het vereiste meestal dure menselijke docenten om perfecte voorbeelden te schrijven van hoe te zoeken, of zelfs sterkere AI-modellen om de weg te wijzen. Maar wat als de AI zichzelf kon onderwijzen? Dat is de droom van "self-play", een concept waarbij een AI zijn eigen uitdagingen genereert en leert door ze op te lossen. Het is als een personage in een videogame dat zijn eigen levels creëert en ze vervolgens speelt om beter te worden. De grote vraag is echter: wat als de AI sluiproutes neemt? Wat als de AI een puzzel creëert die er moeilijk uitziet maar eigenlijk een truc is, of als het een probleem oplost door slechts de oppervlakte te scannen in plaats van diep te graven? Dit artikel pakt precies dat probleem aan, met de vraag hoe we deze zoekagenten kunnen trainen om eerlijk, grondig en echt slim te zijn zonder dat een menselijke hand bij elke stap nodig is.

Maak kennis met SearchMaster, een slim nieuw framework ontworpen om het "sluiproute-probleem" in AI self-play op te lossen. Denk aan SearchMaster als een strenge maar rechtvaardige coach voor een team van AI-detectives. In plaats van de AI doelloos te laten ronddwalen, geeft SearchMaster het drie specifieke regels om te volgen, wat ervoor zorgt dat de gegenereerde trainingsdata daadwerkelijk nuttig is.

Ten eerste moet de AI een Evidence Chain (bewijsketen) opbouwen. Stel je voor dat de AI een mysterie probeert op te lossen. In plaats van alleen het antwoord te raden na het lezen van één pagina, moet de AI fysiek aanwijzingen uit verschillende documenten aan elkaar koppelen, zoals het verbinden van stippen op een kaart. Als de AI geen duidelijk pad van bewijs van het ene document naar het andere kan tonen, wordt de taak afgewezen. Dit voorkomt dat de AI "nep" moeilijke vragen maakt die in werkelijkheid met een snelle blik beantwoord kunnen worden.

Ten tweede krijgt de AI een Search-Depth Reward (beloning voor zoekdiepte). In het verleden kreeg een AI een gouden ster als hij een probleem oploste, ongeacht hoe hard hij had gewerkt. SearchMaster verandert het spel: de AI krijgt alleen een grote beloning als hij daadwerkelijk diep heeft moeten graven. Als de AI een puzzel oplost door slechts één pagina te scannen, krijgt hij een lage score. Maar als hij door vele pagina's moet zoeken om het antwoord te vinden, wordt hij geprezen. Dit moedigt de AI aan om taken te creëren en op te lossen die een echte, meerstapsige onderzoeken vereisen in plaats van oppervlakkig gokken.

Ten derde is er een Over-Opening Penalty (straf voor overmatig openen). Soms is een AI inefficiënt of in de war en opent hij een miljoen documenten zonder ze echt te lezen, in de hoop op het antwoord te stuiten. SearchMaster straft dit gedrag af. Het is als een coach die zegt: "Je kunt niet zomaar elke deur in het huis openen; je moet op zoek naar de juiste sleutel." Dit dwingt de AI om efficiënt te zijn en documenten alleen te openen wanneer hij echt nieuwe informatie nodig heeft.

De resultaten van deze strikte training zijn indrukwekkend. Wanneer de onderzoekers hun methode testten op een standaard AI-model (specifiek een Qwen3.5-9B backbone), sprong het vermogen van het model om diepe zoekproblemen op te lossen van gemiddeld 38,19% naar 51,52%. Op een bijzonder moeilijke test genaamd BrowseComp-Plus was de verbetering enorm, met een sprong van 30,1 punten (van 30,12% naar 60,24%). Het beste eraan? De AI heeft dit allemaal zelf geleerd, gebruikmakend van een lokale zoekomgeving zonder menselijke voorbeelden of expertdemonstraties. Door de leerervaring van de AI te funderen in echte bewijsketens en het gedrag te reguleren, laat SearchMaster zien dat AI zichzelf kan leren een veel betere detective te zijn, mits het wordt geleerd om zich aan de regels te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →