← Nieuwste papers
💬 NLP

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1 is een zelf-evolutiemethode die zoekversterkte redeneringsagenten verbetert met uitsluitend standaard GRPO en offline zelfdistillatie om state-of-the-art prestaties op QA-benchmarks te bereiken zonder afhankelijkheid van complexe externe supervisie of hulpmodules.

Oorspronkelijke auteurs: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

Gepubliceerd 2026-05-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slim maar iets onhandige student (de AI) hebt die probeert lastige trivia-vragen te beantwoorden. Om het juiste antwoord te krijgen, mag deze student een bibliotheek (een zoekmachine) gebruiken om feiten op te zoeken, maar ze moeten zelf beslissen wanneer ze kijken en wat ze vragen.

De meeste huidige methoden leren deze student door te wachten tot ze het hele essay heeft afgerond. Als het uiteindelijke antwoord goed is, geeft de leraar een gouden ster. Als het fout is, geeft de leraar een rode X. Het probleem? De student weet niet welke specifieke stap de fout was. Stelden ze de verkeerde vraag? Lees ze de verkeerde paragraaf? Waren ze afgeleid? Ze weten alleen dat de hele poging mislukt is.

Search-E1 is een nieuwe, eenvoudigere manier om deze student te leren. Het heeft geen super-slimme menselijke leraar, een chique extra robot of een speciaal beloningssysteem nodig. In plaats daarvan gebruikt het een techniek genaamd "Zelf-evolutie" via een twee-staps dans:

Stap 1: De "Probeer Alles"-fase (GRPO)

Eerst wordt de student vijf keer dezelfde vraag gesteld.

  • Bij één poging kunnen ze door de bibliotheek dwalen, domme vragen stellen en falen.
  • Bij een andere poging kunnen ze de perfecte vragen stellen, het juiste boek vinden en snel het juiste antwoord krijgen.

Het systeem bekijkt deze vijf pogingen en zegt: "Oké, degene die het juiste antwoord kreeg, is de 'Gouden Standaard' voor deze ronde." Maar, zoals eerder, vertelt dit de student alleen: "Goed gedaan met dat hele essay", niet "Goed gedaan met het stellen van die specifieke vraag".

Stap 2: De "Terugspoelen en Leren"-fase (Offline Zelf-distillatie)

Hier gebeurt de magie. Het systeem neemt de mislukte poging (de "Student") en de succesvolle poging (de "Leraar").

Hier is de slimme truc:

  1. Het systeem geeft de Student de oorspronkelijke vraag.
  2. Het systeem geeft de Leraar dezelfde vraag, maar geeft hen ook een spiekbriefje: het hele succesvolle pad dat de student in de andere poging heeft afgelegd.
  3. De Leraar leest het spiekbriefje en zegt: "Als ik deze vraag nu zou beantwoorden, wetende het juiste pad, zou ik precies dit als volgende zeggen."
  4. De Student wordt vervolgens gedwongen naar de Leraar te luisteren en stap voor stap te proberen hun woorden na te bootsen.

De Student krijgt niet alleen te horen "Je was goed/fout". Ze krijgen, token voor token (woord voor woord), precies getoond hoe ze beter moeten denken. "Oh, ik zie het! Toen ik vroeg 'Wie is de president?', vroeg de Leraar 'Wie was de president in 1990?' Dat is het verschil!"

Waarom is dit speciaal?

  • Geen Externe Leraren: Normaal gesproken heb je voor dit niveau van detail een super-intelligente AI (zoals een model met 72 miljard parameters) nodig om elke enkele stap te beoordelen. Search-E1 gebruikt de eigen succesvolle pogingen van de student als leraar. Het is alsof een student zijn eigen tentamenpapier bestudeert na het behalen van een A, in plaats van te wachten tot een professor het beoordeelt.
  • Geen Extra Machines: Andere methoden voegen complexe tools toe om uit te zoeken welke stappen goed waren. Search-E1 gebruikt gewoon de standaard "probeer en probeer opnieuw"-lus en voegt deze "bestudeer je eigen succes"-stap er tussen toe.
  • De Resultaten: Toen ze dit testten op zeven verschillende trivia-uitdagingen, behaalde de student die Search-E1 gebruikte aanzienlijk betere scores dan andere studenten die complexere methoden gebruikten. Het was vooral goed in "multi-hop"-vragen (waar je meerdere punten moet verbinden), omdat die vragen veel stappen hebben waar je fout kunt gaan, en deze methode de specifieke gebroken stappen repareert.

Kortom: Search-E1 leert een AI slimmer te worden door het te laten falen, en vervolgens zijn eigen succesvolle pogingen te laten bestuderen alsof het een perfect leerboek is, waarbij het precies leert wat het op elk enkel moment moet zeggen zonder enige buitenstaande hulp.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →