← Nieuwste papers
🤖 AI

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

Het artikel stelt het Hybrid Open-Ended Tri-Evolution (HOTE) framework voor, dat hybride modus reinforcement learning gebruikt om een proposer, solver en judge gezamenlijk te laten evolueren, waardoor een 8B-model in staat wordt gesteld om grotere statische en state-of-the-art deep research-modellen op open-ended taken te overtreffen met een verminderde tijdsoverhead.

Oorspronkelijke auteurs: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

Gepubliceerd 2026-06-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Robot Leren Worden, een Super-onderzoeker

Stel je voor dat je een AI wilt bouwen die kan fungeren als een wereldklasse onderzoeker. Het moet informatie op het internet kunnen vinden, duizenden artikelen kunnen lezen en een lang, gedetailleerd rapport kan schrijven over complexe onderwerpen (zoals: "Hoe beïnvloedt klimaatverandering de koffieproductie in 2050?").

Het probleem is dat de meeste AI-modellen lijken op studenten die alleen uit een vaststaand tekstboek leren. Zodra ze het tekstboek uit hebben, stoppen ze met leren. Ze kunnen niet uit zichzelf beter worden in het onderzoeken van nieuwe zaken.

Dit paper introduceert een nieuw systeem genaamd HOTE (Hybrid Open-Ended Tri-Evolution). Denk aan HOTE niet als één enkele student, maar als een zelfverbeterend onderzoeksteam dat leert door een spel tegen zichzelf te spelen.

De Drie Karakters in het Team

In plaats van slechts één AI die alles probeert te doen, gebruikt HOTE drie gespecialiseerde rollen die samen evolueren:

  1. De Solver (De Onderzoeker):

    • Rol: Dit is de AI die het eigenlijke werk doet. Het neemt een vraag, doorzoekt het web, leest documenten en schrijft een lang onderzoeksrapport.
    • Analogie: Denk aan de Solver als een detective die een mysterie probeert op te lossen.
  2. De Judge (De Criticus):

    • Rol: Deze AI leest de rapporten die de Solver heeft geschreven. In plaats van alleen "Goed" of "Slecht" te zeggen, maakt het een aangepaste checklist (een "rubric") om het rapport te beoordelen. Het kijkt naar specifieke sterktes en zwaktes.
    • Analogie: De Judge is als een strenge redacteur of een scheidsrechter bij een sportwedstrijd. Als de detective een aanwijzing mist, blaast de scheidsrechter op zijn fluitje en zegt: "Je bent deze specifieke details vergeten." Cruciaal is dat de Judge zijn eigen regelboek bijwerkt wanneer hij nieuwe soorten fouten ziet, zodat hij niet vast blijft zitten aan oude regels.
  3. De Proposer (De Quizmaster):

    • Rol: Deze AI kijkt naar de feedback van de Judge en de fouten van de Detective om nieuwe, moeilijkere vragen te bedenken. Het doel is om de zwakke plekken van de Detective te vinden en hem uit te dagen.
    • Analogie: De Proposer is als een gymcoach die naar de atleet kijkt terwijl deze faalt bij een specifieke oefening, en vervolgens een nieuwe, iets moeilijkere oefening ontwerpt om precies die zwakte aan te pakken.

Hoe Ze Trainen: Het "Tri-Evolution" Spel

De magie gebeurt omdat deze drie samenwerken in een lus, waarbij ze constant verbeteren:

  1. De Quizmaster bedenkt een lastige onderzoeksvraag.
  2. De Detective probeert deze te beantwoorden, doorzoekt het web en schrijft een rapport.
  3. De Scheidsrechter beoordeelt het rapport, maakt een nieuwe checklist en wijst precies aan waar de Detective tekortschoot.
  4. De Detective leert van het cijfer en probeert het opnieuw.
  5. De Quizmaster ziet waar de Detective nog steeds slecht in is en maakt voor de volgende ronde een nog moeilijkere vraag.

Deze cyclus herhaalt zich duizenden keren. Het paper noemt dit "Tri-Evolution" omdat alle drie de karakters tegelijkertijd evolueren (verbeteren).

Het "Hybride" Geheime Recept

Het paper vermeldt ook een "Dual-Mode Hybrid" strategie. Dit is als het trainen van een atleet op twee verschillende manieren:

  • Modus A (Tool-gebruik): De Detective mag het internet gebruiken (zoektools) om antwoorden te vinden. Dit is realistisch, maar kan ruisachtig en traag zijn.
  • Modus B (Geen Tools): De Detective moet antwoorden vanuit geheugen en logica alleen, zonder iets op te zoeken. Dit is sneller, maar leunt op wat ze al weten.

Het HOTE-systeem traint de Detective in beide modi tegelijkertijd.

  • Waarom? Als je alleen traint met internet, kan de Detective lui worden en te veel vertrouwen op zoekresultaten. Als je alleen traint zonder internet, kan hij vergeten hoe hij het internet effectief moet gebruiken. Door ze te mengen, leert de Detective een meester-onderzoeker te zijn die weet wanneer hij moet zoeken en hoe hij diep moet nadenken zonder tools.

De Resultaten: Waarom het Ertoe Doet

De onderzoekers hebben dit systeem getest op drie moeilijke benchmarks (Gezondheid, Wetenschap en Algemeen Onderzoek).

  • De Claim: Een model met 8 miljard parameters (een middelgrote AI) die getraind is met HOTE, werd slimmer dan veel grotere modellen (32B+) en andere state-of-the-art onderzoeks-AI's.
  • Efficiëntie: Het bereikte deze resultaten in minder tijd en met minder rekenkracht dan andere methoden.
  • Duurzaamheid: In tegen tegenstelling tot andere methoden, die na een tijdje stoppen met verbeteren, bleef het HOTE-team langdurig beter worden omdat de "Quizmaster" steeds nieuwe, uitdagende problemen vond die de "Detective" nog niet had opgelost.

Samenvatting in één zin

HOTE is een zelfverbeterend AI-systeem waarbij een Onderzoeker, een Criticus en een Quizmaster een continu spel van "schaken" met elkaar spelen, waarbij ze een mix gebruiken van internetonderzoek en puur nadenken om een middelgrote AI sneller en beter te transformeren tot een wereldklasse diepgaande onderzoeker dan wie dan ook.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →