UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp
Het artikel introduceert UNIBROWSE, een nieuw data-naar-agent-framework dat uitgebreide trainingsdata genereert die alle drie de multimodale browse-informatiestroompatronen dekt en exploratiebewuste reinforcement learning gebruikt om een agent van 35B-schaal te trainen die state-of-the-art prestaties behaalt op de multimodale BrowseComp-benchmarks, waarbij het zowel het basismodel als toonaangevende closed-source agents aanzienlijk overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van alleen een paar aanwijzingen op een notitieblok te lezen, moet je tussen een bibliotheek, een fotoalbum en een live nieuwsfeed springen om het antwoord te vinden. Dat is wat een "Multimodal BrowseComp"-taak is: een supermoeilijke puzzel waarbij een AI-agent tekst moet lezen, naar plaatjes moet kijken en zoektools moet gebruiken om een oplossing in elkaar te zetten die niet simpelweg op één webpagina staat.
Lange tijd waren de AI-detectives die we trainden een beetje eenzijdig. Ze waren geweldig in het lezen van tekstuele aanwijzingen of het bekijken van een foto en vervolgens tekst lezen om een antwoord te vinden (zoals een foto van een hond zien en zoeken naar "welk ras is dit?"). Maar ze waren verschrikkelijk in het omgekeerde: tekst lezen om te ontdekken waar je naar moet zoeken in een afbeelding (zoals een beschrijving van een vreemd gebouw lezen en dan op zoek gaan naar een foto om de vorm te bevestigen).
De Grote Ontdekking: De "UniBrowse" Detective
De onderzoekers achter dit paper, een team van de Universiteit Peking, hebben een nieuw trainingssysteem gebouwd genaamd UNIBROWSE. Zie dit als een superintelligente trainingskamp waar AI-agents eindelijk leren om álle drie de soorten aanwijzingen te hanteren:
- Alleen tekst: Alleen feiten lezen en verbinden.
- Afbeelding-naar-tekst: Beginnen met een foto en het bijbehorende verhaal vinden.
- Tekst-naar-afbeelding: Eerst een verhaal lezen en dan op zoek gaan naar de bijpassende foto om het visueel te bewijzen.
Vóór dit moment dekten de meeste trainingskampen alleen de eerste twee types af. De auteurs stellen dat het negeren van het derde type (Tekst-naar-afbeelding) de AI "ondergetraind" laat voor scenario's in de echte wereld, waarin je een feit visueel moet verifiëren nadat je erover hebt gelezen. Ze merkten ook op dat eerdere methoden leken op proberen te leren door willekeurig door een stad te dwalen (wat leidt tot veel ruis en verkeerde afslagen) of door alleen naar een perfecte, neppe kaart te kijken (wat niet overeenkomt met de chaotische echte wereld). UNIBROWSE lost dit op door te beginnen met een solide "kaart" (een kennisgrafiek), maar vervolgens de AI naar buiten te sturen om live, realtime bewijs van het werkelijke internet te verzamelen om te controleren of de aanwijzingen echt zijn.
De "Exploratie"-filter: Het weghalen van de vulling
Hier komt het slimme deel: de onderzoekers realiseerden zich dat niet alle oefenopgaven gelijk zijn. Sommige problemen hebben slechts één saaie manier om ze op te lossen, terwijl andere de agent dwingen om verschillende paden te proberen, terug te stappen en het opnieuw te proberen.
Om dit op te lossen, hebben ze een nieuwe metriek uitgevonden genaamd "exploration degree" (exploratiegraad). Stel je voor dat je het huiswerk van een leerling nakijkt. Als elke leerling de wiskundevraag op exact dezelfde, gemakkelijke manier oplost, leer je niet veel. Maar als sommige leerlingen een kortere weg proberen, anderen vastlopen en achteruit moeten stappen, en een paar anderen een slim nieuw pad vinden, dát is waar het echte leren gebeurt.
Het team gebruikte deze "exploration degree" om hun data te filteren. Ze gooiden de saaie, eenzijdige problemen weg en hielden alleen de bovenste 30% van de meest "exploratieve" vragen over. Dit maakte hun Reinforcement Learning (het deel waar de AI leert door middel van trial-and-error) veel efficiënter, door de focus te leggen op de puzzels die de agent echt leren om diep na te denken.
De Resultaten: Een Nieuwe Kampioen
Met deze pipeline bouwden ze een 35-miljard parameter AI-agent (een zeer groot brein). Ze gokten niet alleen dat het zou werken; ze maten het tegen vijf verschillende uitdagende benchmarks.
De resultaten waren indrukwekkend. Hun nieuwe agent, UniBrowse, behaalde een gemiddelde nauwkeurigheid van 54,4 over deze tests.
- Dit is een sprong van 10,5 punten ten opzichte van de basismodel (Qwen3.5-35B-A3B), dat op 43,9 begon.
- Het versloeg verschillende beroemde "closed-source" reuzen (zoals GPT-5 en Gemini-2.5 Pro) die respectievelijk rond de 42,9 en 44,8 scoorden.
- Het presteerde zelfs beter dan andere open-source modellen zoals Kimi K2.5 (50,8).
Wat Ze Niet Beweren
Het is belangrijk om te weten wat dit paper niet zegt. De auteurs merken zorgvuldig op dat hoewel UniBrowse de beste open-source agent is die ze hebben gezien, het nog steeds de absoluut sterkste propriëtaire systemen (zoals Gemini-3.1 Pro, die de 63,2 haalde) niet heeft verslagen. Ze geven ook toe dat hun agent beperkt is tot publiek webbrowsen met tekst en afbeeldingen; het kan nog geen interactieve websites, video's of kaarten aan. Ze suggereren dat grotere modellen en betere tools nodig kunnen zijn om die resterende kloof te dichten, maar ze beweren niet dat ze het hele probleem van AI-browsen hebben opgelost.
De Kern van het Verhaal
Door een trainingssysteem te bouwen dat alle drie de soorten aanwijzingen dekt (tekst, afbeelding-naar-tekst en tekst-naar-afbeelding) en de saaie oefenproblemen te filteren, heeft het UNIBROWSE-team een AI-agent gecreëerd die aanzienlijk beter is in het oplossen van complexe, meerstaps mysteries op het internet. Het is een belangrijke stap voorwaarts die bewijst dat de manier waarop je een agent traint net zo belangrijk is als hoe groot zijn brein is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.