← Nieuwste papers
🤖 machine learning

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents

HyperEyes is een parallel multimodaal zoekagent getraind via een dual-grained efficiency-aware versterkingsleerframework dat visuele grounding en retrieval samenvoegt tot gelijktijdige acties, waardoor een superieure nauwkeurigheid en aanzienlijk verlaagde inferentiekosten worden bereikt in vergelijking met bestaande sequentiële agenten.

Oorspronkelijke auteurs: Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

Gepubliceerd 2026-05-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Guankai Li, Jiabin Chen, Yi Xu, Xichen Zhang, Yuan Lu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die probeert een mysterie op te lossen met zes verschillende verdachten in één foto.

De oude manier (seriële zoektocht):
Traditionele AI-agenten werken als een zeer grondige maar trage detective. Ze kijken naar de foto, kiezen de eerste persoon, knippen hun gezicht uit, zoeken op internet naar die persoon, lezen de resultaten en gaan dan pas naar de tweede persoon. Ze herhalen dit proces één voor één.

  • Het probleem: Als de foto zes mensen bevat, maakt de detective zes aparte reizen naar de bibliotheek. Tegen de tijd dat ze bij de zesde persoon aankomen, hebben de eerste vijf reizen hun notitieboekje volgepropt met te veel informatie, waardoor het moeilijk wordt om zich te concentreren. Het is alsof je een zesgangendiner probeert te bereiden door één pot water te koken, te wachten tot het klaar is, en dan pas de volgende pot te koken. Het duurt eeuwen en verspilt energie.

De nieuwe manier (HyperEyes):
Het artikel introduceert HyperEyes, een nieuwe AI-agent die de filosofie volgt: "Zoek breder, niet langer."
In plaats van zes keer naar de bibliotheek te gaan, kijkt HyperEyes naar de hele foto, identificeert alle zes verdachten tegelijk en stuurt zes zoekopdrachten gelijktijdig in één enkele reis. Het is alsof je zes verschillende onderzoekers tegelijk naar de bibliotheek stuurt, allemaal parallel werken, en één georganiseerd rapport terugbrengen.

Hoe HyperEyes werd getraind (de "school"-analogie)

De onderzoekers vertelden de AI niet alleen om sneller te zijn; ze bouwden een speciale trainingsschool voor met twee hoofdfasen:

1. De "Strenge Leraar"-fase (Datasyntese):
Eerst creëerden ze een enorme bibliotheek met oefenopgaven. Maar ze wilden niet zomaar een correct antwoord; ze wilden het snelste correcte antwoord.

  • Ze gebruikten een techniek genaamd Progressive Rejection Sampling (Progressieve Afwijkingsteekening). Stel je een leraar voor die een student een toets geeft. Als de student 10 minuten nodig heeft om een probleem op te lossen, gooit de leraar die poging weg. Als de student het in 2 minuten oplost, houdt de leraar het. Ze behielden alleen de snelste, meest efficiënte oplossingen om de AI vanaf dag één te leren hoe ze scherp en snel moet zijn.

2. De "Dubbelkorrelige"-coachingfase (Versterkend Leren):
Zodra de AI de basis kende, pasten ze een speciaal coachingssysteem toe met twee niveaus:

  • Macro-niveau (Het grote plaatje): Ze gaven de AI een beloningssysteem genaamd TRACE. Denk hierbij aan een coach die zegt: "Als je het mysterie in 3 stappen oplost, krijg je een gouden ster. Als je 5 stappen nodig hebt, krijg je een straf." Cruciaal is dat de coach naarmate de tijd vordert strenger wordt. Als de AI leert het in 3 stappen op te lossen, tilt de coach de lat naar 2 stappen. Dit dwingt de AI om constant efficiënter te worden, niet alleen nauwkeuriger.
  • Micro-niveau (De fijne details): Soms maakt de AI halverwege een fout. De On-Policy Distillation (OPD) fungeert als een "ghostwriter" die alleen ingrijpt wanneer de AI faalt. De ghostwriter (een slimmere, grotere AI) fluistert het volgende juiste woord in het oor van de student-AI, waardoor deze precies leert waar het misging zonder tijd te verspillen aan de onderdelen die het al goed had.

De nieuwe scorekaart (IMEB)

De onderzoekers realiseerden zich dat oude tests alleen omhadden of de AI het juiste antwoord had, en negeerden hoe lang het duurde of hoeveel "bibliotheekreizen" (tool-aanroepen) het kostte.
Ze creëerden een nieuwe benchmark genaamd IMEB (Image Multi-Entity Benchmark).

  • De analogie: Stel je voor dat je een race beoordeelt. Oude tests keken alleen naar wie als eerste over de finish kwam. De nieuwe test (IMEB) kijkt naar wie over de finish kwam en wie de minste brandstof gebruikte. Ze introduceerden een Cost-Aware Score (Kostbewuste Score) die nauwkeurigheid beloont maar tijd- en energieverlies zwaar bestraft.

De resultaten

Toen ze HyperEyes tegen de beste bestaande AI-agenten op de proef stelden:

  • Nauwkeurigheid: Het gaf vaker het juiste antwoord dan zijn concurrenten (specifiek 9,9% beter dan de beste open-source rivaal).
  • Efficiëntie: Het was dramatisch sneller. Het had 5,3 keer minder "bibliotheekreizen" nodig om dezelfde problemen op te lossen.

Samenvatting

HyperEyes is alsof je overstapt van een eenbaansweg met file naar een snelweg met meerdere rijstroken. Door de AI te leren om alle aanwijzingen tegelijk te bekijken en haar te straffen voor onnodige omwegen, creëerden de onderzoekers een agent die niet alleen slimmer is, maar ook aanzienlijk efficiënter, waardoor complexe visuele puzzels in een fractie van de tijd worden opgelost.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →