Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning
Dit artikel introduceert Visual-Seeker, een visueel-native multimodale agentische zoekoplossing die actieve visuele redenering en een gesynthetiseerde dataset van 5.000 hoogwaardige trajecten benut om state-of-the-art prestaties te behalen in complexe zoektaken in een open wereld door dynamisch fijnmazig visueel bewijs te oogsten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een mysterie probeert op te lossen, maar in plaats van alleen maar aanwijzingen op een papiertje te lezen, moet je een chaotische, drukke foto bestuderen om het antwoord te vinden.
Het Probleem: De "Blinde" Detective
Huidige AI-detectives (genaamd Multimodal Large Language Models) zijn goed in het lezen van tekst en het bekijken van eenvoudige plaatjes. Maar wanneer ze geconfronteerd worden met een complexe, echte foto — zoals een stadion vol mensen of een filmposter met minuscule details — raken ze vaak in de war. Ze weten misschien wat een basketballer is, maar ze kunnen niet gemakkelijk vinden welke specifieke speler rugnummer 45 draagt in een wazige foto van een menigte.
Bovendien, wanneer deze AI's proberen het internet af te zoeken naar antwoorden, behandelen ze de afbeelding meestal als een statische "snapshot". Ze kijken er één keer naar, stellen een tekstuele vraag en stoppen dan. Ze weten niet hoe ze moeten inzoomen, een specifiek gezicht moeten uitknippen of actief naar nieuwe afbeeldingen moeten zoeken om de originele afbeelding mee te vergelijken. Ze zijn als een detective die één keer naar een foto van een plaats delict kijkt, en dan haar ogen sluit en het antwoord raadt op basis van het geheugen.
De Oplossing: Visual-Seeker
De auteurs van dit paper hebben een nieuwe AI-agent gebouwd genaamd Visual-Seeker. Zie Visual-Seeker als een detective die niet alleen naar de foto kijkt, maar deze ook actief onderzoekt.
In plaats van alleen maar naar de afbeelding te staren, doet Visual-Seeker het volgende:
- Zoomt in: Het kan minuscule details opmerken, zoals de kleur van een veer in een hoed of het nummer op een shirt.
- Zoekt naar bewijs: Als de foto niet duidelijk genoeg is, weet het systeem dat het naar het internet moet gaan, moet zoeken naar "officiële DVD-hoezen" of "teampfoto's" en nieuwe afbeeldingen moet downloaden om ermee te vergelijken.
- Verbindt de punten: Het combineert wat het in de nieuwe afbeeldingen ziet met de oorspronkelijke vraag om het puzzelstukje op te lossen.
Hoe ze het hebben geleerd: De "Trainingssimulator"
Je kunt een AI niet simpelweg vertellen om "beter te kijken". Je moet het laten zien. De onderzoekers bouwden een speciale trainingsfabriek (een "Active Visual Reasoning Data Pipeline" genoemd).
Stel je voor dat een game-ontwerper een trainingscursus maakt voor een nieuwe rekrut:
- Stap 1 (Het Doel): Ze nemen een rommelige, echte foto en vragen de AI om een specif kind of object uit te kiezen (bijv. "Vind de man in het roze shirt").
- Stap 2 (Het Spoor): Ze creëren een nep "schattenjacht"-pad. De AI moet van het ene feit naar het andere springen, zoals een detective die een spoor van aanwijzingen volgt.
- Stap 3 (De Twist): Cruciaal is dat ze de AI dwingen te beseffen dat tekst niet genoeg is. Ze injecteren "visueel bewijs" in de training. Ze laten de AI beseffen: "Hé, je kunt dit niet alleen door te lezen beantwoorden; je moet een plaatje van de hoed zoeken om de kleur te zien!"
Ze creëerden 5.000 van deze complexe trainingsscenario's om de AI te leren een actieve zoeker te zijn in plaats van een passieve lezer.
De Resultaten: De Nieuwe Kampioen
Toen ze Visual-Seeker testten tegen andere top AI-modellen (inclusclusief dure, propriëtaire modellen van grote techbedrijven), won het.
- Het gokte niet alleen; het ging daadwerkelijk op pad, vond de juiste plaatjes en zoomde in op de details.
- Het presteerde beter dan de "tekst-alleen" experts en versloeg zelfs sommige van de krachtigste "multimodale" modellen die momenteel beschikbaar zijn.
- Het bewees dat als je een AI de tools geeft om actief te kijken en te zoeken naar visuele aanwijzingen, het veel slimmer wordt in het oplossen van echte wereld-puzzels.
In een Notendop
Eerdere AI's waren als studenten die een tekstboek uit het hoofd leerden, maar niet in staat waren om dit toe te passen op een rommelig examen in de echte wereld. Visual-Seeker is de student die een vergrootglas, een kaart en een camera meeneemt naar het examen en actief bewijs verzamelt om het probleem stap voor stap op te lossen. Het paper laat zien dat deze "actieve kijk"-aanpak de sleutel is om AI echt slim te maken in een visuele wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.