← Nieuwste papers
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

Dit artikel introduceert InterLV-Search, een uitgebreid benchmark- en evaluatiekader voor interleaved multimodaal agentisch zoeken dat aanzienlijke huidige beperkingen belicht in de capaciteit van systemen om tekstuele en visuele bewijsvoering dynamisch te integreren in scenario's van actief zoeken, gecontroleerd offline zoeken en open-web zoeken.

Oorspronkelijke auteurs: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een complex mysterie op te lossen, zoals het vinden van een specifieke persoon op basis van een reeks aanwijzingen.

De Oude Manier (Vorige Benchmarks):
De meeste huidige AI-"detectives" worden zo getraind: je geeft hen een foto van een verdachte en vraagt: "Wie is dit?" of "Welke kleur heeft hun hoed?" De AI kijkt naar de foto en antwoordt. Als de foto niet voldoende is, kan de AI zoeken op internet naar tekst over de persoon, maar het behandelt de foto slechts als het startpunt of het eindantwoord. Het gebruikt zelden een foto die het in het midden van zijn onderzoek vindt om zijn richting te wijzigen. Het is als een detective die naar een foto van een misdaadplek kijkt, vervolgens gewoon een krantenartikel leest, en nooit beseft dat een nieuwe foto die hij op pagina 3 van de krant vindt, hem eigenlijk naar een volledig andere stad leidt.

De Nieuwe Manier (InterLV-Search):
De auteurs van dit paper, "InterLV-Search", bouwden een nieuwe trainingsomgeving (een benchmark) om te testen of AI iets veel moeilijks kan doen: Interleaved Multimodal Agentic Search (Gekruiste Multimodale Agentische Zoeking).

Stel je dit voor als een detective die constant moet schakelen tussen het bekijken van kaarten (tekst) en het bekijken van foto's (afbeeldingen) om de zaak op te lossen.

  • De Twist: De AI vindt een foto, bekijkt deze en beseft: "Oh! Het logo op dit gebouw in de foto vertelt me dat ik moet zoeken naar een specifiek merk." Vervolgens zoekt hij naar dat merk, vindt een nieuwe foto van een auto, ziet een kenteken, en dat kenteken vertelt hem om te zoeken naar een specifieke stad.
  • Het Doel: De foto is niet alleen het antwoord; de foto is een stuurwiel. Het vertelt de AI waar hij als volgende naartoe moet rijden.

De Drie Moeilijkheidsgraden

Het paper test AI op drie niveaus, zoals een videospel met toenemende moeilijkheidsgraad:

  1. Niveau 1: De "Vind de Afbeelding"-Uitdaging.

    • De Taak: De AI krijgt een tekstbeschrijving zoals: "Vind het spel dat deze piratenschip bevat." Hij moet uitzoeken wat het schip is, er naar zoeken, de afbeelding vinden, en vervolgens een vraag over de afbeelding beantwoorden (bijvoorbeeld: "Welke motor gebruikt het schip?").
    • De Metafoor: Je krijgt een raadsel over een verborgen object. Je moet het object eerst vinden voordat je het raadsel kunt oplossen.
  2. Niveau 2: De "Gecontroleerde Labyrint"-Uitdaging.

    • De Taak: De AI bevindt zich in een gesloten kamer (een gecontroleerde offline database) met een kaart. Hij begint met een tekstaanwijzing, vindt een foto, de foto geeft een nieuwe aanwijzing, hij vindt een andere foto, en zo verder.
    • De Metafoor: Stel je een schattenjacht voor waarbij het vinden van een foto van een rode deur je leidt naar een tekstuele aanwijzing over een blauwe auto, die je op zijn beurt leidt naar een foto van een gele vogel. De AI moet de foto van de deur gebruiken om te beslissen om naar de auto te zoeken. Als hij de foto negeert en gewoon tekst blijft lezen, raakt hij verdwaald.
  3. Niveau 3: De "Wilde Internet"-Uitdaging.

    • De Taak: Nu is de AI buiten in het echte, rommelige internet. Hij moet aanwijzingen zoeken, foto's vinden, beseffen dat sommige foto's nep of irrelevant zijn, verschillende paden vergelijken (bijvoorbeeld: "Is deze film 60 minuten of 90 minuten?"), en het juiste pad kiezen om verder te gaan.
    • De Metafoor: Dit is als een detective die probeert een zaak op te lossen met behulp van het hele internet. Hij moet door miljoenen websites filteren, sommige met slechte foto's, sommige met verkeerde data, en beslissen welk pad hij moet volgen op basis van wat hij in de afbeeldingen ziet.

Wat Vonden Ze?

De auteurs testten veel van de slimste AI-modellen (zoals GPT-5, Gemini en Claude) op deze nieuwe test.

  • Het Resultaat: De AI-modellen zijn momenteel zeer slecht hierin. Zelfs de besten kregen minder dan 50% van de antwoorden goed.
  • Het Probleem: De AI-modellen zijn geweldig in het lezen van tekst en geweldig in het bekijken van een enkele afbeelding. Maar ze worstelen om de punten te verbinden wanneer een foto die in het midden van een zoektocht wordt gevonden, het hele zoekplan moet wijzigen. Ze blijven vaak vastzitten in het zoeken naar tekst terwijl ze naar een foto moeten kijken, of ze behandelen de foto slechts als een "eindcontrole" in plaats van als een "nieuwe aanwijzing".

De Toolkit (InterLV-Agent)

Om ervoor te zorgen dat iedereen volgens dezelfde regels speelde, bouwden de auteurs een standaard "gamecontroller" genaamd InterLV-Agent. Deze tool laat de AI een webbrowser gebruiken, zoeken naar afbeeldingen, afbeeldingen bijsnijden en een "notitieboek" (geheugen) bijhouden van wat het tot nu toe heeft gevonden. Dit zorgt ervoor dat wanneer we zeggen dat een AI gefaald heeft, het is omdat hij de puzzel niet kon oplossen, en niet omdat hij niet de juiste tools had.

Samenvatting

In eenvoudige termen zegt dit paper: "We hebben een nieuwe, moeilijkere test voor AI-detectives gebouwd. We ontdekten dat hoewel AI slimmer wordt, het nog steeds niet effectief foto's kan gebruiken die het tijdens een zoektocht vindt om van gedachten te veranderen en de volgende aanwijzing te vinden. Het is als een detective die een kaart kan lezen en naar een foto kan kijken, maar niet kan begrijpen dat de foto hem eigenlijk vertelt een ander pad te nemen."

De auteurs hebben deze test en de tools vrijgegeven zodat andere onderzoekers kunnen proberen AI te bouwen die beter is in deze "gekreuzde" manier van denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →