← Nieuwste papers
💻 computer science

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

Dit paper introduceert AgentVista, een benchmark voor multimodale agenten die realistische, visueel complexe scenario's combineert met langdurige toolgebruikstaken om de beperkingen van huidige state-of-the-art modellen bloot te leggen.

Oorspronkelijke auteurs: Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

Gepubliceerd 2026-03-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhaochen Su, Jincheng Gao, Hangyu Guo, Zhenhua Liu, Lueyang Zhang, Xinyu Geng, Shijue Huang, Peng Xia, Guanyu Jiang, Cheng Wang, Yue Zhang, Yi R. Fung, Junxian He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

AgentVista: De "Super-Test" voor Slimme Digitale Assistenten

Stel je voor dat je een zeer slimme, digitale assistent hebt. Deze assistent kan niet alleen lezen en praten, maar ook kijken naar foto's, plannen maken en online zoeken. Je vraagt hem: "Kijk naar deze foto van mijn woonkamer. Welk parket past hierbij? Zoek het product online, check of het op voorraad is, en bereken hoeveel het kost voor mijn kamer."

In de echte wereld is dit een complexe taak. Je moet eerst de foto analyseren, dan een zoekopdracht doen, een website bezoeken, de specificaties lezen, en tenslotte een berekening maken.

Het probleem is dat de huidige slimme assistenten (AI-modellen) hier vaak in falen. Ze zijn goed in het beantwoorden van simpele vragen over één foto, maar ze raken in de war als ze een lange reeks stappen moeten doen met verschillende hulpmiddelen.

Wat is AgentVista?
De auteurs van dit paper hebben AgentVista bedacht. Je kunt dit zien als een extreme sportwedstrijd of een meesterproef voor deze digitale assistenten.

  • De "Sport": In plaats van simpele vragen te stellen, geven ze de assistent realistische, rommelige situaties. Denk aan het repareren van een kapotte machine door naar een foto en een schema te kijken, of het plannen van een reis waarbij je een kaart moet lezen en de dienstregeling moet checken.
  • De "Hulpmiddelen": De assistent mag niet alleen "gokken". Hij moet echte tools gebruiken: internet zoeken, afbeeldingen zoeken, door webpagina's bladeren en zelfs code schrijven om foto's te bewerken of berekeningen te maken.
  • De "Lengte": De taken zijn lang. Het is alsof je een detective bent die niet direct het antwoord heeft, maar eerst tien verschillende aanwijzingen moet verzamelen en controleren voordat hij de dader kan aanwijzen.

Hoe hebben ze dit gemaakt?
Stel je voor dat je een enorme berg foto's en vragen verzamelt (300.000+).

  1. Filteren: Ze gooien de saaie en simpele foto's weg (zoals een foto van een enkele auto).
  2. Maken: Mensen maken er echte, moeilijke scenarios van. Bijvoorbeeld: "Ik heb een allergie voor noten, zoek de chocoladesaus met de minste suiker op deze foto van een supermarktplank."
  3. Testen: Ze laten de AI de taak doen. Als de AI het niet zelfstandig kan oplossen met de juiste tools, is het geen goede testvraag.
  4. Resultaat: Uiteindelijk houden ze 209 super-moeilijke taken over.

Wat hebben ze ontdekt?
Ze hebben de beste AI's ter wereld (zoals GPT-5, Gemini, Claude) op deze test laten springen. Het nieuws is niet zo goed:

  • Het is heel moeilijk: Zelfs de slimste AI haalt maar 27% van de vragen goed. Dat is alsof je een examen doet en 27 van de 100 vragen goed hebt.
  • De fouten: Waar gaan ze vaak mis?
    • Slecht kijken: Ze zien een klein detail op een foto niet (bijvoorbeeld een klein lettertje op een etiket) en trekken daaruit de verkeerde conclusie.
    • Vergeten: Ze vergeten wat ze eerder hebben gevonden en doen een nieuwe zoektocht die ze al gedaan hadden.
    • Hallucineren: Ze verzinnen feiten omdat ze denken dat ze het wel weten, in plaats van het op te zoeken.

Waarom is dit belangrijk?
Vroeger testten we AI's op of ze een kat konden herkennen op een foto. Dat is makkelijk. AgentVista test of ze echt nuttig kunnen zijn in het echte leven. Het laat zien dat we nog een lange weg te gaan hebben voordat we een AI hebben die je echt kunt vertrouwen om complexe, praktische taken uit te voeren zonder dat je er zelf bij hoeft te zijn.

Kortom:
AgentVista is een strenge leraar die de slimste digitale studenten een moeilijke, realistische opdracht geeft. De studenten (de AI's) doen het momenteel nog niet goed genoeg, maar deze test helpt ons om ze in de toekomst veel slimmer en betrouwbaarder te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →