← Nieuwste papers
🤖 AI

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench introduceert de eerste interactieve multimodale benchmark voor hulpmiddelgebruikende agenten, met 1.045 egocentrische videotaken en een gesimuleerde gebruikersomgeving om de synergie van waarneming, redenering en dynamische interactie streng te evalueren, waarbij blijkt dat huidige state-of-the-art-modellen aanzienlijk moeite hebben met deze complexe vaardigheden.

Oorspronkelijke auteurs: Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

Gepubliceerd 2026-05-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een robotbutler te leren hoe hij je kan helpen bij het koken van het avondeten of het boodschappen doen, terwijl je een camera op je hoofd draagt. Je wilt dat de robot niet alleen ziet wat je doet, maar ook nadenkt over wat als volgende moet gebeuren, tools gebruikt om een database te raadplegen (zoals een kookboek of een prijslijst), en terugpraat als hij in de war raakt.

Het artikel introduceert EgoBench, wat in wezen een gigantisch, zeer moeilijk "eindexamen" is voor deze robotbutlers. Hier is een uitleg van wat het artikel doet, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Te Makkelijke" Tests

Stel je voor dat je een hond traint. Als je hem alleen test door te vragen of hij "zit" op een rustig, leeg veld, lijkt hij misschien een genie. Maar in de echte wereld moet de hond zitten terwijl een auto toetert, een eekhoorn langsrent en je een complexe opdracht geeft zoals "zit, haal dan de bal, maar alleen als hij rood is".

De auteurs zeggen dat de huidige tests voor AI-agenten vergelijkbaar zijn met dat rustige veld. Ze zijn te simpel. Ze testen niet of de AI kan:

  • Zien wat er gebeurt in een rommelige, bewegende video (zoals een eerstepersoonsbeeld van je handen die koken).
  • Nadenken over een meerstaps logische puzzel (bijvoorbeeld: "Als de tomaat rood is, check dan de koelkast; als hij verlopen is, koop dan een nieuwe").
  • Praten met een mens die misschien ongeduldig is, vergeetachtig is of verwarrende hints geeft.

2. De Oplossing: EgoBench (De "Obstakelbaan")

EgoBench is een nieuw testterrein dat specifiek is gebouwd om te zien of AI-agenten het chaos van het echte leven aankunnen. Het heeft drie hoofdonderdelen:

  • De Video (De Ogen): In plaats van statische afbeeldingen, bekijkt de AI korte eerstepersoonsvideo's (zoals GoPro-beelden van je hoofd). Het is alsof de AI je bril draagt. Het moet uitzoeken: "Ah, dat is een tomaat links, en ik heb hem zojuist opgepakt."
  • De Tools (De Handen): De AI kan niet zomaar gissen. Het moet "tools" gebruiken (zoals een digitaal telefoonboek of een database) om verborgen informatie te vinden. Bijvoorbeeld: de video toont een fles wijn, maar de video zegt niet of deze verlopen is. De AI moet een tool gebruiken om de database te controleren.
  • De Gesimuleerde Gebruiker (De Mond): Dit is het slimme deel. Het artikel heeft een "nepmens" (een computerprogramma dat zich als een mens gedraagt) gebouwd om met de AI te praten. Deze nepmens kan zijn:
    • Gemakkelijk: Alleen beleefd vragen stellen.
    • Moeilijk: Ongeduldig zijn, irrelevante informatie geven ("Trouwens, het weer is mooi!") of boos worden als de AI te langzaam is.
    • Statisch: Alle instructies in één keer geven in één groot alinea.

3. Het Beoordelingssysteem: Geen Valsspelen Toegestaan

In veel AI-tests leest een slimme computer (een andere AI) het antwoord en zegt: "Dat klinkt goed!" Dit is subjectief.

EgoBench gebruikt een deterministisch beoordelingssysteem. Denk hierbij aan een videospeelscore:

  • Procescontrole: Heeft de AI de juiste tools aangeroepen? (Heeft het de prijs gecontroleerd? Heeft het de vervaldatum gecontroleerd?)
  • Resultaatcontrole: Stemde de uiteindelijke database-status overeen met het doel? (Is het artikel daadwerkelijk in de winkelwagen? Is het recept bijgewerkt?)
    Als de AI zegt "Ik heb het gedaan" maar de database toont de wijziging niet, krijgt het een nul. Geen discussie met de leraar.

4. De Resultaten: De "Realiteitscheck"

De auteurs hebben 8 van de slimste, meest geavanceerde AI-modellen die vandaag beschikbaar zijn, op dit examen getest.

Het oordeel? Ze faalden jammerlijk.

  • Zelfs het beste model haalde ongeveer 19% tot 30% van de taken goed, afhankelijk van hoe moeilijk de "nepmens" zich gedroeg.
  • In het makkelijkste scenario (Retail/Winkelen) kreeg het beste model nog steeds slechts ongeveer 30% goed.

Waarom faalden ze? Het artikel vond dat de AI-agenten worstelden met:

  • Het verkeerd interpreteren van de video: "Ik dacht dat het een tomaat was, maar het was eigenlijk een rode paprika."
  • Hallucineren: Feiten verzinnen die niet in de video of de database stonden.
  • Slechte logica: De "Als/Dan"-regels verkeerd toepassen.
  • Risicovolle bewegingen: Dingen doen die de gebruiker niet vroeg, zoals items uit een lijst verwijderen.

Samenvatting

Het artikel betoogt dat AI, hoewel het goed wordt in praten en naar afbeeldingen kijken, nog steeds zeer slecht is in het combineren van die vaardigheden om daadwerkelijk dingen te doen in een rommelige, realistische omgeving waar het met een mens moet praten, tools moet gebruiken en complexe regels moet volgen. EgoBench is de nieuwe liniaal die we gebruiken om precies te meten hoe ver we nog moeten gaan.

Belangrijke Opmerking: Het artikel presenteert alleen deze benchmark en de testresultaten. Het beweert niet dat deze AI-agenten klaar zijn om te worden gebruikt in ziekenhuizen, voor zelfrijdende auto's of in enige andere specifieke real-world toepassing. Het zegt simpelweg: "Hier is een test, en hier is hoe slecht de huidige topmodellen erop presteren."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →