← Nieuwste papers
💻 computer science

Perception Test 2025: Challenge Summary and a Unified VQA Extension

Dit artikel vat de resultaten samen van de Perception Test 2025-uitdaging, die state-of-the-art multimodale videomodellen evalueerde op een geünificeerde benchmark met geconsolideerde tracks zoals geünificeerde video-QA en tracking om de aanzienlijke moeilijkheden te benadrukken waar huidige modellen mee geconfronteerd worden bij het aanpakken van diverse perceptietaken via één interface.

Oorspronkelijke auteurs: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

Gepubliceerd 2026-04-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische talentenjacht met hoge inzet voor voor computervisie, maar in plaats van te zingen of te dansen, zijn de deelnemers kunstmatige intelligentie-modellen die proberen de wereld te "zien" en te begrijpen. Dit artikel is het rapport van de editie van 2025 van deze show, genaamd de Perception Test, die plaatsvond naast een grote conferentie voor informatica.

Hieronder volgt een overzicht van wat er gebeurde, met behulp van eenvoudige analogieën.

Het Grote Idee: Van Gespecialiseerde Hulpmiddelen tot een Zwitsers Zakmes

In het verleden waren AI-modellen als gespecialiseerde hulpmiddelen: één model was uitstekend in het vinden van een specifieke persoon in een menigte (tracking), een ander was goed in het opsporen van een auto-ongeval (actieherkenning), en een derde was goed in het beantwoorden van vragen over een video.

Voor de uitdaging van dit jaar besloten de organisatoren om te stoppen met het testen van deze "gespecialiseerde hulpmiddelen". In plaats daarvan eisten ze een Zwitsers zakmes. Ze wilden zien of één enkel AI-model alles tegelijk kon doen zonder van hoed te wisselen. Ze stelden de vraag: "Kan één brein het volgen van een bal, het horen van een geluid en het beantwoorden van een vraag over het tafereel allemaal tegelijk aan?"

De Vijf Hoofdevenementen (Tracks)

De competitie bestond uit vijf hoofdevenementen, waarbij elk een andere "spier" van de AI testte:

  1. De Geïntegreerde Video-Quiz (De "Magic Eye"-test):

    • De Oude Manier: Om te testen of een AI een bewegend stipje kon volgen, moest je een specifieke tracker bouwen.
    • De Nieuwe Manier: De organisatoren veranderden deze moeilijke taken in meerkeuzevragen. Stel je een video voor waarin een specifieke plek op een tafel groen opflitst. De AI wordt gevraagd: "Welke van deze vijf stippen was degene die opflitste?"
    • De Twist: Ze voegden lastige vragen toe zoals "In welke volgorde vonden deze handelingen plaats?" of "Welk object deed alsof het iets deed?" Dit dwong de AI om taal te gebruiken om visuele puzzels op te lossen.
  2. De Dubbele Tracking-Uitdaging:

    • De AI moest twee dingen tegelijk volgen: een heel object (zoals een stuiterende bal) en een specifiek punt op dat object (zoals een rode sticker op de bal), zelfs als de bal achter een muur verdween (occlusie).
  3. De Geluid-en-Actie-Detective:

    • De AI moest een video bekijken en zeggen: "Op precies 10 seconden schopte iemand een bal, en je hoorde een doep." Het moest het wanneer en wat vinden voor zowel de visuele actie als het geluid tegelijkertijd.
  4. De "Klik-en-Kies"-Detective:

    • De AI kreeg een vraag zoals: "Welke hond jaagt de kat na?" en moest niet alleen zeggen "De bruine", maar ook daadwerkelijk een kader om die specifieke hond te tekenen en deze door de hele video te volgen.
  5. De Marathonloper (Uur-Lange Video's):

    • De meeste AI-modellen raken moe na het bekijken van een clip van 30 seconden. Dit evenement gooide video's van 1 uur naar hen toe. De AI moest details uit het begin onthouden om een vraag aan het einde te beantwoorden.

De Resultaten: Een Verhaal van Twee Snelheden

Het artikel rapporteert een fascinerende splitsing in hoe goed de AI presteerde:

  • De Taalwinnaars: Wanneer de AI taal kon gebruiken (vragen beantwoorden, scènes beschrijven), scoorde het veel beter dan vorig jaar. Sterker nog, voor de "Klik-en-Kies"- en "Uur-Lange"-tests verdubbelden de scores bijna. Het is alsof de AI plotseling een handleiding leerde lezen en deze toepaste op de visuele wereld.
  • De "Stille" Strijd: Wanneer de AI dingen moest doen zonder taal (zoals gewoon een stipje volgen of een geluid vinden), verbeterde het niet veel. De beste "Zwitsers zakmes"-modellen van dit jaar waren eigenlijk trager dan de gespecialiseerde "single-task"-modellen van vorig jaar.

De Conclusie: Het artikel concludeert dat AI, hoewel het steeds verbazingwekkender wordt in het praten over wat het ziet, nog steeds worstelt om één enkel, geïntegreerd brein te zijn dat alles perfect tegelijk kan doen. Het "general perception"-model is onderweg, maar het is er nog niet helemaal.

De Winnaars

  • Totaal Aantal Inschrijvingen: Meer dan 100 teams leverden 450 pogingen in.
  • De Prijs: De winnaars namen in totaal $47.000 mee naar huis.
  • Toppresteerders: Het team "NJUST_KMG" was een frequente winnaar en behaalde topposities in de categorieën tracking, geluid en uur-lange video's. Een ander team, "SGVR@KAIST", won de "Klik-en-Kies"-categorie.

In het Kort

De Perception Test van 2025 liet ons zien dat AI snel leert om te praten over wat het ziet, maar het leert nog steeds hoe het alles tegelijk moet doen zonder in de war te raken. De kloof tussen "gespecialiseerde robots" en "algemene, mensachtige waarneming" wordt kleiner, maar de finishlijn is nog steeds een beetje weg.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →