← Nieuwste papers
🤖 machine learning

SERUM: State Extraction and Refinement for User Modeling

Het artikel introduceert SERUM, een multi-pass framework dat hiërarchische VLM-annotatie en iteratieve verfijning benut om automatisch gestructureerde, interpreteerbare gebruikersgedragsmodellen te extraheren uit ongestructureerde egocentrische schermvideo's, wat de voorspellende nauwkeurigheid en labelcoherentie aanzienlijk verbetert ten opzichte van single-pass methoden.

Oorspronkelijke auteurs: Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang

Gepubliceerd 2026-08-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij een behulpzame sidekick kan zijn. Om dat te doen, moet de robot niet alleen begrijpen wat je op dit moment doet, maar ook waarom je het doet en wat je waarschijnlijk hierna zult gaan doen. Dit is de wereld van "user modeling", een tak van kunstmatige intelligentie waarbij computers proberen een mentale kaart van menselijk gedrag te bouwen. Meestal moeten wetenschappers om dergelijke kaarten te maken, uren aan video handmatig bekijken en elke actie opschrijven, als een heel traag, heel duur spelletje "Ik Verstop Me". Maar wat als we de robot gewoon een ruwe video van iemands dag kunnen geven en hem het zichzelf laten uitzoeken met alle patronen? Dat is de grote vraag die dit artikel aanpakt: Kunnen we rommelige, ongeorganiseerde videobeelden omzetten in een helder, gestructureerd verhaal over menselijke intentie zonder dat een mens ook maar één label hoeft te schrijven?

Het artikel introduceert een nieuw systeem genaamd SERUM (State Extraction and Refinement for User Modeling). Denk aan SERUM als een zeer geduldige, superintelligente detective die een video niet slechts één keer bekijkt, maar vele malen, en bij elke kijkbeurt beter wordt in de taak.

In het begin, als je een standaard AI vraagt om een video te beschrijven, zegt het misschien: "Persoon houdt een boormachine vast," dan "Persoon kijkt naar een doos," en dan "Persoon drukt op een knop." Het ziet de acties, maar mist het grotere plaatje. Het weet niet dat al die kleine acties eigenlijk deel uitmaken van één groot doel: "De airconditioner repareren." Erger nog, als de AI de video frame voor frame bekijkt zonder te onthouden wat er vijf seconden geleden gebeurde, kan het in de war raken en dezelfde actie in de ene seconde "groenten schoonmaken" noemen en in de volgende "producten afspoelen". Dit wordt "hallucinatie" en "temporele conflatie" genoemd – in feat maakt de AI dingen bij elkaar of raakt het de tijdlijn kwijt omdat het context mist.

SERUM lost dit op door een slimme "multi-pass" strategie te gebruiken. Stel je voor dat je een complexe puzzel probeert op te lossen. Bij je eerste poging plaats je misschien alleen de randstukjes en raad je wat de afbeelding is. Bij je tweede poging kijk je naar de afbeelding die je bent begonnen te bouwen en realiseer je je: "Oh, dat stukje is geen wolk in de lucht; het is onderdeel van een berg!" Je past je gok aan. SERUM doet precies dit met video. Het doorloopt de video meerdere keren.

  1. Pass 1: Het bekijkt de frames en geeft een ruwe beschrijving van de acties (bijv. "typen op toetsenbord").
  2. Pass 2: Het bekijkt die acties en probeert de intentie of het doel te raden (bijv. "code schrijven").
  3. Pass 3: Het gaat terug naar de acties, maar gebruikt dit keer de nieuwe "intentie"-gok om de actiebeschrijving te verfijnen. Misschien was "typen op toetsenbord" niet zomaar typen; het was "code debuggen".
  4. Pass 4: Het verfijnt de intentie opnieuw op basis van de nieuwe, scherpere actielabels.

Het systeem blijft door de video loopen, waarbij het afwisselt tussen het raden van acties en het raden van doelen, waarbij het de "geheugensteun" van de vorige ronde gebruikt om fouten te corrissen. De auteurs ontdekten dat het systeem na ongeveer 8 rondes van dit heen-en-weer gaan stopt met van mening veranderen. Ze noemen dit "schematic equilibrium" (schematisch evenwicht). Het is alsoast de puzzel die eindelijk op zijn plek valt, en de AI heeft een stabiele, consistente woordenschat gevonden om te beschrijven wat er gebeurt.

Maar er is nog één stap. Omdat de AI creatief is, kan het verschillende woorden gebruiken voor hetzelfde, zoals "de AC repareren" en "de HVAC herstellen." SERUM heeft een laatste "opruimfase" waarin het een wiskundig hulpmiddel gebruikt om te beseffen dat deze hetzelfde zijn en ze samenvoegt tot één helder label. Dit verkleint de lijst met mogelijke staten en maakt het uiteindelijke model veel scherper.

Het team testte dit op 61 video's verspreid over vier verschillende werelden: coderen, koken, fysieke activiteiten en het dagelijks leven. Ze ontdekten dat de uiteindelijke modellen van SERUM veel beter waren in het voorspellen van wat een persoon hierna zou doen vergeleken met eenvoudige gokstrategieën. Zo kreeg de system in coderingsvideo's de volgende actie in 76,4% van de gevallen goed na normalisatie, terwijl een eenvoudige "raad het meest voorkomende ding"-strategie het slechts in ongeveer 47% van de gevallen goed had.

Menselijke experts hebben de resultaten ook beoordeeld. Zij waren het ermee eens dat de labels van de laatste ronde van SERUM in 88,3% van de gevallen correct waren, en zij gaven de voorkeur aan deze verfijnde labels boven de rommelige eerste gokken in 82,8% van de gevallen. Dit suggereert dat het "loopen"-proces de AI echt helpt om het verhaal achter de video te begrijpen, en niet alleen de individuele frames.

Kortom, SERUM laat zien dat we geen mensen nodig hebben om elke seconde van een video handmatig te labelen om menselijk gedrag te begrijpen. Door een AI de beelden steeds opnieuw te laten bekijken en erover na te denken, kunnen we een gestructureerde, betrouwbare kaart bouwen van wat mensen doen en waarom, wat de deur opent naar toekomstige AI-assistenten die onze workflows echt kunnen begrijpen en ons proactief kunnen helpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →