← Nieuwste papers
💻 computer science

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

Dit artikel introduceert GuideMe, de eerste multi-domein benchmark voor streamingvideo die is ontworpen om multimodale Large Language Models te evalueren en te trainen op closed-loop interactieve taakbegeleiding, waarbij wordt onthuld dat huidige modellen uitblinken in het geven van instructies, maar aanzienlijk moeite hebben met realtime foutdetectie en corrigerende feedback.

Oorspronkelijke auteurs: Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

Gepubliceerd 2026-07-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te leren hoe je een complex meubelstuk monteert of een ingewikkeld gerecht bereidt. Je hebt een zeer slimme, deskundige vriend (een AI) die elke handleiding heeft gelezen en elke kookshow heeft bekeken.

Het Probleem:
Op dit moment, als je deze vriend om hulp vraagt, zijn ze erg goed in het geven van een lijst met instructies nadat je klaar bent met het hele proces. Ze kunnen zeggen: "Nou, je deed stap 1, en toen stap 2, en daarna maakte je een fout." Maar ze zijn slecht in het zijn van een real-time coach. Ze kunnen niet naar je kijken terwijl je aan het werk bent, merken dat je op het punt staat de verkeerde schroevendraaier te gebruiken, en direct zeggen: "Wacht! Stop! Dat is het verkeerde gereedschap!"

De meeste huidige AI-modellen zijn als een filmcriticus die pas een recensie schrijft nadat de film is afgelopen. Ze zijn niet goed in het zijn van een regisseur die "Cut!" roept terwijl de scène wordt opgenomen.

De Oplossing: "GuideMe"
De auteurs van dit paper hebben een nieuwe testomgeving gebouwd genaamd GuideMe. Denk aan het als een enorme sportschool voor AI-coaches.

  • De Training: Ze hebben een enorme bibliotheek gemaakt van meer dan 2.400 video's (zoals koken, reparaties, dagelijkse taken en fitness) met een totaal van meer dan 223 uur.
  • De Oefening: Ze hebben de video's niet alleen gelabeld; ze hebben ze veranderd in interactieve gesprekken. In deze sportschool moet de AI:
    1. De volgende instructie geven.
    2. De gebruiker het uitvoeren zien doen.
    3. Cruciaal: Als de gebruiker een fout maakt, moet de AI dit direct opmerken en zeggen: "Nee, dat is fout, probeer dit in plaats daarvan."
    4. Als de gebruiker het goed doet, moet de AI weten dat hij stil moet blijven en niet mag onderbreken.

De Grote Ontdekking
De onderzoekers hebben veel verschillende AI-modellen (zowel bekende commerciële als open-source modellen) in deze sportschool geplaatst om te zien hoe ze presteerden. De resultaten waren verrassend en een beetje teleurstellend:

  • De "Praters": Sommige AI's waren te enthousiast. Ze bleven instructies schreeuwen zelfs als de gebruiker het goed deed, of ze gaven advies op het verkeerde moment. Het was als een coach die nooit ophoudt met praten, zelfs niet als je gewoon aan het stretchen bent.
  • De "Stilzwijgers": Andere AI's waren te verlegen. Ze keken toe hoe de gebruiker grote fouten maakte, maar zeiden niets en wachtten tot de gebruiker om hulp vroeg. Ze waren als een coach die gewoon op de bank zit en toekijkt hoe je faalt.
  • De Kloof: De AI's waren eigenlijk best goed in zeggen: "Dit is wat je hierna moet doen." Maar ze waren slecht in het moeilijke deel: kijken naar wat je echt aan het doen bent, beseffen dat het fout is, en het ter plekke corrigeren.

Hoe ze succes maten
Om de AI te beoordelen, gebruikten ze een scorekaart met drie delen:

  1. Timing: Sprak de AI op het exacte juiste moment, of was het te vroeg/te laat?
  2. Gedrag: Wist de AI wanneer hij stil moest blijven en wanneer hij moest spreken? (Dit was het moeilijkste deel).
  3. Kwaliteit: Wanneer de AI wel sprak, was het advies dan daadwerkelijk nuttig en correct?

De Kern van het Verhaal
Het paper concludeert dat hoewel AI erg goed wordt in het beschrijven van video's en het geven van stapsgewijze lijsten, het nog lang niet een betrouwbare, real-time coach is. Het kan je wel het recept vertellen, maar het kan je nog niet in de gaten houden terwijl je kookt om te voorkomen dat je de toast aanbrandt. De auteurs hopen dat deze nieuwe "sportschool" (GuideMe) toekomstige AI-ontwikkelaars zal helpen om hun modellen te trainen om echte interactieve coaches te worden in plaats van slechts passieve vertellers.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →