← Nieuwste papers
🤖 AI

STORM: End-to-End Referring Multi-Object Tracking in Videos

Deze paper introduceert STORM, een end-to-end MLLM-framework dat referring multi-object tracking (RMOT) oplost door gronding en tracking te combineren via een nieuwe taakcompositiestrategie, en presenteert het STORM-Bench-dataset dat leidt tot state-of-the-art prestaties op diverse benchmarks.

Oorspronkelijke auteurs: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

Gepubliceerd 2026-04-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

STORM: De "Super-Volger" die Praten en Kijken Combineert

Stel je voor dat je een video bekijkt van een drukke markt. Je vraagt aan je vriend: "Kijk, vind die ene man met de rode hoed die een ijsje eet, en volg hem terwijl hij door de menigte loopt."

Vroeger was dit voor computers heel lastig. Ze konden ofwel mensen vinden, ofwel praten, maar het combineren van beide in één vloeiende beweging was als proberen te fietsen terwijl je een boek leest: de twee taken botsten met elkaar.

De onderzoekers van Amazon hebben STORM bedacht. Dit is een slimme computerprogramma (een "AI") die dit probleem oplost. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Bakermat" van de AI

Tot nu toe moesten computers twee aparte taken doen:

  1. Zoeken: "Waar staat de man met de rode hoed?" (Dit heet grounding).
  2. Volgen: "Waar is hij nu, en waar gaat hij heen?" (Dit heet tracking).

Oude systemen deden dit met twee verschillende "hulpmiddelen" die niet goed met elkaar spraken. Het was alsof je een detective hebt die de verdachte beschrijft, en een andere die de verdachte volgt, maar ze communiceren niet. Als de beschrijving lastig is (bijv. "de man die net voorbij de vrouw met de blauwe paraplu loopt"), raken ze de draad kwijt.

2. De Oplossing: STORM (De Alles-in-Één Detective)

STORM is anders. Het is een enkele, super-slimme "denker" (een Large Language Model, net als een geavanceerde chatbot) die zowel kan zien als kan praten.

  • Geen losse hulpmiddelen: STORM heeft geen extra camera's of zoekmachines nodig. Het kijkt naar de video en het gesprek tegelijkertijd.
  • Het denken: Als je vraagt om de man met het ijsje, denkt STORM: "Oké, ik zie een man met een hoed. Hij eet iets. Hij loopt naar links. Nu is hij achter die auto." Het houdt het verhaal in zijn hoofd vast, frame na frame.

3. De Leerstrategie: "Eerst de Basis, Dan de Meester" (TCL)

Het grootste probleem bij dit soort taken is dat er heel weinig voorbeelden zijn van mensen die precies zeggen wat ze willen zien in een video. Je kunt niet zomaar 10.000 films maken met perfecte beschrijvingen; dat kost te veel tijd en geld.

De onderzoekers bedachten een slimme truc, genaamd Task-Composition Learning (TCL).

  • De Analogie: Stel je voor dat je een kok wilt leren die een heel complex gerecht moet maken (RMOT). Je kunt niet direct 10.000 keer dat specifieke gerecht oefenen.
    • Stap 1: Laat de kok eerst koken met simpele ingrediënten (afbeeldingen zoeken) en leren hoe je een gerecht opwarmt zonder dat het verbrandt (objecten volgen in tijd).
    • Stap 2: Laat de kok dan pas het complexe recept oefenen.
  • Het Resultaat: STORM leert eerst op duizenden simpele foto's en korte filmpjes. Daardoor leert het de "basisvaardigheden" van kijken en bewegen. Vervolgens krijgt het een klein beetje training op de moeilijke video's. Hierdoor wordt het een meester, zonder dat ze duizenden dure video's nodig hebben.

4. De Nieuwe Bibliotheek: STORM-Bench

Omdat de oude "boeken" (datasets) vaak onduidelijk waren of te simpel, hebben de onderzoekers een nieuwe bibliotheek gebouwd: STORM-Bench.

  • Ze hebben een slim proces bedacht waarbij ze eerst de objecten in een video vinden, en dan een AI laten bedenken hoe je die objecten precies beschrijft (bijv. "het meisje dat rent achter de hond").
  • Daarna laten ze een andere AI controleren of die beschrijving klopt.
  • Dit zorgt voor een bibliotheek van video's met zeer precieze, menselijke beschrijvingen, zodat STORM kan leren hoe echte mensen praten.

5. Waarom is dit geweldig?

In tests heeft STORM laten zien dat het beter is dan alle vorige systemen.

  • Het begrijpt nuance: Als je zegt "de auto die links van de bus staat", vindt STORM die auto, zelfs als de bus beweegt.
  • Het is robuust: Als een object even uit beeld verdwijnt (bijvoorbeeld achter een boom), onthoudt STORM waar het was en weet het dat het daar weer moet verschijnen.
  • Het is één geheel: Omdat het niet twee aparte systemen gebruikt, maakt het minder fouten en is het sneller.

Kortom: STORM is als een zeer oplettende filmcriticus die niet alleen naar de film kijkt, maar ook luistert naar wat jij vraagt, en dan precies weet welk personage je bedoelt en waar dat personage naartoe gaat, zelfs in een chaotische menigte. Het combineert het beste van twee werelden: het begrijpen van taal en het zien van beweging, in één slimme kop.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →