← Nieuwste papers
💻 computer science

TAPNext++: What's Next for Tracking Any Point (TAP)?

Deze paper introduceert TAPNext++, een verbeterd model dat het bestaande TAPNext-aanpak voor het volgen van willekeurige punten in video's overwint door langere sequenties te ondersteunen en het tot nu toe verwaarloosde probleem van het opnieuw detecteren van verduisterde of uit beeld verdwenen punten effectief op te lossen.

Oorspronkelijke auteurs: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

Gepubliceerd 2026-04-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

TAPNext++: De Onvermoeibare Camera-Begeleider

Stel je voor dat je een video maakt van een drukke markt. Je wijst met je vinger naar een specifieke appel op een kraam en zegt: "Hou die in de gaten."

De meeste huidige computersystemen (de "oude modellen") doen dit prima zolang de appel in beeld blijft. Maar als de appel even achter een doos verdwijnt, of als de kraamman hem even uit het kader haalt en weer terugzet, raken deze systemen de draad kwijt. Ze vergeten waar de appel was en kunnen hem niet meer vinden. Het is alsof je een vriend in een menigte probeert te volgen, maar zodra hij even achter een paal staat, je hem volledig uit het oog verliest en denkt: "Wie was dat ook weer?"

TAPNext++ is de nieuwe, super-slimme versie van deze "vriend". Het is een computerprogramma dat ontwikkeld is om elk punt in een video te volgen, hoe lang de video ook duurt en hoe vaak het punt verdwijnt en weer terugkomt.

Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. Het Probleem: Het "Korte Geheugen"

De vorige generatie systemen (zoals TAPNext) hadden een heel kort geheugen. Ze waren goed in het volgen van dingen in korte clips, maar als je ze een lange video gaf (bijvoorbeeld 1000 beelden lang), raakten ze in de war. Het was alsof iemand die een lange tekst moet onthouden, na de eerste paar zinnen al begint te vergeten wat er aan het begin stond. Ze waren ook slecht in het vinden van dingen die even uit beeld waren geweest.

2. De Oplossing: "Trainen voor de Marathon"

De onderzoekers van TAPNext++ hebben een slimme truc bedacht. In plaats van het systeem alleen te laten trainen op korte filmpjes (zoals een sprintje van 50 meter), hebben ze het getraind op extreem lange video's (van 1024 beelden, alsof je een hele marathon loopt).

  • De Analogie: Stel je voor dat je een atleet traint. Als je hem alleen maar korte sprints laat lopen, wordt hij goed in sprinten, maar hij bezwijkt bij een lange wandeling. Door hem direct lange wandelingen te laten doen, leert zijn lichaam (en in dit geval het computermodel) om energie te besparen en de route langdurig in het geheugen te houden.
  • De Techniek: Omdat deze lange video's te groot zijn voor één computerchip, hebben de onderzoekers een manier bedacht om de "rekenkracht" van meerdere chips tegelijkertijd te gebruiken, alsof je een zware last verdeelt over een heel team dragers.

3. De "Roll"-Truc: Het Verdwenen Punt

Een groot probleem was: wat als een punt (bijvoorbeeld een bal) uit het beeld vliegt en aan de andere kant weer binnenkomt? De oude systemen dachten vaak: "Die bal is weg, ik zoek hem niet meer."

TAPNext++ gebruikt een speciale oefening tijdens het trainen, genaamd "Roll Augmentation".

  • De Analogie: Stel je voor dat je een foto van een kamer op een rolletje papier tekent. Als je het papier een beetje draait, verdwijnt de hoek van de kamer aan de ene kant en komt hij aan de andere kant weer terug.
  • Het Effect: Door het systeem te laten oefenen met deze "rolbewegingen" (waar objecten verdwijnen en aan de andere kant weer opduiken), leert het systeem: "Oh, als dit punt verdwijnt, moet ik niet stoppen met zoeken, maar kijken of het aan de andere kant weer terugkomt." Het leert de bal te herkennen, zelfs als hij een hele ronde heeft gemaakt.

4. Een Nieuwe Score: De "Herontdekking"-Test

De onderzoekers merkten dat de oude meetlatjes niet goed werkten. Ze keken alleen naar hoe lang een punt zichtbaar bleef. Maar wat als een punt 10 seconden weg was en daarna weer terugkwam? De oude systemen faalden hierop.

Ze introduceerden een nieuwe score: AJRD (Herontdekting Gemiddelde Jaccard).

  • De Analogie: Het is alsof je een spelletje "Verstoppeertje" speelt. De oude regels gaven punten als je de verstekeling niet zag verdwijnen. TAPNext++ krijgt punten als je de verstekeling vindt, nadat hij zich 10 minuten lang perfect heeft verstopt en dan plotseling weer uit de kast springt. TAPNext++ is hierin de beste speler ooit.

5. Waarom is dit belangrijk?

Dit klinkt als een technisch spelletje, maar het is cruciaal voor de toekomst:

  • Robotica: Een robot die een kamer schoonmaakt, moet kunnen onthouden waar een stofje lag, zelfs als hij er even niet naar kan kijken.
  • Augmented Reality (AR): Als je een virtuele game speelt in je woonkamer en je loopt even naar de keuken, moet de game weten waar je virtuele objecten stonden toen je terugkwam.
  • Snelheid: Het werkt razendsnel. Het kan 193 beelden per seconde verwerken. Dat is sneller dan het menselijk oog kan waarnemen, waardoor het perfect is voor realtime toepassingen.

Kortom:
TAPNext++ is als een onvermoeibare, super-attentieve cameraman. Hij vergeet nooit waar hij was, hij kan een object vinden nadat het lang verdwenen is, en hij doet dit allemaal terwijl hij razendsnel is en weinig energie verbruikt. Ze hebben bewezen dat het probleem niet zat in de "hersenen" van het systeem, maar in hoe ze het hadden getraind. Met de juiste training (lange video's en slimme oefeningen) is het systeem nu een wereldkampioen in het volgen van alles en iedereen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →