← Nieuwste papers
💻 computer science

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE is een efficiënt fine-tuning-framework voor op DiT gebaseerde video-objectverwijdering dat de inferentie versnelt door adaptief essentiële tokens te selecteren via Batch Variable-length Indexing en ongemaskerde gebieden te simuleren met een Diffusion Process Simulator, waardoor een snelheidswinst tot 2,5X wordt bereikt terwijl de visuele kwaliteit behouden blijft.

Oorspronkelijke auteurs: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

Gepubliceerd 2026-05-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een video hebt van een drukke straat en je wilt een specifieke persoon die over het beeld loopt verwijderen. In het verleden waren AI-modellen die dit probeerden te doen, als een team schilders dat, in plaats van de persoon gewoon over te schilderen, besloot elke keer opnieuw de hele straat, de lucht en elke auto op de achtergrond opnieuw te schilderen bij elke wijziging. Dit was ontzettend traag en verspillend, omdat 90% van de video niet aangeraakt hoefde te worden.

Dit paper introduceert YOSE (You Only Select Essential Tokens), een nieuwe methode die fungeert als een slimme, chirurgische editor. In plaats van het hele canvas opnieuw te schilderen, schildert YOSE alleen de specifieke plekken die gerepareerd moeten worden, terwijl het er tegelijkertijd voor zorgt dat de nieuwe verf perfect overgaat in de onaangetaste delen.

Hier is hoe YOSE werkt, opgesplitst in eenvoudige concepten:

1. Het Probleem: De "Hele Canvas"-Aanpak

Huidige AI-videotools (gebaseerd op iets dat "DiT" wordt genoemd) zijn zeer goed in het verwijderen van objecten, maar ze zijn traag. Zelfs als je alleen een klein vogeltje uit een video wilt verwijderen, verwerkt de computer elk afzonderlijk pixel van de hele video. Het is alsof je een sloopkogel gebruikt om een notenkraker te kraken. Het paper merkt op dat zelfs de beste bestaande tools slechts ongeveer 10 frames per seconde (FPS) halen, wat te traag is voor gebruik in real-time.

2. De Oplossing: Twee Slimme Hulpmiddelen

YOSE voegt twee speciale "gadgets" toe aan de bestaande AI om het sneller te maken zonder de kwaliteit te verstoren.

Gadget A: De "Slimme Knipper" (Batch Variable-length Indexing)

  • De Analogie: Stel je voor dat je een stapel van 100 huiswerkbladen hebt, maar slechts 5 daarvan bevatten fouten. Een normale leraar corrigeert alle 100 bladen één voor één. YOSE is als een leraar die direct de 5 bladen met fouten eruit knipt, alleen die corrigeert en ze vervolgens weer in de stapel legt.
  • Hoe het werkt: De AI kijkt naar het "masker" (het gebied dat je wilt wijzigen). Het gebruikt een techniek genaamd BVI om fysiek alleen de datapunten (tokens) binnen dat masker te selecteren. Het negeert de rest van de video tijdens de zware arbeid. Hierdoor kan de computer werken met een variabel aantal items, afhankelijk van hoe groot het object is, in plaats van een vast, enorm aantal.

Gadget B: De "Geestfluisteraar" (Diffusion Process Simulator)

  • De Analogie: Als je alleen het kleine plekje schildert waar de persoon stond, kan de nieuwe verf eruitzien als een sticker die niet past bij de belichting of textuur van de straat eromheen. Je moet weten hoe de rest van de straat eruitziet om de nieuwe verf erin te laten overlopen.
  • Het Probleem: Als je de "slechte" delen eruit knipt om tijd te besparen, vergeet de AI hoe de "goede" delen eruitzien. Het verliest de context.
  • De Oplossing: YOSE gebruikt een module genaamd DiffSim. Het verwerkt de "goede" delen van de video niet daadwerkelijk (wat traag zou zijn). In plaats daarvan creëert het een simulatie of een "geest" van wat die goede delen doen. Het fluistert naar de AI: "Hé, de lucht hierboven is blauw, en de auto daar beweegt naar links", zodat de AI weet hoe het het nieuwe plekje naadloos moet laten overlopen. Het is alsof je een kaart van de hele stad hebt terwijl je alleen door één wijk loopt.

3. De "Naadloze Steek" (Fusiestrategie)

Zelfs met de geestfluisteraar kan er een heel klein zichtbaar lijntje ontstaan waar het nieuwe video-overleg op het oude video-overleg aansluit. YOSE gebruikt een laatste truc: het laat de randen licht overlappen en past de helderheid en kleurstatisieken (gemiddelde en variantie) aan om de overgang onzichtbaar te maken. Het is alsof je de randen van een uitgeknipte foto verzacht zodat deze in de achtergrond oplost.

De Resultaten: Snel en Schoon

Het paper beweert dat door het gebruik van deze trucs:

  • Snelheid: YOSE is 2,5 keer sneller dan de vorige beste methoden. Als de oude methode 10 seconden duurde, duurt YOSE ongeveer 4.
  • Schaalbaarheid: De snelheid hangt af van de grootte van het object dat je verwijdert. Als je een klein vlekje verwijdert, is het supersnel. Als je een enorm gebouw verwijdert, wordt het langzamer, maar het wordt nooit langzamer dan de oude methode.
  • Kwaliteit: De videokwaliteit blijft even goed als bij de trage, volledige verwerkingsmethoden. Sterker nog, omdat het per ongeluk de achtergrond niet verstoort (aangezien het die negeert), ziet de achtergrond er vaak stabieler uit.

Samenvatting

YOSE is een "slimme editor" die beseft dat je niet de hele universum opnieuw hoeft te simuleren om een enkel object te verwijderen. Het knipt het werk dat het niet hoeft te doen eruit, gebruikt een slimme simulatie om de context van de delen die het negeerde te onthouden, en naait alles weer zo perfect aan elkaar dat je het verschil niet kunt zien. Het verandert een traag, zwaar proces in een snel, chirurgisch proces.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →