← Nieuwste papers
💻 computer science

AnyDepth-DETR/-YOLO: Any-depth object detection with a single network

Dit artikel introduceert AnyDepth-DETR/-YOLO, een raamwerk dat het mogelijk maakt dat een enkel objectdetectienetwerk zijn diepte tijdens de inferentie dynamisch aanpast om een continu bereik van afwegingen tussen nauwkeurigheid en efficiëntie te bestrijken zonder opnieuw te trainen, door gebruik te maken van een architectuur met een overslaanbare verfijningspad en zelfdistillatie-training om de featurehiërarchie te behouden en modulariteit per fase te waarborgen.

Oorspronkelijke auteurs: Woochul Kang, Hyungseop Lee, Jiho Lee

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Woochul Kang, Hyungseop Lee, Jiho Lee

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van expert-detectives hebt die proberen objecten in een video te vinden. Meestal moet je om verschillende situaties aan te pakken twee verschillende teams inhuren: één dat snel en vindingrijk is (goed voor snelle controles maar kan details missen) en één dat langzaam en nauwkeurig is (geweldig voor precisie maar duurt eeuwen). In de wereld van AI-objectdetectie betekent dit dat je twee volledig aparte computermodellen moet bouwen en onderhouden.

Het artikel "AnyDepth-DETR/-YOLO" introduceert een nieuwe manier om dit te doen: één enkel detective-team dat zijn eigen grootte direct kan aanpassen.

Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

1. Het Probleem: Het Dilemma van "Één Maat Past Niemand"

Momenteel zijn AI-modellen als statische gebouwen. Als je een heel hoog gebouw wilt (hoge nauwkeurigheid), bouw je het met 20 verdiepingen. Als je een snelle, goedkope constructie nodig hebt (hoge snelheid), bouw je een versie met 5 verdiepingen. Je kunt niet zomaar "verdiepingen" uit het hoge gebouw verwijderen zonder dat het instort, en je kunt niet magisch verdiepingen toevoegen aan het korte gebouw. Ontwikkelaars moeten dus meerdere aparte modellen trainen en opslaan voor elk mogelijk scenario.

2. De Oplossing: Het "Modulaire" Detective-Team

De auteurs hebben een netwerk gecreëerd dat is opgebouwd als een modulair bouwset. In plaats van één solide blok van lagen, is elke fase van het netwerk opgesplitst in twee paden:

  • Het Essentiële Pad (De Kern): Dit is het "moet-hebben"-gedeelte. Het draait altijd. Denk hierbij aan de basisopleiding en de kerninstincten van de detective. Het is snel en lichtgewicht.
  • Het Verfijningspad (De Extra Hulp): Dit is het "optionele" gedeelte. Het is alsof je een specialist of een vergrootglas inschakelt. Het draait alleen als je extra tijd en rekenkracht hebt.

De Magische Truc:
Vanwege de manier waarop ze het hebben gebouwd, kun je deze paden mixen en matchen.

  • Maximale snelheid nodig? Laat alleen het "Essentiële Pad" door het hele netwerk lopen.
  • Maximale nauwkeurigheid nodig? Laat het "Essentiële Pad" plus alle "Verfijningspaden" lopen.
  • Iets tussendoor nodig? Zet het verfijningspad alleen aan voor de eerste helft van het netwerk.

Het beste deel? Het is allemaal één enkel model. Je hoeft het niet opnieuw te trainen of bestanden te wisselen. Je schakelt op het moment van gebruik gewoon een knop om om te beslissen hoe "diep" (hoeveel lagen) het netwerk denkt.

3. De Trainingsuitdaging: Het Team Leren Om Te Akkoord Gaan

Je zou kunnen denken: "Als ik een team train om in twee verschillende modi te werken (snel versus langzaam), raken ze misschien in de war."

  • Als de "Snelle Modus" leert een detail te negeren, maar de "Langzame Modus" dat detail nodig heeft, krijgen de gewichten (het brein van de AI) tegenstrijdige instructies.
  • Het artikel lost dit op met een techniek die Zelf-Distillatie heet.

De Analogie:
Stel je een meesterkok (de "Super-Net") en een leerlingkok (de "Base-Net") voor die in dezelfde keuken werken.

  1. De Meesterkok bereidt het volledige, complexe gerecht (met alle paden).
  2. De Leerling bereidt de simpele versie (alleen met essentiële paden).
  3. De Meesterkok proeft niet alleen het eten; hij onderwijst de Leerling. Hij zegt: "Hé, als je de garnering overslaat, zorg er dan voor dat de basis smaak nog steeds smaakt naar mijn gerecht, alleen eenvoudiger."

Ze gebruiken een speciale trainingsmethode waarbij de "Meester" en de "Leerling" voortdurend elkaars werk controleren om ervoor te zorgen dat, zelfs als de Leerling stappen overslaat, het eindresultaat nog steeds compatibel is met wat de Meester zou hebben geproduceerd. Dit zorgt ervoor dat het netwerk niet kapot gaat, ongeacht welke "diepte" je later kiest.

4. De Resultaten: Eén Model Om Ze Allemaal Te Regeeren

De auteurs hebben dit getest op twee beroemde AI-modellen (RT-DETR en YOLOv12).

  • De Volledige Versie: Toen ze het volledige netwerk draaiden, was het net zo goed als de beste bestaande modellen.
  • De Snelle Versie: Toen ze de extra verfijningspaden uitschakelden, werd het model 1,8 keer sneller (bijna dubbel zo snel) terwijl het slechts een klein beetje nauwkeurigheid verloor (ongeveer 2 punten op een standaard schaal).

Waarom Dit Belangrijk Is

Denk hierbij aan een slimme fotocamera.

  • By 's ochtends heb je misschien gewoon een snelle foto nodig (met het "Essentiële Pad" voor snelheid).
  • 's Avonds heb je misschien een hoogwaardige, gedetailleerde foto nodig (met het "Volledige Pad" voor nauwkeurigheid).

In plaats van twee verschillende camera's in je telefoon te hebben, staat deze technologie één enkele camera toe om direct van modus te wisselen afhankelijk van het licht en je behoeften, zonder dat je een nieuwe app hoeft te downloaden of de software hoeft bij te werken. Het bespaart ruimte, bespaart geld en maakt AI veel flexibeler voor gebruik in de echte wereld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →