← Nieuwste papers
🤖 AI

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

Ultralytics YOLO26 introduceert een verenigde familie van real-time end-to-end visiemodellen die non-maximum suppression en Distribution Focal Loss elimineert door middel van een dual-head architectuur en geavanceerde trainingsstrategieën, waarmee een state-of-the-art nauwkeurigheid-latentie prestatie wordt bereikt over meerdere taken, waaronder detectie, segmentatie, pose schatting en open-vocabulary inferentie.

Oorspronkelijke auteurs: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

Gepubliceerd 2026-06-03
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een supersnelle beveiligingsbeambte hebt wiens taak het is om objecten in een videostream in real-time te spotten. Jarenlang waren de beste bewakers (genaamd "YOLO"-modellen) geweldig, maar ze hadden een paar irritante gewoontes: ze hadden een trage "dubbelcheck"-stap nodig nadat ze iets hadden gespot, ze droegen zware rugzakken met extra data die hen vertraagden, en ze misten vaak kleine, verre objecten omdat hun trainingsregels te streng waren.

Het paper introduceert YOLO26, een nieuwe generatie van deze visuele bewakers die ontworpen zijn om sneller, lichter en scherper dan ooit tevoren te zijn. Hier is hoe ze de oude problemen hebben opgelost, uitgelegd met alledaagse analogieën:

1. De "Geen-Dubbelcheck"-regel (NMS-vrije inferentie)

Het Oude Probleem: Voorheen, wanneer een bewaker een auto zag, zag hij die misschien drie of vier keer op iets andere plekken. De bewaker moest dan stoppen en een "Non-Maximum Suppression" (NMS)-proces uitvoeren—een trage, handmatige dubbelcheck—om slechts één beste gok te kiezen en de duplicaten weg te gooien. Dit kostte tijd.
De YOLO26 Fix: YOLO26 gebruikt een dual-head design. Denk aan het hebben van twee gespecialiseerde werkers:

  • Werker A (De Speedster): Deze werker is getraind om onmiddellijk precies één perfecte gok te maken voor elk object. Geen dubbelcheck nodig. Het is als een scherpschutter die bij de eerste poging het doel raakt.
  • Werker B (De Maximizer): Deze werker kijkt nog steeds naar alles en kan worden gebruikt als je de absolute hoogste nauwkeurigheid nodig hebt en het niet erg vindt om de extra "dubbelcheck"-tijd te nemen.
    Het Resultaat: Je krijgt een systeem dat "end-to-end" is, wat betekent dat het direct van het zien van de afbeelding naar het geven van het antwoord gaat zonder te stoppen voor een tweede mening.

2. De Zware Rugzak Weggooien (Verwijderen van DFL)

Het Oude Probleem: Recente modellen droegen een zware "Distribution Focal Loss" (DFL)-rugzak. Deze rugzak probeerde de grootte van een object te voorspellen door te gokken uit een lijst van 16 verschillende mogelijkheden voor elke afzonderlijke rand. Dit maakte het model zwaar (meer geheugen) en traag, vooral voor kleine modellen. Het had ook een "maximale grootte"-limiet; als een object te groot was voor de lijst, raakte het model in de war.
De YOLO26 Fix: Ze hebben de rugzak weggegooid. In plaats van te gokken vanuit een lijst, meet het model nu direct de grootte, zoals het gebruik van een liniaal in plaats van gokken vanuit een menu.
Het Resultaat: Het model is lichter, sneller en kan nu zeer grote objecten nauwkeurig meten zonder tegen een "plafond" aan te lopen.

3. Het "Kleine Objecten" Veiligheidsnet (STAL)

Het Oude Probleem: De oude trainingsregels waren als een spelletje "verstoppertje" waarbij de regels zeiden: "Je mag alleen verstoppen binnen een doos die in een specifiek rooster past." Als een klein object (zoals een verre vogel) kleiner was dan de roosterblokken, kon de bewaker het simpelweg niet zien. Het kreeg nul aandacht en werd genegeerd tijdens de training.
De YOLO26 Fix: Ze hebben STAL geïntroduceerd (Small-Target-Aware Label Assignment). Stel je voor dat de bewaker een speciale loep krijgt voor kleine dingen. Zelfs als een klein object niet in het standaard rooster past, dwingt het systeem de bewaker om er aandacht aan te besteden door het rooster tijdelijk net genoeg te "rekken" om het te dekken.
Het Resultaat: Het model negeert de kleinste, moeilijkst te zien objecten niet langer.

4. De "Slimme Coach" (MuSGD & Progressieve Loss)

Het Oude Probleem: Het trainen van deze modellen was vroeger als een marathon waarbij de coach de hele 600 mijl lange race lang dezelfde instructies schreeuwde. Het duurde lang om goed te worden. Ook behandelde de coach de "Speedster"-werker en de "Maximizer"-werker precies hetzelfde, ook al hadden ze verschillende taken.
De YOLO26 Fix:

  • MuSGD (De Slimme Coach): Ze hebben de oude trainingsmethode vervangen door een nieuwe optimizer (MuSGD) die sneller leert, zoals een coach die precies weet hoe hij de hardloper moet tempon om in minder mijlen (minder trainings-epochs) te finishen.
  • Progressive Loss (Het Curriculum): Ze hebben het trainingsschema aangepast. Aan het begin richten ze zich op de "Maximizer"-werker om een sterke basis te leggen. Naarmate de training vordert, verschuiven ze de focus geleidelijk naar de "Speedster"-werker, zodat het eindproduct perfect is afgestemd op de snelle, zonder-check inferentie.

5. Gespecialiseerde Vaardigheden voor Verschillende Taken

Alleen omdat de bewaker snel auto's spot, betekent niet dat hij in alles goed is. YOLO26 voegt gespecialiseerde tools toe voor andere taken:

  • Vormen uit snijden (Segmentatie): Ze hebben een multi-scale systeem toegevoegd dat de bewaker helpt de achtergrond beter te begrijpen, waardoor het makkelijker wordt om de exacte contouren van een object te traceren.
  • Mensen volgen (Pose Estimation): Ze hebben een manier toegevoegd om te raden hoe "onzeker" de bewaker is over een gewricht (zoals een elleboog). Als de elleboog verborgen is, geeft het model toe dat het onzeker is in plaats van wild te gokken.
  • Gedraaide objecten (OBB): Voor dingen zoals schepen of vliegtuigen die niet altijd recht omhoog staan, hebben ze de wiskunde gecorrigeerd zodat het model niet in de war raakt wanneer een object gekanteld is.

6. De "Open Vocabulaire" Upgrade (YOLOE-26)

Ten slotte hebben ze YOLOE-26 geïntroduceerd, wat is als het geven van een universele vertaler aan de bewaker.

  • Tekst Prompting: Je kunt de bewaker vertellen: "Zoek een rode brandkraan," en hij zal er een vinden, zelfs als hij nooit expliciet op brandkranen is getraind.
  • Visuele Prompting: Je kunt de bewager een foto van een specifiek speeltje laten zien, en hij zal dat speeltje in de video vinden.
  • Geen Prompt: Hij kan ook gewoon rondkijken en beschrijven wat hij ziet op eigen houtje.

De Kern van het Verhaal

YOLO26 is een verenigde familie van modellen die sneller, lichter en nauwkeuriger zijn dan hun voorgangers. Ze bereiken dit door onnodige bagage te verwijderen, de regels voor het spotten van kleine dingen te herstellen en een slimmere trainingscoach te gebruiken. Of je nu de absolute snelheid nodig hebt (het NMS-vrije pad) of de hoogst mogelijke nauwkeurigheid (het NMS-pad), YOLO26 biedt een versie die helemaal bovenaan de "snelheid versus nauwkeurigheid"-grafiek staat.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →