← Derniers articles
🤖 AI

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

Ultralytics YOLO26 introduit une famille unifiée de modèles de vision en temps réel de bout en bout qui élimine la suppression des non-maxima et la perte focale de distribution grâce à une architecture à double tête et des stratégies d'entraînement avancées, atteignant des performances de pointe en termes de précision-latence sur de multiples tâches, incluant la détection, la segmentation, l'estimation de pose et l'inférence à vocabulaire ouvert.

Auteurs originaux : Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

Publié 2026-06-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un garde de sécurité super rapide dont le travail est de repérer des objets dans un flux vidéo en temps réel. Pendant des années, les meilleurs gardes (appelés modèles « YOLO ») ont été excellents, mais ils avaient quelques habitudes agaçantes : ils avaient besoin d'une étape de « double vérification » lente après avoir repéré quelque chose, ils transportaient des sacs à dos lourds de données supplémentaires qui les ralentissaient, et ils manquaient souvent de petits objets lointains parce que leurs règles d'entraînement étaient trop strictes.

Le papier présente YOLO26, une nouvelle génération de ces gardes de vision conçus pour être plus rapides, plus légers et plus affûtés que jamais. Voici comment ils ont résolu les anciens problèmes, expliqués avec des analogies de la vie quotidienne :

1. La règle du « Pas de double vérification » (Inférence sans NMS)

L'ancien problème : Auparavant, lorsqu'un garde repérait une voiture, il pouvait la voir trois ou quatre fois à des endroits légèrement différents. Il devait alors s'arrêter et effectuer un processus de « Suppression des non-maxima » (NMS) — une double vérification manuelle et lente — pour choisir la meilleure estimation et jeter les doublons. Cela prenait du temps.
La correction de YOLO26 : YOLO26 utilise une conception à double tête (dual-head). Imaginez que vous avez deux travailleurs spécialisés :

  • Le Travailleur A (Le Rapide) : Ce travailleur est entraîné pour choisir immédiatement une seule estimation parfaite pour chaque objet. Pas de double vérification nécessaire. C'est comme un tireur d'élite qui atteint la cible du premier coup.
  • Le Travailleur B (Le Maximiseur) : Ce travailleur continue de tout regarder et peut être utilisé si vous avez besoin de la précision absolue et que vous ne vous souciez pas du temps de « double vérification » supplémentaire.
    Le résultat : Vous obtenez un système qui est « de bout en bout », ce qui signifie qu'il passe directement de la vision de l'image à la réponse sans s'arrêter pour un deuxième avis.

2. Jeter le sac à dos lourd (Suppression du DFL)

L'ancien problème : Les modèles récents transportaient un sac à dos lourd appelé « Distribution Focal Loss » (DFL). Ce sac à dos essayait de prédire la taille d'un objet en devinant à partir d'une liste de 16 possibilités différentes pour chaque bord. Cela rendait le modèle lourd (plus de mémoire) et lent, surtout pour les petits modèles. Il y avait également une limite de « taille maximale » ; si un objet était trop grand pour la liste, le modèle devenait confus.
La correction de YOLO26 : Ils ont jeté le sac à dos. Au lieu de deviner à partir d'une liste, le modèle mesure directement la taille, comme en utilisant une règle plutôt qu'en choisissant dans un menu.
Le résultat : Le modèle est plus léger, plus rapide, et peut désormais mesurer avec précision des objets très grands sans heurter de « plafond » sur leur taille.

3. Le filet de sécurité pour les « Objets minuscules » (STAL)

L'ancien problème : Les anciennes règles d'entraînement étaient comme un jeu de « cache-cache » où les règles disaient : « Tu ne peux te cacher que dans une boîte qui correspond à une grille spécifique. » Si un objet minuscule (comme un oiseau lointain) était plus petit que les carrés de la grille, le garde ne pouvait tout simplement pas le voir. Il ne recevait aucune attention et était ignoré pendant l'entraînement.
La correction de YOLO26 : Ils ont introduit le STAL (Small-Target-Aware Label Assignment). Imaginez que le garde reçoive une loupe spéciale pour les choses minuscules. Même si un objet minuscule ne rentre pas dans la grille standard, le système force le garde à prêter attention à lui en « étirant » temporairement la grille juste assez pour le couvrir.
Le résultat : Le modèle n'ignore plus les objets les plus petits et les plus difficiles à voir.

4. Le « Coach Intelligent » (MuSGD & Perte Progressive)

L'ancien problème : L'entraînement de ces modèles ressemblait autrefois à un marathon où le coach criait les mêmes instructions pendant toute la course de 600 miles. Cela prenait beaucoup de temps pour devenir bon. De plus, le coach traitait le travailleur « Rapide » et le travailleur « Maximiseur » exactement de la même manière, même s'ils avaient des tâches différentes.
La correction de YOLO26 :

  • MuSGD (Le Coach Intelligent) : Ils ont remplacé l'ancienne méthode d'entraînement par un nouvel optimiseur (MuSGD) qui apprend plus vite, comme un coach qui sait exactement comment cadencer le coureur pour qu'il termine en moins de miles (moins d'époques d'entraînement).
  • Perte Progressive (Le Curriculum) : Ils ont changé le programme d'entraînement. Au début, ils se concentrent sur le travailleur « Maximiseur » pour construire une base solide. Au fil de l'entraînement, ils basculent progressivement l'attention vers le travailleur « Rapide », garantissant que le produit final est parfaitement réglé pour une inférence rapide sans vérification.

5. Des compétences spécialisées pour différents travaux

Le fait qu'un garde soit rapide pour repérer des voitures ne signifie pas qu'il est bon en tout. YOLO26 ajoute des outils spécialisés pour d'autres tâches :

  • Découper des formes (Segmentation) : Ils ont ajouté un système multi-échelle qui aide le garde à mieux comprendre l'arrière-plan, ce qui facilite le traçage du contour exact d'un objet.
  • Suivre les personnes (Estimation de pose) : Ils ont ajouté un moyen de deviner à quel point le garde est « incertain » concernant une articulation (comme un coude). Si le coude est caché, le modèle admet qu'il n'est pas sûr plutôt que de deviner n'importe quoi.
  • Objets pivotés (OBB) : Pour les objets comme les navires ou les avions qui ne sont pas toujours droits, ils ont corrigé les mathématiques pour que le modèle ne soit pas confus lorsqu'un objet est incliné.

6. La mise à niveau « Vocabulaire Ouvert » (YOLOE-26)

Enfin, ils ont introduit YOLOE-26, qui est comme donner au garde un traducteur universel.

  • Prompt Textuel : Vous pouvez dire au garde : « Trouve-moi une borne d'incendie rouge », et il la trouvera, même s'il n'a jamais été explicitement entraîné sur les bornes d'incendie.
  • Prompt Visuel : Vous pouvez montrer au garde l'image d'un jouet spécifique, et il trouvera ce jouet dans la vidéo.
  • Sans Prompt : Il peut aussi simplement regarder autour de lui et décrire ce qu'il voit de lui-même.

L'essentiel

YOLO26 est une famille unifiée de modèles qui sont plus rapides, plus légers et plus précis que leurs prédécesseurs. Ils y parviennent en supprimant les bagages inutiles, en corrigeant les règles pour repérer les petites choses et en utilisant un coach d'entraînement plus intelligent. Que vous ayez besoin de la vitesse absolue (la voie sans NMS) ou de la précision la plus élevée (la voie avec NMS), YOLO26 propose une version qui se situe tout en haut du graphique « vitesse vs précision ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →