← Ultimi articoli
🤖 AI

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

Ultralytics YOLO26 introduce una famiglia unificata di modelli di visione end-to-end in tempo reale che elimina la non-maximum suppression e la Distribution Focal Loss attraverso un'architettura a doppia testa e strategie di addestramento avanzate, raggiungendo prestazioni state-of-the-art tra accuratezza e latenza in molteplici task, inclusi rilevamento, segmentazione, stima della posa e inferenza open-vocabulary.

Autori originali: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

Pubblicato 2026-06-03
📖 5 min di lettura🧠 Approfondimento

Autori originali: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere una guardia giurata super veloce il cui compito è individuare oggetti in un flusso video in tempo reale. Per anni, le migliori guardie (chiamate modelli "YOLO") sono state brave, ma avevano alcune abitudini fastidiose: avevano bisogno di un passaggio di "doppio controllo" lento dopo aver individuato qualcosa, portavano con sé zaini pesanti di dati extra che le rallentavano e spesso perdevano oggetti minuscoli o lontani perché le loro regole di addestramento erano troppo rigide.

Il documento presenta YOLO26, una nuova generazione di queste guardie visive progettate per essere più veloci, leggere e precise come mai prima d'ora. Ecco come hanno risolto i vecchi problemi, spiegati con analogie quotidiane:

1. La regola del "Niente Doppio Controllo" (Inferenza NMS-Free)

Il Vecchio Problema: In precedenza, quando una guardia individuava un'auto, poteva vederla tre o quattro volte in punti leggermente diversi. Doveva fermarsi ed eseguire un processo di "Non-Maximum Suppression" (NMS)—un doppio controllo manuale e lento—per scegliere un solo tentativo migliore e scartare i duplicati. Questo richiedeva tempo.
La Soluzione di YOLO26: YOLO26 utilizza un design a doppia testa (dual-head). Immagina di avere due lavoratori specializzati:

  • Lavoratore A (Lo Speedster): Questo lavoratore è addestrato a scegliere esattamente un tentativo perfetto per ogni oggetto immediatamente. Nessun doppio controllo necessario. È come un cecchino che colpisce il bersaglio al primo colpo.
  • Lavoratore B (Il Maximizer): Questo lavoratore continua a guardare tutto e può essere utilizzato se serve la massima accuratezza assoluta e non ci si dispiace per il tempo extra del "doppio controllo".
    Il Risultato: Ottieni un sistema che è "end-to-end", il che significa che passa direttamente dal vedere l'immagine al fornire la risposta senza fermarsi per un secondo parere.

2. Gettare lo Zaino Pesante (Rimozione di DFL)

Il Vecchio Problema: I modelli recenti portavano un pesante zaino chiamato "Distribution Focal Loss" (DFL). Questo zaino cercava di prevedere la dimensione di un oggetto indovinando da una lista di 16 diverse possibilità per ogni singolo bordo. Questo rendeva il modello pesante (più memoria) e lento, specialmente per i modelli piccoli. Inoltre, aveva un limite di "dimensione massima"; se un oggetto era troppo grande per la lista, il modello andava in confusione.
La Soluzione di YOLO26: Hanno buttato via lo zaino. Invece di indovinare da una lista, il modello ora misura direttamente la dimensione, proprio come usare un righello invece di indovinare da un menu.
Il Risultato: Il modello è più leggero, più veloce e può ora misurare accuratamente oggetti molto grandi senza incontrare un "tetto" massimo di dimensione.

3. La Rete di Sicurezza per gli "Oggetti Minuscoli" (STAL)

Il Vecchio Problema: Le vecchie regole di addestramento erano come un gioco di "nascondino" dove le regole dicevano: "Puoi nasconderti solo dentro una scatola che rientra in una griglia specifica". Se un oggetto minuscolo (come un uccello lontano) era più piccolo dei quadrati della griglia, la guardia semplicemente non riusciva a vederlo. Riceveva zero attenzione e veniva ignorato durante l'addestramento.
La Soluzione di YOLO26: Hanno introdotto STAL (Small-Target-Aware Label Assignment). Immagina che alla guardia venga data una lente d'ingrandimento speciale per le cose piccole. Anche se un oggetto minuscolo non rientra nella griglia standard, il sistema costringe la guardia a prestare attenzione a esso "allungando" temporaneamente la griglia solo quanto basta per coprirlo.
Il Risultato: Il modello non ignora più gli oggetti più piccoli e difficili da vedere.

4. Il "Coach Intelligente" (MuSGD & Progressive Loss)

Il Vecchio Problema: L'addestramento di questi modelli era simile a una maratona in cui l'allenatore urlava le stesse istruzioni per l'intera corsa di 600 miglia. Ci voleva molto tempo per diventare bravi. Inoltre, il coach trattava il lavoratore "Speedster" e il lavoratore "Maximizer" esattamente allo stesso modo, anche se avevano lavori diversi.
La Soluzione di YOLO26:

  • MuSGD (Il Coach Intelligente): Hanno sostituito il vecchio metodo di addestramento con un nuovo ottimizzatore (MuSGD) che impara più velocemente, come un coach che sa esattamente come scandire il passo del corridore per finire in meno miglia (meno epoche di addestramento).
  • Progressive Loss (Il Curriculum): Hanno cambiato il programma di addestramento. All'inizio, si concentrano sul lavoratore "Maximizer" per costruire una base solida. Man mano che l'addestramento procede, spostano gradualmente l'attenzione sul lavoratore "Speedster", assicurando che il prodotto finale sia perfettamente tarato per l'inferenza veloce e senza controlli.

5. Competenze Specializzate per Diversi Lavori

Solo perché una guardia è veloce a individuare auto, non significa che sia brava in tutto. YOLO26 aggiunge strumenti specializzati per altri compiti:

  • Ritagliare le forme (Segmentation): Hanno aggiunto un sistema multi-scala che aiuta la guardia a capire meglio lo sfondo, rendendo più facile tracciare il contorno esatto di un oggetto.
  • Tracciare le persone (Pose Estimation): Hanno aggiunto un modo per indovinare quanto la guardia sia "incerta" su un'articolazione (come un gomito). Se il gomito è nascosto, il modello ammette di non essere sicuro invece di indovinare a caso.
  • Oggetti ruotati (OBB): Per cose come navi o aerei che non sono sempre dritti in verticale, hanno sistemato la matematica in modo che il modello non si confonda quando un oggetto è inclinato.

6. L'Upgrade "Open Vocabulary" (YOLOE-26)

Infine, hanno introdotto YOLOE-26, che è come dare alla guardia un traduttore universale.

  • Text Prompting: Puoi dire alla guardia: "Cerca un idrante rosso", e lei lo troverà, anche se non è stata esplicitamente addestrata sugli idranti.
  • Visual Prompting: Puoi mostrare alla guardia l'immagine di un giocattolo specifico e lei troverà quel giocattolo nel video.
  • No Prompt: Può anche semplicemente guardarsi intorno e descrivere ciò che vede autonomamente.

In Sintesi

YOLO26 è una famiglia unificata di modelli che sono più veloci, più leggeri e più accurati rispetto ai loro predecessori. Ci riescono eliminando i bagagli inutili, correggendo le regole per individuare le cose minuscole e usando un coach di addestramento più intelligente. Che tu abbia bisogno della velocità assoluta (il percorso NMS-free) o della massima accuratezza possibile (il percorso NMS), YOLO26 offre una versione che si posiziona proprio in cima alla classifica di "velocità vs accuratezza".

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →