← नवीनतम पेपर
🤖 AI

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

अल्ट्रालाइटिक्स YOLO26 रीयल-टाइम एंड-टू-एंड विजन मॉडल्स का एक एकीकृत परिवार पेश करता है जो डुअल-हेड आर्किटेक्चर और उन्नत प्रशिक्षण रणनीतियों के माध्यम से नॉन-मैक्सिमम सुप्रेसिव और डिस्ट्रीब्यूशन फोकल लॉस को समाप्त करता है, जिससे डिटेक्शन, सेगमेंटेशन, पोज़ एस्टीमेशन और ओपन-वोकैबुलरी इन्फरेंस सहित कई कार्यों में अत्याधुनिक सटीकता-विलंबता प्रदर्शन प्राप्त होता है।

मूल लेखक: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

प्रकाशित 2026-06-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-फास्ट सुरक्षा गार्ड है जिसका काम वीडियो स्ट्रीम में वस्तुओं को वास्तविक समय (real-time) में पहचानना है। वर्षों से, सबसे अच्छे गार्ड (जिन्हें "YOLO" मॉडल कहा जाता है) बेहतरीन रहे हैं, लेकिन उनकी कुछ परेशान करने वाली आदतें थीं: उन्हें कुछ देखने के बाद एक धीमा "दोबारा जांचने" वाला चरण (double-check step) अपनाना पड़ता था, वे अतिरिक्त डेटा के भारी बैकपैक लेकर चलते थे जिससे उनकी गति धीमी हो जाती थी, और वे अक्सर बहुत सख्त प्रशिक्षण नियमों के कारण छोटी और दूर की वस्तुओं को मिस कर देते थे।

यह पेपर YOLO26 पेश करता है, जो इन विजन गार्ड्स की एक नई पीढ़ी है जिसे पहले से कहीं अधिक तेज़, हल्का और सटीक बनाया गया है। उन्होंने पुराने समस्याओं को कैसे ठीक किया, इसका विवरण रोजमर्रा के उदाहरणों के साथ यहाँ दिया गया है:

1. "नो-डबल-चेक" नियम (NMS-Free Inference)

पुरानी समस्या: पहले, जब एक गार्ड कार को देखता था, तो वह उसे थोड़े अलग स्थानों पर तीन या चार बार देख सकता था। उन्हें केवल एक सबसे अच्छा अनुमान चुनने और डुप्लिकेट को हटाने के लिए एक "नॉन-मैक्सिमम सप्रेशन" (NMS) प्रक्रिया—एक धीमी, मैनुअल दोबारा जांच—पर रुकना पड़ता था। इसमें समय लगता था।
YOLO26 का समाधान: YOLO26 एक डुअल-हेड डिज़ाइन का उपयोग करता है। इसे दो विशिष्ट श्रमिकों के रूप में सोचें:

  • श्रमिक A (द स्पीडस्टर): इस श्रमिक को हर वस्तु के लिए तुरंत ठीक एक सटीक अनुमान लगाने के लिए प्रशिक्षित किया गया है। दोबारा जांच की आवश्यकता नहीं है। यह एक स्नाइपर की तरह है जो पहली बार में ही लक्ष्य को भेद देता है।
  • श्रमिक B (द मैक्सिमाइज़र): यह श्रमिक अभी भी सब कुछ देखता है और इसका उपयोग तब किया जा सकता है जब आपको उच्चतम सटीकता की आवश्यकता हो और आप अतिरिक्त "दोबारा जांच" के समय से समझौता न करना चाहें।
    परिणाम: आपको एक ऐसा सिस्टम मिलता है जो "एंड-टू-एंड" है, जिसका अर्थ है कि यह बिना किसी दूसरे विचार के लिए रुके, सीधे छवि देखने से उत्तर देने तक जाता है।

2. भारी बैकपैक को हटाना (Removing DFL)

पुरानी समस्या: हाल के मॉडल एक भारी "डिस्ट्रीब्यूशन फोकल लॉस" (DFL) बैकपैक लेकर चलते थे। यह बैकपैक हर किनारे के लिए 16 अलग-अलग संभावनाओं की सूची से अनुमान लगाकर वस्तु के आकार का अनुमान लगाने की कोशिश करता था। इसने मॉडल को भारी (अधिक मेमोरी) और धीमा बना दिया, विशेष रूप से छोटे मॉडलों के लिए। इसमें एक "अधिकतम आकार" की सीमा भी थी; यदि कोई वस्तु सूची के लिए बहुत बड़ी होती थी, तो मॉडल भ्रमित हो जाता था।
YOLO26 का समाधान: उन्होंने वह बैकपैक फेंक दिया। एक सूची से अनुमान लगाने के बजाय, मॉडल अब सीधे एक स्केल (रूलर) की तरह आकार को सीधे मापता है।
परिणाम: मॉडल हल्का, तेज़ है, और अब बिना किसी "सीलिंग" (सीमा) के बहुत बड़ी वस्तुओं को भी सटीक रूप से माप सकता है।

3. "छोटा ऑब्जेक्ट" सेफ्टी नेट (STAL)

पुरानी समस्या: पुराने प्रशिक्षण नियम "लुका-छिपी" के खेल की तरह थे जहाँ नियमों ने कहा था, "आप केवल एक ऐसे बॉक्स के अंदर छिप सकते हैं जो एक विशिष्ट ग्रिड में फिट बैठता हो।" यदि कोई छोटी वस्तु (जैसे दूर का पक्षी) ग्रिड के वर्गों से छोटी थी, तो गार्ड उसे देख ही नहीं पाता था। उसे शून्य ध्यान मिलता था और प्रशिक्षण के दौरान उसे अनदेखा कर दिया जाता था।
YOLO26 का समाधान: उन्होंने STAL (स्मॉल-टारगेट-अवेयर लेबल असाइनमेंट) पेश किया। कल्पना करें कि गार्ड को छोटी चीजों के लिए एक विशेष आवर्धक लेंस (magnifying glass) दिया गया है। भले ही एक छोटी वस्तु मानक ग्रिड में फिट न हो, सिस्टम ग्रिड को अस्थायी रूप रूप से इतना "खींचकर" (stretch) गार्ड को उस पर ध्यान देने के लिए मजबूर करता है कि वह उसे कवर कर सके।
परिणाम: मॉडल अब सबसे छोटी, कठिन वस्तुओं को अनदेखा नहीं करता है।

4. "स्मार्ट कोच" (MuSGD & Progressive Loss)

पुरानी समस्या: इन मॉडलों का प्रशिक्षण पहले एक मैराथन की तरह था जहाँ कोच पूरे 600 मील की दौड़ के दौरान एक ही निर्देश चिल्लाता रहता था। अच्छा होने में बहुत समय लगता था। साथ भी, कोच ने "स्पीडस्टर" कार्यकर्ता और "मैक्सिमाइज़र" कार्यकर्ता के साथ बिल्कुल एक जैसा व्यवहार किया, भले ही उनके काम अलग थे।
YOLO26 का समाधान:

  • MuSGD (द स्मार्ट कोच): उन्होंने पुराने प्रशिक्षण पद्धति को एक नए ऑप्टिमाइज़र (MuSGD) से बदल दिया जो तेज़ी से सीखता है, जैसे एक ऐसा कोच जो धावक को कम मील (कम ट्रेनिंग एपोच) में खत्म करने के लिए सही गति से चलाने को जानता हो।
  • प्रोग्रेसिव लॉस (द करिकुलम): उन्होंने प्रशिक्षण कार्यक्रम को बदल दिया। शुरुआत में, वे एक मजबूत नींव बनाने के लिए "मैक्सिमाइज़र" कार्यकर्ता पर ध्यान केंद्रित करते हैं। जैसे-जैसे प्रशिक्षण आगे बढ़ता है, वे धीरे-धीरे "स्पीडस्टर" कार्यकर्ता पर ध्यान केंद्रित करना शुरू करते हैं, यह सुनिश्चित करते हुए कि अंतिम उत्पाद तेज़, नो-चेक इन्फरेंस के लिए पूरी तरह से ट्यून किया गया है।

5. विभिन्न कार्यों के लिए विशेष कौशल

सिर्फ इसलिए कि गार्ड कारों को पहचानने में तेज़ है, इसका मतलब यह नहीं है कि वह सब कुछ करने में अच्छा है। YOLO26 अन्य कार्यों के लिए विशेष उपकरण जोड़ता है:

  • आकार काटना (सेगमेंटेशन): उन्होंने एक मल्टी-स्केल सिस्टम जोड़ा है जो गार्ड को बैकग्राउंड को बेहतर ढंग से समझने में मदद करता है, जिससे किसी वस्तु की सटीक रूपरेखा बनाना आसान हो जाता है।
  • लोगों को ट्रैक करना (पोज़ एस्टीमेशन): उन्होंने यह अनुमान लगाने का एक तरीका जोड़ा है कि गार्ड एक जोड़ (जैसे कोहनी) के बारे में कितना "अनिश्चित" है। यदि कोहनी छिपी हुई है, तो मॉडल बेतरतीब ढंग से अनुमान लगाने के बजाय यह स्वीकार करता है कि वह अनिश्चित है।
  • घूमती हुई वस्तुएं (OBB): उन चीजों के लिए जो हमेशा सीधे ऊपर-नीचे नहीं होतीं (जैसे जहाज या विमान), उन्होंने गणित को ठीक किया ताकि मॉडल टेढ़ी वस्तु होने पर भ्रमित न हो।

6. "ओपन वोकैबुलरी" अपग्रेड (YOLOE-26)

अंत में, उन्होंने YOLOE-26 पेश किया है, जो एक यूनिवर्सल ट्रांसलेटर देने जैसा है।

  • टेक्स्ट प्रॉम्प्टिंग: आप गार्ड को कह सकते हैं, "मेरे लिए एक लाल फायर हाइड्रेंट ढूँढो," और वह उसे ढूँढ लेगा, भले ही उसे स्पष्ट रूप से फायर हाइड्रेंट पर प्रशिक्षित न किया गया हो।
  • विजुअल प्रॉम्प्टिंग: आप गार्ड को एक विशिष्ट खिलौने की तस्वीर दिखा सकते हैं, और वह वीडियो में उस खिलौने को ढूँढ लेगा।
  • नो प्रॉम्प्ट: यह बस अपने आप देख सकता है और जो वह देखता है उसका वर्णन कर सकता है।

निचोड़ (The Bottom Line)

YOLO26 मॉडल्स का एक एकीकृत परिवार है जो अपने पूर्ववर्तियों की तुलना में तेज़, हल्के और अधिक सटीक हैं। वे अनावश्यक बोझ को हटाकर, छोटी चीजों को पहचानने के नियमों को ठीक करके, और एक स्मार्ट ट्रेनिंग कोच का उपयोग करके यह हासिल करते हैं। चाहे आपको पूर्ण गति (NMS-free पथ) की आवश्यकता हो या उच्चतम सटीकता (NMS पथ) की, YOLO26 एक ऐसा संस्करण प्रदान करता है जो "गति बनाम सटीकता" के चार्ट में सबसे ऊपर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →