← नवीनतम पेपर
💻 computer science

Cross-Generation Optimization of YOLOv26, YOLOv11, and YOLOv8 for Fine-Grained Small-Object Detection and Instance Segmentation in Complex Orchards

यह अध्ययन विभिन्न पैमानों और रिज़ॉल्यूशन के माध्यम से Ultralytics YOLOv8, YOLOv11, और YOLOv26 का बेंचमार्किंग करता है ताकि यह पहचान की जा सके कि उच्च-रिज़ॉल्यूशन इनपुट (विशेष रूप से YOLOv11s-960 और YOLOv26s-960) पर प्रशिक्षित कॉम्पैक्ट मॉडल, जटिल बाग (orchard) परिवेशों में सूक्ष्म-वस्तु पहचान (fine-grained small-object detection) और इंस्टेंस सेगमेंटेशन के लिए सबसे प्रभावी सटीकता-दक्षता संतुलन प्रदान करते हैं।

मूल लेखक: Ranjan Sapkota, Manoj Karkee

प्रकाशित 2026-08-26
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ranjan Sapkota, Manoj Karkee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक वाणिज्यिक सेब के बाग की शांत, धूप से सराबोर पंक्तियों में, भविष्य की मशीनों के लिए एक सूक्ष्म लेकिन कठिन चुनौती प्रतीक्षा कर रही है। दशकों से, कंप्यूटर विज़न ने वस्तुओं को पहचानना सीख लिया है, जैसे कि ट्रैफ़िक में कारों या भीड़ में लोगों को उल्लेखनीय गति से ढूँढ लेना। लेकिन जब वे ही मशीनें गर्मियों की शुरुआत में एक छोटे सेब के पेड़ को देखती हैं, तो यह कार्य आश्चर्यजनक रूप से कठिन हो जाता है। फल बहुत छोटा होता है, अक्सर एक अंगूठे के नाखून से भी छोटा, और यह हरी पत्तियों, डंठलों और शाखाओं के घने, अराजक जाल के भीतर छिपा होता है जो लगभग फल के समान ही दिखते हैं। यह "हरे-पर-हरा" (green-on-green) वातावरण एक दृश्य पहेली बनाता है जहाँ लक्ष्य पृष्ठभूमि में सहजता से घुलमिल जाता है। इन पेड़ों की देखभाल करने वाले रोबोट बनाने के लिए—शायद अतिरिक्त फलों को कम करने के लिए ताकि बचे हुए फल बड़े और मीठे हो सकें—इंजीनियरों को केवल एक ऐसे कैमरे की आवश्यकता नहीं है जो फल को देख सके। उन्हें एक ऐसी प्रणाली की आवश्यकता है जो फल को थामे हुए नाजुक, धागे जैसी डंठल, उसके आधार पर स्थित छोटे प्याले और स्वयं फल के शरीर के बीच अंतर कर सके, भले ही वे आंशिक रूप से छिपे हों या स्क्रीन पर केवल कुछ पिक्सेल चौड़े हों।

यह वह विशिष्ट समस्या है जिसे कॉर्नेल यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने हल किया है, जिन्होंने यह परीक्षण करने के लिए कदम उठाया कि आधुनिक आर्टिफिशियल इंटेलिजेंस इन नन्हे, छिपे हुए विवरणों को कितनी अच्छी तरह संभालता है। उन्होंने AI के एक परिवार पर ध्यान केंद्रित किया जिसे YOLO के रूप में जाना जाता है, जो वास्तविक समय में वस्तुओं को पहचानने की अपनी क्षमता के लिए प्रसिद्ध है। टीम ने किसी नए प्रकार का AI का आविष्कार नहीं किया; इसके बजाय, उन्होंने सावधानीपूर्वक प्रयोगकर्ता के रूप में कार्य किया, इन मॉडलों की तीन अलग-अलग पीढ़ियों—स्थापित YOLOv8, नए YOLOv11, और बहुत हालिया YOLOv26—को लिया और उन्हें विभिन्न परिस्थितियों में परखा। वे दो बातें जानना चाहते थे: क्या एक बड़ा, अधिक जटिल AI मॉडल हमेशा इन छोटे लक्ष्यों के लिए बेहतर काम करता है, और क्या AI को एक स्पष्ट, उच्च-रिज़ॉल्यूशन वाली तस्वीर खिलाने से उसे वह देखने में मदद मिलती है जो वह अन्यथा चूक सकता था? यह जानने के लिए, उन्होंने वाशिंगटन राज्य के एक वास्तविक सेब के बाग से ली गई 600 छवियों के डेटासेट पर इन मॉडलों के तीस अलग-अलग संस्करणों को प्रशिक्षित किया, जहाँ फल अपने सबसे छोटे और सबसे कठिन रूप में था।

इस व्यापक परीक्षण के परिणामों ने यह खुलासा किया कि ये मशीनें कैसे देखती हैं, इसके बारे में एक प्रति-सहज (counterintuitive) सत्य सामने आया। लंबे समय से, इस क्षेत्र में यह धारणा रही है कि यदि आप बेहतर प्रदर्शन चाहते हैं, तो आपको बस एक बड़ा 'मस्तिष्क' चाहिए। AI की दुनिया में, इसका अर्थ है एक ऐसे मॉडल का उपयोग करना जिसमें अधिक परतें और अधिक पैरामीटर हों, जो अनिवार्य रूप से कंप्यूटर को छवि का विश्लेषण करने के लिए अधिक मेमोरी और प्रोसेसिंग पावर प्रदान करता है। शोधकर्ताओं ने इसकी तुलना करने के लिए मॉडलों के सबसे छोटे संस्करणों, जिन्हें "नैनो" (nano) कहा जाता है, बनाम विशाल "एक्स्ट्रा-लार्ज" (extra-large) संस्करणों का परीक्षण किया। उन्होंने पाया कि केवल मॉडल को बड़ा बनाने से बेहतर परिणाम सुनिश्चित नहीं होते हैं। वास्तव में, सबसे बड़े, अत्यधिक गणनात्मक रूप से भारी मॉडल अक्सर अपने बहुत छोटे, अधिक कुशल समकक्षों से बेहतर प्रदर्शन करने में विफल रहे। सबसे बड़े मॉडल कभी-कभी नन्ही डंठल को पूरी तरह से छोड़ देते थे या फल की सटीक सीमाओं को खींचने में संघर्ष करते थे, जबकि उनके पास कहीं अधिक कंप्यूटिंग शक्ति उपलब्ध थी।

इसके बजाय, इन छोटी वस्तुओं को स्पष्ट रूप से देखने की कुंजी इस बात में निहित थी कि प्रशिक्षण के दौरान छवियों को AI के सामने कैसे प्रस्तुत किया गया। शोधकर्ताओं ने दो दृष्टिकोणों की तुलना की: एक जहाँ छवियों को 640 x 640 पिक्सेल के मानक आकार में सिकोड़ दिया गया था, और दूसरा जहाँ छवियों को 960 x 960 पिक्सेल के उच्च रिज़ॉल्यूशन पर रखा गया था। जब छवियों को सिकोड़ा गया, तो नन्ही डंठल और छोटे फल के शरीर ने विवरण खो दिया, जिससे वे धुंधले हो गए या पृष्ठभूमि की पत्तियों के शोर में गायब हो गए। उच्च रिज़ॉल्यूशन बनाए रखकर, शोधकर्ताओं ने उन सूक्ष्म स्थानिक विवरणों को सुरक्षित रखा जिनकी AI को दृश्य को समझने के लिए आवश्यकता थी। इस उच्च-रिज़ॉल्यूशन वाले दृष्टिकोण ने लगातार मदद की, लेकिन इसने सभी मॉडलों की समान रूप से मदद नहीं की। सबसे महत्वपूर्ण सुधार मध्यम आकार के छोटे मॉडलों में देखे गए। ये संक्षिप्त मॉडल, जब तीक्ष्ण छवियों पर प्रशिक्षित किए गए, तो वे उस स्तर की सटीकता के साथ छोटे फलों के हिस्सों को पहचानने और रेखांकित करने में सक्षम थे जिसे विशाल मॉडल भी नहीं छू सके, भले ही विशाल मॉडलों को समान उच्च-रिज़ॉल्यूशन वाली तस्वीरें दी गई थीं।

अध्ययन ने इस बात पर प्रकाश डाला कि कार्य की कठिनाई इस बात पर निर्भर करती है कि रोबोट को फल के किस हिस्से को देखने की आवश्यकता है। युवा फल का मुख्य शरीर, जो गोल और बड़ा होता है, उसे ढूँढना AI के लिए अपेक्षाकृत आसान था। फल के आधार पर स्थित फूल का प्याला (flower cup) कठिन था, लेकिन फिर भी प्रबंधनीय था। सबसे कठिन लक्ष्य 'पेडुनकल' (peduncle) था, वह पतला, सुई जैसा डंठल जो फल को शाखा से जोड़ता है। यह संरचना इतनी संकीर्ण है और अक्सर पत्तियों द्वारा इतनी ढकी होती है कि जब छवि का आकार बदला जाता है या जब AI मॉडल ठीक से ट्यून नहीं होता है, तो यह आसानी से खो जाती है। शोधकर्ताओं ने पाया कि उच्च-रिज़ॉल्यूशन वाली छवियों पर प्रशिक्षित छोटे मॉडल इन डंठलों को खोजने में सबसे सफल रहे। उदाहरण के लिए, एक छोटा मॉडल, जिसे 960-पिक्सेल वाली छवियों पर प्रशिक्षित किया गया था, ने उपलब्ध सबसे शक्तिशाली प्रणालियों के एक अंश में कंप्यूटिंग शक्ति का उपयोग करते हुए फल और उसके हिस्सों की पहचान करने में उच्च स्तर की सटीकता प्राप्त की। इसके विपरीत, सबसे बड़े मॉडलों को प्रत्येक छवि को संसाधित करने के लिए काफी अधिक समय की आवश्यकता थी और वे बहुत अधिक ऊर्जा की खपत करते थे, फिर भी उन्होंने बेहतर परिणाम नहीं दिए। कुछ मामलों में, सबसे बड़े मॉडलों ने वास्तव में खराब प्रदर्शन किया, जो बताता है कि अधिक जटिलता जोड़ने से कभी-कभी AI की मदद करने के बजाय उसे भ्रमित किया जा सकता है।

यह कार्य कृषि के लिए रोबोट बनाने वाले इंजीनियरों के लिए एक स्पष्ट मार्गदर्शिका प्रदान करता है। यह सुझाव देता है कि बेहतर धारणा (perception) का मार्ग आवश्यक रूप से बड़े, अधिक महंगे कंप्यूटर बनाना नहीं है, बल्कि डेटा को तैयार करने के तरीके के बारे में स्मार्ट होना है। छवि के सूक्ष्म विवरणों को संरक्षित करने पर ध्यान केंद्रित करके और उसे एक ऐसे मॉडल के साथ जोड़कर जो कार्य को संभालने के लिए पर्याप्त बड़ा है, उच्च सटीकता प्राप्त करना संभव है बिना भारी कंप्यूटिंग लागत के। शोधकर्ताओं ने पाया कि उच्च-रिज़ॉल्यूशन वाली छवियों पर प्रशिक्षित एक छोटा मॉडल, फल और उसके नाजुक हिस्सों को उस सटीकता के साथ पहचान सकता है जो उपलब्ध सबसे शक्तिशाली प्रणालियों के बराबर या उससे अधिक है। यह भविष्य की रोबोटिक खेती के लिए एक महत्वपूर्ण खोज है, जहाँ रोबोटों को खेत में तेज़ी से और कुशलता से काम करने की आवश्यकता होती है, जो अक्सर सीमित शक्ति और कंप्यूटिंग संसाधनों के साथ संचालित होते हैं। अध्ययन निष्कर्ष निकालता है कि एक जटिल हरे वातावरण में छोटे, छिपे हुए ऑब्जेक्ट्स को देखने की विशिष्ट चुनौती के लिए, एक संक्षिप्त मॉडल और एक स्पष्ट दृश्य का संयोजन, समस्या पर केवल अधिक कंप्यूटिंग शक्ति झोंकने की तुलना में कहीं अधिक प्रभावी है। इन मॉडलों का कार्यान्वयन और उपयोग किया गया डेटा अब दूसरों के उपयोग के लिए उपलब्ध है, जो अगली पीढ़ी के कृषि रोबोटों के लिए एक व्यावहारिक आधार प्रदान करता है जो बाग को केवल एक हरे धुंधलेपन के रूप में नहीं, बल्कि व्यक्तिगत, नाजुक संरचनाओं के संग्रह के रूप में देख सकते हैं जो देखभाल की प्रतीक्षा कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →