← नवीनतम पेपर
💻 computer science

AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding

यह शोध पत्र AgroVG को प्रस्तुत करता है, जो छह कृषि लक्ष्य परिवारों में 10,000 से अधिक इमेज-क्वेरी युग्मों वाला एक बड़े पैमाने का मल्टी-सोर्स बेंचमार्क है, जो विज़ुअल ग्राउंडिंग का एक सामान्यीकृत सेट प्रेडिक्शन कार्य के रूप में मूल्यांकन करने के लिए है, जो कृषि परिदृश्यों में छोटे, अवरुद्ध और परिवर्तनशील वस्तु गणनाओं को संभालने की वर्तमान मॉडलों की क्षमता में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

मूल लेखक: Haocheng Li, Juepeng Zheng, Zenghao Yang, Kaiqi Du, Guilong Xiao, Gengmeng Pu, Haohuan Fu, Jianxi Huang

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haocheng Li, Juepeng Zheng, Zenghao Yang, Kaiqi Du, Guilong Xiao, Gengmeng Pu, Haohuan Fu, Jianxi Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट माली को एक विशाल, बिखरे हुए खेत में काम करना सिखा रहे हैं। आप उसे सरल निर्देश देना चाहते हैं जैसे, "केवल बाईं ओर के पके हुए सेब तोड़ो," या "खरपतवार पर छिड़काव करो, लेकिन स्वस्थ फसलों को छोड़ दो।"

लंबे समय से, AI शोधकर्ता रोबोट को यह पहचानने में माहिर रहे हैं कि तस्वीर में क्या है (जैसे, "यह एक सेब है")। लेकिन वे रोबोट को इस बारे में विशिष्ट निर्देश सुनने में बहुत अच्छे नहीं रहे हैं कि चीजें कहाँ हैं, खासकर जब दर्जनों समान चीजें एक साथ भीड़ लगाकर खड़ी हों, या जब वह चीज़ वहाँ हो ही नहीं जिसके बारे में आपने पूछा था।

यह पेपर AgroVG पेश करता है, जो एक नया "टेस्ट ड्राइव" (बेंचमार्क) है, जिसे यह देखने के लिए बनाया गया है कि क्या AI मॉडल वास्तव में इन जटिल कृषि निर्देशों का पालन कर सकते हैं।

यहाँ इसका विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "भूसे के ढेर में सुई" की चुनौती

एक सामान्य फोटो में, AI को "बिल्ली ढूँढो" कहना आसान है। लेकिन एक खेत में:

  • भूसे का ढेर: वहाँ 50 गेहूं की बालियाँ हो सकती हैं जो लगभग एक जैसी दिखती हैं।
  • सुई: आप कह सकते हैं "दाईं ओर की तीन सबसे ऊंची गेहूं की बालियाँ।"
  • जाल: कभी-कभी आप "लाल सेब" ढूंढने के लिए कहते हैं, लेकिन तस्वीर में कोई लाल सेब नहीं होता। एक स्मार्ट रोबोट को कहना चाहिए, "मुझे कोई नहीं दिख रहा," लेकिन एक मूर्ख रोबोट कल्पना (hallucinate) कर सकता है और किसी हरी पत्ती की ओर इशारा कर सकता है।

मौजूदा परीक्षण यह जांच नहीं पाते थे कि क्या रोबोट इन तीनों कठिन स्थितियों को एक साथ संभाल सकते हैं: एक विशिष्ट वस्तु को खोजना, कई विशिष्ट वस्तुओं को खोजना, या वस्तु मौजूद न होने पर सही ढंग से "कोई नहीं" कहना।

2. समाधान: AgroVG "ड्राइविंग टेस्ट"

लेखकों ने AgroVG नामक एक विशाल परीक्षण बैंक बनाया है। इसे कृषि रोबोटों के लिए एक विशाल, मानकीकृत ड्राइविंग टेस्ट की तरह समझें।

  • आकार: इसमें 10,000 से अधिक परीक्षण प्रश्न शामिल हैं।
  • विविधता: यह छह अलग-अलग "ड्राइविंग परिदृश्यों" (परिवारों) को कवर करता है: फसल बनाम खरपतवार, फल, गेहूं की बालियाँ, कीट (कीड़े), पौधों की बीमारियाँ, और पेड़ों की कैनोपी (छत्र)।
  • कठिनाई के दो स्तर:
    • स्तर 1 (बॉक्स): रोबोट लक्ष्य के चारों ओर एक चौकोर बॉक्स बनाता है। यह ऐसा है जैसे कहना, "लक्ष्य इस वर्ग के आसपास कहीं है।"
    • स्तर 2 (मास्क): रोबोट लक्ष्य के चारों ओर एक सटीक रूपरेखा (outline) बनाता है। यह ऐसा है जैसे कहना, "लक्ष्य बिल्कुल इसी आकार का है, इससे ज्यादा नहीं, इससे कम नहीं।" यह बहुत कठिन है क्योंकि पत्तियों और कीड़ों के आकार टेढ़े-मेढ़े होते हैं।

3. उन्होंने इसका परीक्षण कैसे किया

उन्होंने रोबोट को इस टेस्ट के लिए प्रशिक्षित नहीं किया। इसके बजाय, उन्होंने 26 अलग-अलग AI मॉडल (GPT-4 जैसे बड़े प्रसिद्ध मॉडलों और विशेष ओपन-सोर्स मॉडलों सहित) को लिया और उनसे बिना किसी पूर्व तैयारी के (zero-shot) टेस्ट देने को कहा।

उन्होंने ऐसे प्रश्न पूछे जैसे:

  • "सबसे बड़ा कीड़ा खोजें।" (एकल लक्ष्य)
  • "बाईं ओर की सभी खरपतवार खोजें।" (एकाधिक लक्ष्य)
  • "नीले फूल खोजें।" (जब तस्वीर में कोई नीला फूल मौजूद न हो)।

4. परिणाम: रोबोट संघर्ष करते रहे

परिणाम थोड़े चौंकाने वाले थे। यहाँ तक कि सबसे स्मार्ट AI मॉडल भी इस टेस्ट को शानदार तरीके से पास करने में विफल रहे।

  • "सेट" की समस्या: जब उन्हें सभी खरपतवार खोजने के लिए कहा गया, तो रोबोट आमतौर पर सबसे बड़े, सबसे स्पष्ट वाले ढूंढ लेते थे लेकिन छोटे, छिपे हुए वाले छूट जाते थे। वे ऐसे छात्र की तरह थे जो केवल आसान सवालों के जवाब देते हैं और बाकी छोड़ देते हैं।
  • "भ्रम/हैलुसिनेशन" की समस्या: जब किसी ऐसी चीज़ को खोजने के लिए कहा गया जो वहां नहीं थी (जैसे घास की तस्वीर में "लाल सेब खोजें"), तो कई रोबोटों ने आत्मविश्वास के साथ रैंडम हरी पत्तियों के चारों ओर बॉक्स या मास्क बना दिए। वे खुश करने के लिए बहुत उत्सुक थे और उन्होंने ऐसे लक्ष्य बना दिए जो अस्तित्व में ही नहीं थे।
  • "सटीकता" की समस्या: जब उन्हें एक सटीक रूपरेखा (स्तर 2) बनाने के लिए कहा गया, तो रोबोट अक्सर लापरवाह थे। वे ऐसा मास्क बना सकते थे जो केवल बीमार पत्ती के बजाय पूरे पौधे को ढक ले, या वे किनारों को पूरी तरह से मिस कर देते थे।

मुख्य बात: सबसे अच्छा मॉडल केवल 35% "एकाधिक वस्तुओं को खोजने" वाले प्रश्नों को सही कर पाया, और "सटीक रूपरेखा" वाले प्रश्नों में 17% से भी कम सफल रहा।

5. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का तर्क है कि इससे पहले कि हम रोबोट पर आवाज के आदेशों के आधार पर कीटनाशकों के छिड़काव या फल तोड़ने के लिए भरोसा कर सकें, हमें यह मापने का एक तरीका चाहिए कि क्या वे वास्तव में सुन रहे हैं और सही देख रहे हैं।

AgroVG वही मापने वाला पैमाना है। यह हमें दिखाता है कि हालांकि AI तस्वीरें "देखने" में बेहतर हो रहा है, लेकिन यह जटिल निर्देशों को सुनने और अस्त-व्यस्त, वास्तविक दुनिया के वातावरण में सही ढंग से समझने में अभी भी बहुत खराब है। यह रेखांकित करता है कि हमें ऐसे रोबोटों की आवश्यकता है जो न केवल चीजों को पहचानने में अच्छे हों, बल्कि यह जानने में भी सक्षम हों कि कुछ भी नहीं होने पर क्या करना है, और चीजों को गिनने और समूह बनाने में भी कुशल हों।

संक्षेप में: हमने खेत के रोबोटों के लिए एक बहुत कठिन परीक्षा बनाई। उन्होंने परीक्षा दी, और वे ज्यादातर फेल हो गए। यह हमें बताता है कि उन्हें खेतों में अकेले काम करने के लिए छोड़ने से पहले हमें अभी एक लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →