← नवीनतम पेपर
💻 computer science

Robotic Strawberry Harvesting with Robust Vision and Deep Reinforcement Learning based Sim-to-Real Control

यह शोध पत्र एक क्लोज्ड-लूप रोबोटिक स्ट्रॉबेरी हार्वेस्टिंग सिस्टम प्रस्तुत करता है जो जटिल कृषि वातावरणों में उच्च सफलता दर प्राप्त करने के लिए सिमुलेशन-प्रशिक्षित डीप रिइन्फोर्समेंट लर्निंग कंट्रोल के साथ एक सुदृढ़ HRAttnEdge-YOLO26-seg विजन मॉडल को एकीकृत करता है, जिससे हार्डवेयर निर्भरता और विकास लागत कम होती है।

मूल लेखक: Al Bashir, Shao-Yang Chang, Partho Ghose, Prem Raj, Chen-Kang Huang, Azlan Zahid

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Al Bashir, Shao-Yang Chang, Partho Ghose, Prem Raj, Chen-Kang Huang, Azlan Zahid

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक भीड़ भरे बगीचे में स्ट्रॉबेरी तोड़ने की कोशिश कर रहा है। पत्तियाँ हर तरफ फैली हुई हैं, बेरीज (berries) डंठल के पीछे छिपी हुई हैं, और रोबोट को इतना कोमल होना चाहिए कि वह फल को कुचले नहीं, लेकिन उसे बेल से तोड़ने के लिए पर्याप्त मजबूत भी होना चाहिए। इसे स्वचालित रूप से करना अविश्वसनीय रूप से कठिन है क्योंकि रोबोट को बेरी को स्पष्ट रूप से "देखना" होगा और फिर बिना किसी चीज़ से टकराए अपने हाथ को सुचारू रूप से "चलाना" होगा।

यह शोध पत्र एक नए रोबोट सिस्टम का वर्णन करता है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है, जो दो मुख्य तरकीबों का उपयोग करता है: एक सुपर-शार्प "चश्मा" (दृष्टि/vision) और एक "मसल मेमोरी" (मांसपेशियों की स्मृति) वाला मस्तिष्क (नियंत्रण), जिसे वास्तविक रोबोट को छूने से पहले एक वीडियो गेम में प्रशिक्षित किया गया था।

यह सिस्टम कैसे काम करता है, यहाँ सरल भागों में दिया गया है:

1. "सुपर-ग्लासेस": कचरे के बीच से देखना

समस्या: एक वास्तविक ग्रीनहाउस में, स्ट्रॉबेरी अक्सर पत्तियों के पीछे छिपी होती हैं या आपस में गुच्छों में होती हैं। मानक कंप्यूटर विजन कपड़ों के एक बिखरे हुए ढेर को देखने जैसा है; यह एक लाल धब्बे को तो देख सकता है, लेकिन यह ठीक से नहीं बता सकता कि बेरी कहाँ खत्म होती है और पत्ती कहाँ शुरू होती है। यदि रोबोट किनारे का गलत अनुमान लगाता है, तो वह फल के बजाय पत्ती को पकड़ सकता है।

समाधान: शोधकर्ताओं ने एक नया प्रकार का कैमरा सॉफ्टवेयर बनाया है जिसे HRAttnEdge-YOLO26-seg कहा जाता है।

  • उपमा (Analogy): मानक विजन सॉफ्टवेयर को एक मोटे, कुंद ब्रश का उपयोग करने वाले चित्रकार के रूप में सोचें। यह स्ट्रॉबेरी का सामान्य आकार तो प्राप्त कर लेता है लेकिन किनारे धुंधले छोड़ देता है। यह नया सॉफ्टवेयर एक बारीक टिप वाले पेन का उपयोग करने वाले एक मास्टर कलाकार की तरह है। इसके पास तीन विशेष उपकरण हैं:
    1. हाई-रिज़ॉल्यूशन लेंस: यह उन सूक्ष्म विवरणों (जैसे डंठल और बेरी के किनारे) का एक "ज़ूम-इन" दृश्य रखता है जिन्हें अन्य सिस्टम आमतौर पर हटा देते हैं।
    2. फोकस फ़िल्टर: यह बैकग्राउंड के शोर (पत्तियों और छाया) को अनदेखा करता है और केवल उन्हीं हिस्सों पर ध्यान केंद्रित करता है जो फल जैसे दिखते हैं।
    3. एज डिटेक्टिव (किनारे का जासूस): यह विशेष रूप से उन तीखी रेखाओं को देखता है जहाँ फल समाप्त होता है, जिससे यह सुनिश्चित होता है कि रोबोट को ठीक पता हो कि कहाँ पकड़ना है।
  • परिणाम: परीक्षण के दौरान, यह सिस्टम पुराने तरीकों की तुलना में, भले ही बेरी आंशिक रूप से छिपी हो, स्ट्रॉबेरी के चारों ओर एकदम सटीक रूप से रूपरेखा (outline) बनाने में बहुत बेहतर था।

2. "वीडियो गेम ट्रेनिंग": चीजों को तोड़े बिना चलना सीखना

समस्या: एक रोबोटिक हाथ को सुचारू रूप से हिलना सिखाने में आमतौर पर "परीक्षण और त्रुटि" (trial and error) शामिल होता है। आप रोबोट को चलने के लिए कहते हैं, वह टकरा जाता है, आप उसे ठीक करते हैं, आप फिर से प्रयास करते हैं, आप फिर से कोशिश करते हैं। यह महंगा, धीमा है और रोबोट या नाजुक स्ट्रॉबेरी को तोड़ने का जोखिम उठाता है।

समाधान: शोधकर्ताओं ने डीप रीइन्फोर्समेंट लर्निंग (DRL) का उपयोग किया, विशेष रूप से PPO नामक एक विधि।

  • उपमा: रोबोट को वास्तविक ग्रीनहाउस में सिखाने के बजाय, उन्होंने इसे एक आभासी वीडियो गेम (Isaac Lab) में रखा। इस गेम में, उन्होंने हजारों नकली ग्रीनहाउस और नकली स्ट्रॉबेरी बनाईं। रोबोट ने लक्ष्य तक पहुँचने की कोशिश में लाखों बार यह गेम खेला। हर बार जब वह सुचारू रूप से चला, तो उसे एक "पॉइंट" मिला। हर बार जब वह झटके खाकर चला या टकराया, तो उसके अंक कट गए।
  • ट्रांसफर (स्थानांतरण): एक बार जब रोबोट गेम में मास्टर बन गया, तो उन्होंने उस "मस्तिष्क" (पॉलिसी) को लिया और उसे वास्तविक रोबोट में अपलोड कर दिया। क्योंकि इसने सिमुलेशन में सबसे अच्छा तरीके से चलना सीख लिया था, इसलिए यह वास्तविक दुनिया में बिना किसी चीज़ से टकराए तुरंत सुचारू और तरल गति करने में सक्षम था।
  • तुलना: उन्होंने इसका परीक्षण एक पारंपरिक विधि (इनवर्स किनेमैटिक्स) के विरुद्ध किया, जो हाथ को चलाने के लिए वास्तविक समय में एक जटिल गणितीय समीकरण को हल करने जैसा है। पारंपरिक विधि झटकेदार थी और अक्सर विफल हो जाती थी। "वीडियो गेम द्वारा प्रशिक्षित" रोबोट एक मानव नर्तक की तरह चला—सुचारू और अनुमानित।

3. "असेंबली लाइन": सबको एक साथ जोड़ना

टीम ने इन दोनों भागों को एक मानक रोबोट भाषा (ROS) का उपयोग करके जोड़ा।

  1. देखना: कैमरा स्ट्रॉबेरी को पहचानता है और उसके चारों ओर एक सटीक रूपरेखा बनाता है।
  2. गणना करना: यह उस रूपरेखा के केंद्र को पाता है और यह पता लगाता है कि 3D स्पेस में वह वास्तव में कहाँ है।
  3. चलना: "वीडियो गेम द्वारा प्रशिक्षित" मस्तिष्क रोबोट के जोड़ों को उस स्थान तक पहुँचने के लिए कैसे हिलना है, यह बताता है।
  4. पकड़ना: एक सॉफ्ट ग्रिपर (एक कोमल हाथ की तरह) बेरी को पकड़ता है और उसे बेल से खींच लेता है।
  5. दोहराना: रोबोट बेरी को एक टोकरी में डाल देता है और अगली बेरी की ओर बढ़ जाता है।

वास्तविक दुनिया का परीक्षण

वे इस सिस्टम को टेक्सास के एक वास्तविक ग्रीनहाउस में ले गए।

  • स्कोरकार्ड: रोबोट सफलतापूर्वक स्ट्रॉबेरी तक 96.6% बार पहुँचा। उसने सफलतापूर्वक स्ट्रॉबेरी को पकड़ा और खींचा 91.3% बार। कुल मिलाकर, इसने प्रयासों में से 84.3% बार सफलतापूर्वक कटाई की।
  • तुलना: यह पुराने "गणितीय समीकरण" वाले तरीके की तुलना में बहुत बेहतर था, जो अस्त-व्यस्त ग्रीनहाउस वातावरण के लिए बहुत अस्थिर और अविश्वसनीय था।

वे क्या नहीं कर पाए (सीमाएं)

शोध पत्र स्पष्ट रूप से बताता है कि यह सिस्टम अभी क्या नहीं करता है:

  • यह डंठल के सटीक कोण को नहीं जानता (यह केवल फल के केंद्र की ओर निशाना लगाता है)।
  • यह पत्तियों के पीछे से देखने के लिए कैमरे को सक्रिय रूप से नहीं घुमाता है यदि कोई बेरी बाधित है; यह केवल उन्हें चुनता है जिन्हें यह देख सकता है।
  • यह इस बात पर निर्भर करता है कि रोबोट को एक विशिष्ट तरीके से सेट किया गया है; यदि आप रोबोट को दूसरे ग्रीनहाउस में ले जाते हैं, तो आपको कैमरा और हाथ के बीच के "मैप" को फिर से कैलिब्रेट करना होगा।

निचोड़ (The Bottom Line)

यह शोध पत्र एक ऐसे रोबोट को प्रस्तुत करता है जो भीड़ के बीच से स्पष्ट रूप से देखने के लिए स्मार्ट विजन और सुचारू रूप से चलने के लिए सिम्युलेटेड वीडियो-गेम ट्रेनिंग का उपयोग करता है। यह सिद्ध करता है कि आपको वास्तविक रोबोट को सिखाने के लिए उसे तोड़ने की आवश्यकता नहीं है; आप इसे एक आभासी दुनिया में सिखा सकते हैं और फिर इसे वास्तविक काम करने दे सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →