← नवीनतम पेपर
🤖 machine learning

ActivePusher: Active Learning and Planning with Residual Physics for Nonprehensile Manipulation

ActivePusher एक नवीन फ्रेमवर्क है जो नॉनप्रिहेन्साइल मैनिपुलेशन (nonprehensile manipulation) में डेटा दक्षता और प्लानिंग विश्वसनीयता को बढ़ाने के लिए रेसिडुअल फिजिक्स मॉडलिंग को अनिश्चितता-आधारित एक्टिव लर्निंग के साथ जोड़ता है ताकि सूचनात्मक डेटा संग्रह को प्राथमिकता दी जा सके और नियंत्रण सैंपलिंग को अधिक विश्वसनीय कार्यों की ओर निर्देशित किया जा सके।

मूल लेखक: Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मेज पर एक भारी बक्से को एक विशिष्ट स्थान तक धकेलने के लिए सिखा रहे हैं। यह किसी चीज़ को ग्रिपर से पकड़ने जैसा नहीं है; यह एयर हॉकी या शफलबोर्ड खेलने जैसा है, जहाँ आपको वस्तु को पकड़े बिना उसे बस एक हल्का सा धक्का देना होता है। इसे नॉन-प्रीहेंसिल मैनिपुलेशन (nonprehensile manipulation) कहा जाता है।

समस्या यह है कि भौतिक विज्ञान (फिजिक्स) बहुत जटिल और अनिश्चित है। घर्षण (friction), वस्तु का आकार, और मेज की सतह कैसी है, ये सब मिलकर वस्तु को अप्रत्याशित तरीके से खिसका सकते हैं। यदि रोबोट का अनुमान गलत हुआ, तो बॉक्स कोने में जा सकता है, मेज से गिर सकता है, या किसी बाधा से टकरा सकता है।

यह पेपर एक नया फ्रेमवर्क पेश करता है जिसे ACTIVEPUSHER कहा जाता है। इसे एक ऐसे रोबोट के रूप में सोचें जो केवल "करने वाला" ही नहीं है, बल्कि एक स्मार्ट "सीखने वाला" और एक सतर्क "योजना बनाने वाला" भी है। यह रोबोटिक्स की दो मुख्य समस्याओं को हल करता है:

  1. सीखना महंगा है: वास्तविक दुनिया में चीजों को धकेल कर डेटा इकट्ठा करने में बहुत समय लगता है और उपकरणों में टूट-फूट भी होती है।
  2. योजना बनाना जोखिम भरा है: यदि रोबोट का वस्तुओं के हिलने-डुलने का आंतरिक मानचित्र (internal map) गलत है, तो उसकी दीर्घकालिक योजना विफल हो जाएगी।

ACTIVEPUSHER कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "को-पायलट" सिस्टम (रेसिड्यूअल फिजिक्स)

कल्पना कीजिए कि आप यह अनुमान लगाने की कोशिश कर रहे हैं कि बर्फ पर कार कैसे फिसलेगी। आपके पास एक टेक्स्टबुक फॉर्मूला (फिजिक्स) है जो कहता है: "यदि आप बाएं मुड़ते हैं, तो कार बाईं ओर जाएगी।" लेकिन वास्तव में, कार थोड़ी अलग तरह से फिसल सकती है क्योंकि बर्फ की स्थिति विशिष्ट है।

टेक्स्टबुक को पूरी तरह से त्याग देने या शून्य से शुरुआत करने के बजाय, ACTIVEPUSHER उस टेक्स्टबुक को एक "को-पायलट" के रूप में उपयोग करता है। यह जानता है कि भौतिकी के सामान्य नियम क्या हैं। फिर, यह एक न्यूरल नेटवर्क (एक प्रकार का AI) जोड़ता है जो एक "करेक्शन एजेंट" (सुधार करने वाले) के रूप में कार्य करता है।

  • को-पायलट कहता है: "फिजिक्स के आधार पर, बॉक्स को 10 इंच आगे बढ़ना चाहिए।"
  • करेक्शन एजेंट कहता है: "वास्तव में, पिछले कुछ धक्कों को देखते हुए, यह विशिष्ट बॉक्स आमतौर पर 12 इंच फिसलता है क्योंकि यह डगमगा रहा है। आइए भविष्यवाणी में 2 इंच जोड़ दें।"

यह हाइब्रिड दृष्टिकोण का अर्थ है कि रोबोट बहुत तेज़ी से सीखता है क्योंकि उसे बुनियादी भौतिकी को फिर से सीखने की आवश्यकता नहीं है; उसे केवल उन गलतियों को सीखना है जो भौतिकी मॉडल करता है।

2. "स्मार्ट स्टूडेंट" (एक्टिव लर्निंग)

आमतौर पर, रोबोट रैंडम तरीके से चीजें करके सीखते हैं: "मैं यहाँ धकेलता हूँ, फिर वहाँ, फिर इधर-उधर।" यह एक छात्र की तरह है जो किताब के पन्नों को बेतरतीब ढंग से पलटकर परीक्षा की तैयारी कर रहा है। यह अक्षम है।

ACTIVEPUSHER एक "स्मार्ट स्टूडेंट" है। यह अपने मन में एक नक्शा रखता है कि वह क्या नहीं जानता।

  • उपमा: कल्पना कीजिए कि आप एक नई भाषा सीख रहे हैं। आप पहले से ही "नमस्ते" और "अलविदा" कहना जानते हैं। आपको इनका अभ्यास करने की आवश्यकता नहीं है। लेकिन आप क्रियाओं (verbs) के काल (tense) बदलने में बहुत खराब हैं।
  • रणनीति: "नमस्ते" को 1,000 बार बोलने के बजाय, ACTIVEPUSHER पूछता है, "मैं कहाँ सबसे अधिक भ्रमित हूँ?" यह विशेष रूप से उन "कठिन क्रियाओं" (भ्रमित करने वाले धकेलने के कोण और दूरियों) का अभ्यास करने का चुनाव करता है क्योंकि वहीं से वह सबसे अधिक सीख पाएगा।
  • परिणाम: यह केवल वहीं डेटा एकत्र करता है जहाँ इसकी सबसे अधिक आवश्यकता होती है, जिससे समय और प्रयास की भारी बचत होती है।

3. "सतर्क नेविगेटर" (एक्टिव प्लानिंग)

एक बार जब रोबोट पर्याप्त सीख लेता है, तो उसे बॉक्स को बिंदु A से बिंदु B तक ले जाने के लिए एक रास्ता बनाना होता है।

  • समस्या: यदि रोबोट एक ऐसे "धुंधले" क्षेत्र से होकर गुजरने वाली योजना बनाता है (जहाँ उसने बहुत कम अभ्यास किया है), तो उसका अनुमान गलत हो सकता है और दुर्घटना हो सकती है।
  • समाधान: ACTIVEPUSHER एक सतर्क नेविगेटर की तरह कार्य करता है। जब वह सभी संभावित चालों को देखता है, तो वह कहता है, "मैं इस चाल के बारे में 99% आश्वस्त हूँ, लेकिन मैं उस चाल के बारे में केवल 50% आश्वस्त हूँ।"
  • रणनीति: यह जानबूझकर "धुंधले" रास्तों से बचता है और उन "साफ और धूप वाले" रास्तों को चुनता है जहाँ वह आश्वस्त है। भले ही "धूप वाला" रास्ता थोड़ा लंबा हो, लेकिन यह बहुत सुरक्षित है और इसमें विफल होने की संभावना कम है।

यह क्यों महत्वपूर्ण है

इस पेपर का परीक्षण वास्तविक रोबोटों और विभिन्न वस्तुओं (जैसे केला, मग और बॉक्स) के साथ सिमुलेशन में किया गया।

  • दक्षता: इसने मानक तरीकों की तुलना में आधे से भी कम डेटा का उपयोग करके वस्तुओं को सटीक रूप से धकेलना सीखा।
  • सफलता: जब इसे एक बॉक्स को मेज के किनारे तक धकेलने के लिए कहा गया (एक कठिन कार्य), तो यह उन रोबोटों की तुलना में बहुत अधिक बार सफल रहा जो केवल रैंडम अनुमान लगाते थे या मानक AI का उपयोग करते थे।
  • वास्तविक दुनिया के लिए तैयार: यह तब भी अच्छी तरह से काम किया जब रोबोट को केवल कंप्यूटर सिमुलेशन पर नहीं, बल्कि एक वास्तविक मेज पर प्रशिक्षित किया गया था।

निचोड़

ACTIVEPUSHER ऐसा है जैसे रोबोट को एक टेक्स्टबुक, एक स्मार्ट स्टडी गाइड और एक सुरक्षा कम्पास दे दिया गया हो।

  1. यह शुरुआत के रूप में टेक्स्टबुक (फिजिक्स) का उपयोग करता है।
  2. यह केवल कठिन हिस्सों का अभ्यास करने के लिए स्टडी गाइड (एक्टिव लर्निंग) का उपयोग करता है।
  3. यह खतरनाक और अनिश्चित चालों से बचने के लिए सुरक्षा कम्पास (एक्टिव प्लानिंग) का उपयोग करता है।

परिणामस्वरूप, एक ऐसा रोबोट मिलता है जो तेजी से सीखता है, कम गलतियाँ करता है, और हजारों घंटों के परीक्षण और त्रुटि (trial and error) की आवश्यकता के बिना वास्तविक दुनिया के कार्यों को संभाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →