← नवीनतम पेपर
💻 computer science

Mash, Spread, Slice! Learning to Manipulate Object States via Visual Spatial Progress

यह शोध पत्र SPARTA को प्रस्तुत करता है, जो एक एकीकृत ढांचा (unified framework) है जो विजुअल स्पेशियल प्रोग्रेस सेगमेंटेशन का लाभ उठाकर रोबोटों को संरचित अवलोकनों (structured observations) और सघन पुरस्कारों (dense rewards) के माध्यम से मैशिंग और स्लाइसिंग जैसे निरंतर वस्तु अवस्था परिवर्तनों वाले हेरफेर कार्यों को प्रभावी ढंग से सीखने और निष्पादित करने में सक्षम बनाता है।

मूल लेखक: Priyanka Mandikal, Jiaheng Hu, Shivin Dass, Sagnik Majumder, Roberto Martín-Martín, Kristen Grauman

प्रकाशित 2026-03-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Priyanka Mandikal, Jiaheng Hu, Shivin Dass, Sagnik Majumder, Roberto Martín-Martín, Kristen Grauman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। आज के अधिकांश रोबोट चीज़ों को एक जगह से दूसरी जगह ले जाने में माहिर हैं: जैसे कप उठाना, उसे मेज पर रखना, या दरवाज़ा खोलना। ये कठोर ब्लॉकों को हिलाने जैसा है; वस्तु वैसी ही रहती है, बस उसकी जगह बदल जाती है।

लेकिन वस्तु को खुद बदलने के बारे में क्या?

  • केले को मैश करके चिकना पेस्ट बनाना।
  • टोस्ट पर पीनट बटर को समान रूप से फैलाना।
  • खीरे को पतले गोल टुकड़ों में काटना।

ये कार्य कठिन हैं। वस्तु केवल हिलती नहीं है; वह रूप बदलती (morph) है। वह रोबोट की आँखों के सामने ही अपना आकार, बनावट और रंग बदल लेती है। यदि आप एक मानक रोबोट से कहें कि "इस केले को मैश करो," तो वह शायद पूरे केले को मेज से नीचे धकेल देगा क्योंकि वह यह नहीं समझ पाता कि उसे केवल बिना मैश हुए हिस्सों पर दबाव डालना है और पहले से मैश हो चुके हिस्सों से बचना है।

यह पेपर SPARTA पेश करता है, जो रोबोट को इन "नरम और बदलने वाली" चीज़ों को संभालने के लिए सिखाने का एक नया तरीका है।

मुख्य विचार: "पेंटिंग" का उदाहरण

रोबोट के काम को दीवार पर पेंट करने की तरह समझें।

  • लक्ष्य: पूरी दीवार को पेंट से ढंकना।
  • समस्या: यदि आप केवल दीवार को देखते हैं, तो आपको सफेद (बिना पेंट वाली) और नीली (पेंट वाली) चीज़ों का मिश्रण दिखाई देता है। केवल देखकर यह बताना मुश्किल है कि आप वास्तव में कहाँ हैं या आपने कितनी प्रगति की है।
  • SPARTA का समाधान: रोबोट को उस उलझी हुई दीवार को देखने के बजाय, एक जादुई मानचित्र (magic map) दिया जाता है।
    • मानचित्र पर लाल क्षेत्र का अर्थ है: "यह हिस्सा अभी भी कच्चा/बिना मैश किया हुआ/बिना पेंट किया हुआ है। यहाँ जाओ!"
    • हरे क्षेत्र का अर्थ है: "यह हिस्सा हो चुका है। यहाँ समय बर्बाद न करें।"

इस "जादुई मानचित्र" को SPOC मैप (Spatially Progressing Object State Change) कहा जाता है। यह भ्रमित करने वाले विवरणों (जैसे केले का विशिष्ट रंग या ब्रेड की बनावट) को हटा देता है और केवल इस पर ध्यान केंद्रित करता है कि आगे क्या किया जाना बाकी है

SPARTA कैसे काम करता है: दो मोड

पेपर दिखाता है कि काम के आधार पर SPARTA दो अलग-अलग "व्यक्तित्वों" में काम कर सकता है:

1. SPARTA-L (सीखने वाला - The Learner) 🧠

  • सबसे अच्छा है: उन कठिन कामों के लिए जिनमें सटीकता की आवश्यकता होती है, जैसे पतले ब्रश से सॉस फैलाना या खीरा काटना।
  • यह कैसे काम करता है: यह एक छात्र द्वारा परीक्षा देने जैसा है। रोबोट एक क्रिया करता है, जादुकी मानचित्र को देखता है, और एक स्कोर प्राप्त करता है।
    • क्या आपने एक नया टुकड़ा मैश किया? बहुत अच्छा! (+1 अंक)।
    • क्या आपने उसी जगह को दोबारा मैश किया? कोई अंक नहीं।
    • क्या आपने पूरे केले को ही छोड़ दिया? शून्य अंक।
  • क्योंकि रोबोट को हर छोटे कदम के लिए स्कोर मिलता है (केवल अंत में "पास/फेल" के बजाय), वह तेजी से सीखता है। प्रयोगों में, इसने बिना किसी इंसान के दिखाए, केवल 1.5 से 3 घंटे के वास्तविक अभ्यास में केले को मैश करना और जैम फैलाना सीख लिया।

2. SPARTA-G (लालची उत्साही - The Greedy Go-Getter) 🏃

  • सबसे अच्छा है: बड़े, सरल कामों के लिए जहाँ आपके पास एक चौड़ा औज़ार हो, जैसे बड़े मैशर से आलू को कुचलना।
  • यह कैसे काम करता है: यह रोबोट समय के साथ "सीखता" नहीं है। यह बस जादुई मानचित्र को देखता है और पूछता है, "मेरे ठीक बगल में सबसे बड़ा लाल (बिना मैश हुआ) ढेर कहाँ है?" और तुरंत वहीं जाता है।
  • यह तेज़, हल्का है और इसे प्रशिक्षण की आवश्यकता नहीं है। यह एक वैक्यूम क्लीनर की तरह है जो बस गंदगी के पीछे चलता है।

यह एक बड़ी बात क्यों है?

इससे पहले, रोबोट इन कार्यों में संघर्ष करते थे क्योंकि:

  1. वे दिखावट से भ्रमित हो जाते थे: एक मैश किया हुआ केला, कटे हुए खीरे से बहुत अलग दिखता है। मानक रोबोट हर विशिष्ट लुक को याद रखने की कोशिश करते थे, जो असंभव है। SPARTA लुक्स को अनदेखा करता है और केवल अवस्था (मैश हुआ बनाम बिना मैश हुआ) पर ध्यान केंद्रित करता है।
  2. वे बिना मानचित्र के खो जाते थे: यदि आप रोबोट को "केला मैश करो" कहते हैं और उसे केवल अंत में इनाम देते हैं जब वह काम पूरा हो जाता है, तो रोबोट अंधेरे में तीर चला रहा होता है। यह बिना चुंबक के घास के ढेर में सुई खोजने जैसा है। SPARTA रोब गया को एक चुंबक (सघन रिवॉर्ड) देता है जो उसे चरण-दर-चरण मार्गदर्शन करता है।

परिणाम

टीम ने 10 अलग-अलग वस्तुओं (केले, एवोकैडो, ब्रेड, खीरा, आदि) पर तीन अलग-अलग कार्यों (मैश करना, फैलाना, काटना) के साथ SPARTA का परीक्षण किया।

  • पुराने तरीके (जैसे केवल अनुमान लगाना या साधारण "क्या आपने पूरा किया?" रिवॉर्ड का उपयोग करना) बुरी तरह विफल रहे।
  • SPARTA सफल रहा, जिसने बिखरे हुए, बिना पके हुए खाद्य पदार्थों को पूरी तरह से संसाधित भोजन में बदल दिया।

निष्कर्ष

SPARTA एक रोबोट को एक्स-रे चश्मे देने जैसा है जो देख सकता है कि "क्या हो गया है" और "क्या बाकी है"। वस्तु की विशिष्ट उपस्थिति के बजाय प्रगति पर ध्यान केंद्रित करके, रोबोट अंततः उन बिखरे हुए, नरम और वास्तविक दुनिया के कामों को करने में सक्षम हो सकते हैं जो इंसान रोज़ाना करते हैं, और इसके लिए उन्हें किसी इंसान के हाथ पकड़कर सिखाने की ज़रूरत नहीं पड़ती।

संक्षेप में: SPARTA रोबोट को केवल वस्तुओं को इधर-उधर हिलाना ही नहीं, बल्कि उनके साथ वास्तव में खाना बनाना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →