← नवीनतम पेपर
🤖 AI

GarmentPile++: Affordance-Driven Cluttered Garments Retrieval with Vision-Language Reasoning

GarmentPile++ एक नवीन पाइपलाइन है जो विजन-लैंग्वेज रीजनिंग को विजुअल अफोर्डेंस परसेप्शन और ड्यूल-आर्म कोऑपरेशन के साथ एकीकृत करती है ताकि अव्यवस्थित ढेरों से एकल कपड़ों की सुरक्षित और सटीक प्राप्ति को सक्षम बनाया जा सके, जो सिंगल-गारमेंट मैनिपुलेशन रिसर्च और वास्तविक दुनिया के परिदृश्यों के बीच के अंतर को पाटता है।

मूल लेखक: Mingleyang Li, Yuran Wang, Yue Chen, Tianxing Chen, Jiaqi Liang, Zishun Shen, Haoran Lu, Ruihai Wu, Hao Dong

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingleyang Li, Yuran Wang, Yue Chen, Tianxing Chen, Jiaqi Liang, Zishun Shen, Haoran Lu, Ruihai Wu, Hao Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लंबे दिन के बाद घर आते हैं, और आप अपने बिस्तर पर कपड़ों का एक विशाल, बिखरा हुआ ढेर देखते हैं। यह शर्ट, पैंट, मोजे और स्वेटर का एक उलझा हुआ मिश्रण है। आप बस पहनने के लिए एक विशेष लाल शर्ट उठाना चाहते हैं, या शायद आप चाहते हैं कि रोबोट पूरे ढेर को एक-एक करके तह करना शुरू कर दे।

एक रोबोट के लिए यह करना अविश्वसनीय रूप से कठिन है। कपड़े लचीले होते हैं, वे आपस में उलझ जाते हैं, और मुड़े हुए होने पर वे लगभग एक जैसे दिख सकते हैं। अधिकांश रोबोट एक बार में एक साफ शर्ट संभालने के लिए प्रशिक्षित होते हैं। यदि आप उन्हें कपड़ों का एक बिखरा हुआ ढेर देते हैं, तो वे अक्सर एक साथ बहुत सारे कपड़े पकड़ लेते हैं, या वे भ्रमित होकर सब कुछ गिरा देते हैं।

GarmentPile++ एक नया "दिमाग" है जो इस समस्या को हल करता है। इसे एक ऐसे रोबोट के रूप में सोचें जिसके पास सुपर-विज़न (अति-दृष्टि), कॉमन सेंस (सामान्य समझ), और दो मददगार हाथ एक साथ काम कर रहे हैं। यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. डिटेक्टिव चरण: "मुझे किसे चुनना चाहिए?"

समस्या: जब आप ढेर को देखते हैं, तो यह बताना मुश्किल होता है कि एक शर्ट कहाँ खत्म होती है और दूसरी कहाँ शुरू होती है। एक रोबोट एक शर्ट पकड़ने की कोशिश कर सकता है लेकिन गलती से उसके नीचे उलझी हुई पैंट को भी ऊपर खींच सकता है।
समाधान: रोबोट एक हाई-टेक कैमरा सिस्टम (जिसे SAM2 कहा जाता है) का उपयोग करता है जो एक डिजिटल हाइलाइटर की तरह काम करता है। यह ढेर में मौजूद हर एक वस्तु के चारों ओर एक रेखा खींचने की कोशिश करता है।

  • "फाइन-ट्यूनिंग" का तरीका: कभी-कभी, हाइलाइटर गलत हो जाता है (शायद वह दो लाल शर्टों को एक बड़ा हिस्सा समझ लेता है)। रोबोट का "दिमाग" (एक विज़न-लैंग्वेज मॉडल, या VLM) तस्वीर को देखता है और कहता है, "रुको, यह सही नहीं लग रहा है।" फिर वह रोबोट को धीरे से ढेर को उठाने और हिलाने के लिए कहता है। यह हलचल रोबोट को कपड़ों को अलग होते देखने में मदद करती है, जिससे वह सही ढंग से रेखाएं फिर से खींच पाता है।
  • निर्णय: एक बार जब रोबोट ढेर को स्पष्ट रूप से देख लेता है, तो आप उसे बताते हैं, "मुझे लाल शर्ट चाहिए।" रोबोट का दिमाग ढेर को देखता है और निर्णय लेता है, "ठीक है, लाल शर्ट ऊपर है और सबसे आसानी से पहुँच में है। चलिए उसी से शुरुआत करते हैं।"

2. स्ट्रैटेजी (रणनीति) चरण: "मुझे कहाँ पकड़ना चाहिए?"

समस्या: भले ही रोबोट को पता हो कि कौन सी शर्ट पकड़नी है, लेकिन गलत जगह से पकड़ना एक आपदा हो सकती है। यदि आप एक शर्ट को किसी ढीले धागे से पकड़ते हैं, तो वह फट सकती है। यदि आप उसे नीचे के किनारे (हेम) से पकड़ते हैं, तो पूरा ढेर उसके साथ ऊपर खिंच सकता है।
समाधान: रोबोट एक विशेष "महसूस करने वाले" मैप का उपयोग करता है जिसे अफोर्डेंस मॉडल (Affordance Model) कहा जाता है। कल्पना कीजिए कि रोबोट शर्ट पर एक हीट मैप पेंट कर रहा है:

  • लाल धब्बे हैं "यहाँ पकड़ना बेहतरीन है!" (मजबूत, सुरक्षित, अन्य कपड़ों को नहीं खींचेगा)।
  • नीले धब्बे हैं "यहाँ न छुएं!" (कमजोर, उलझा हुआ, या जोखिम भरा)।
    रोबोट पकड़ने के लिए सबसे "लाल" (Reddest) स्थान चुनता है। यह सुनिश्चित करता है कि वह कपड़ों के पूरे ढेर को बिना खींचे, शर्ट को सफाई से ऊपर उठाए।

3. टीमवर्क चरण: "क्या मुझे मदद की ज़रूरत है?"

समस्या: कुछ कपड़े बहुत बड़े होते हैं (जैसे किंग-साइज़ कंबल) या बहुत लंबे होते हैं। केवल एक हाथ वाला रोबोट एक विशाल कंबल को उठाने में संघर्ष कर सकता है क्योंकि वह फर्श पर घिसट सकता है या उलझ सकता है।
समाधान: रोबोट के पास दो हाथ होते हैं (एक मास्टर और एक स्लेव)।

  • चेकअप: पहले हाथ द्वारा वस्तु को पकड़ने और उठाने के बाद, रोबमा रुकता है और अपने दिमाग से पूछता है: "क्या मैंने गलती से दो चीजें उठा ली हैं? क्या यह वस्तु सिर्फ एक हाथ के लिए बहुत भारी या लंबी है?"
  • टीम-अप: यदि उत्तर "हाँ" है, तो दूसरा हाथ काम में जुट जाता है। रोबोट एक ट्रैकिंग सिस्टम का उपयोग करता है ताकि दूसरे हाथ के लिए पकड़ने का सही स्थान मिल सके, ताकि वे एक साथ मिलकर चीज़ को सुचारू रूप से उठा सकें, जैसे दो लोग एक बड़ी मेज को उठाकर ले जाते हैं।
  • सेफ्टी नेट: यदि रोबोट को एहसास होता है कि उसने एक के बजाय दो शर्ट पकड़ ली हैं, तो वह तुरंत रुक जाता है, उन्हें वापस रख देता है, और फिर से कोशिश करता है। वह कभी भी गलत पकड़ बनाने के लिए ज़बरदस्ती नहीं करता।

यह एक बड़ी बात क्यों है?

पिछले रोबोटों को एक हाथ वाले छोटे बच्चों के रूप में सोचें जो खिलौनों के ढेर को उठाने की कोशिश कर रहे हैं। वे अक्सर बहुत अधिक चीज़ें पकड़ लेते हैं या फंस जाते हैं।

GarmentPile++ एक समझदार, धैर्यवान वयस्क की तरह है जिसके दो हाथ हैं:

  1. वे ढेर के बीच से देख सकते हैं (कैमरे और फाइन-ट्यूनिंग का उपयोग करके)।
  2. वे जानते हैं कि गंदगी से बचने के लिए ठीक कहाँ पकड़ना है (हीट मैप का उपयोग करके)।
  3. वे जानते हैं कि कब मदद के लिए पुकारना है यदि काम बहुत बड़ा है (दूसरे हाथ का उपयोग करके)।

यह प्रणाली रोबोट को अंततः कपड़ों के ढेर को सुरक्षित और कुशलता से संभालने की अनुमति देती है, जो भविष्य में हमारे कपड़े तह करने, लटकाने या तैयार होने में वास्तव में मदद करने वाले रोबोटों के लिए मार्ग प्रशस्त करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →