← नवीनतम पेपर
💻 computer science

Kitchen Robotic Manipulation utilizing Foundation Models

यह शोध पत्र किचन रोबोटिक मैनिपुलेशन के लिए एक मॉड्यूलर परसेप्शन पाइपलाइन प्रस्तुत करता है जो मजबूत 6D पोज़ एस्टीमेशन और ग्रैस्प प्लानिंग प्राप्त करने के लिए कई फाउंडेशन मॉडल्स को एकीकृत करता है, जो एक क्लटर्ड बेंचमार्क पर 89.12% ADI और डिश ट्रांसफर और कप स्टैकिंग जैसे कार्यों के लिए भौतिक रोबोटों पर सफल ज़ीरो-शॉट डिप्लॉयमेंट प्रदर्शित करता है।

मूल लेखक: Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

प्रकाशित 2026-08-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक अस्त-व्यस्त रसोई में मदद करने के लिए सिखाने की कोशिश कर रहे हैं। यह सुनने में सरल लगता है, लेकिन एक मशीन के लिए, रसोई अराजकता का एक दुस्वप्न है। एक कारखाने के विपरीत जहाँ हर उपकरण ठीक एक ही स्थान पर होता है, एक रसोई बर्तनों के ढेर, एक-दूसरे के पीछे छिपी वस्तुओं और फिसलन भरी, चमकदार सतहों से भरी होती है। एक कॉफी मग को उठाने के लिए, रोबोट को पहले उसे स्पष्ट रूप से "देखने" की आवश्यकता है, यह समझना है कि वह वास्तव में 3D स्थान में कहाँ है, और यह जानना है कि पूरे ढेर को गिराए बिना उसे कैसे पकड़ा जाए। यह रोबोटिक परसेप्शन (robotic perception) की दुनिया है: मशीनों को ऐसी आँखें और मस्तिष्क देने का विज्ञान जो एक अस्त-व्यस्त, परिवर्तनशील दुनिया को समझ सकें।

इसे करने के लिए, वैज्ञानिक फाउंडेशन मॉडल्स (Foundation Models) विकसित कर रहे हैं। इन्हें ऐसे सुपर-स्मार्ट छात्रों के रूप में सोचें जिन्होंने किसी भी विशिष्ट कार्य को शुरू करने से पहले इंटरनेट पर लगभग हर किताब पढ़ी है और लगभग हर तस्वीर देखी है। क्योंकि उन्होंने इतना कुछ देखा है, उन्हें हर बार एक नए कमरे में प्रवेश करने पर शून्य से फिर से सिखाने की आवश्यकता नहीं होती; वे केवल अपने सामान्य ज्ञान का उपयोग करके एक "कप" को पहचान सकते हैं, भले ही उन्होंने पहले उस विशिष्ट कप को न देखा हो। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम इन शक्तिशाली, प्री-ट्रेंड "मस्तिष्क" को सीधे एक रोबोट के शरीर में लगा सकते हैं ताकि वह हर घर के लिए महीनों के कस्टम प्रशिक्षण की आवश्यकता के बिना घरेलू काम संभाल सके?


किचन रोबोट का नया "स्विस आर्मी नाइफ" मस्तिष्क

इस शोध पत्र में, शोधकर्ताओं की एक टीम एक रोबोटिक "परसेप्शन पाइपलाइन" बनाती है जो एक रोबोटिक हाथ को अव्यवस्थित किचन सिंक में नेविगेट करने और बर्तन हिलाने में मदद करने के लिए डिज़ाइन की गई है। एक विशाल, कठोर मस्तिष्क बनाने के बजाय जो केवल एक विशिष्ट रसोई के लिए काम करता है, उन्होंने एक मॉड्यूलर सिस्टम (modular system) बनाया है। एक उच्च श्रेणी के कैमरे की कल्पना करें जहाँ आप क्या शूट कर रहे हैं उसके आधार पर लेंस, सेंसर और प्रोसेसर को बदल सकते हैं। यह रोबोट सिस्टम भी उसी तरह काम करता है: यह शोधकर्ताओं को विभिन्न "फाउंडेशन मॉडल्स" को आपस में मिलाने (mix and match) की अनुमति देता है ताकि यह देखा जा सके कि बर्तनों को खोजने और पकड़ने के लिए कौन सा संयोजन सबसे अच्छा काम करता है।

रोबोट का काम सिंक में रखे प्लेटों, कपों और कटोरे के ढेर को देखना, प्रत्येक वस्तु की सटीक स्थिति (इसका 6D पोज़, जिसका अर्थ है 3D स्थान में इसका स्थान और इसका कोण) का पता लगाना, और फिर इसे उठाने का एक सुरक्षित तरीका तय करना है। टीम ने वास्तविक दुनिया के 20 किचन दृश्यों के एक कस्टम डेटासेट पर इस प्रणाली का परीक्षण किया, जिसमें बर्तनों के ढेर और छिपी हुई वस्तुएं शामिल थीं।

सफलता का नुस्खा

शोधकर्ताओं ने केवल अनुमान नहीं लगाया कि किन मॉडल्स का उपयोग करना है; उन्होंने दृश्य (visual) और ज्यामितीय (geometric) मॉडल्स के 24 विभिन्न संयोजनों का व्यवस्थित रूप से परीक्षण किया। उन्होंने इस प्रणाली को एक रेसिपी की तरह माना, जिसमें सही स्वाद खोजने के लिए सामग्री को बदला गया।

  • आँखें (दृश्य मॉडल): ये मॉडल 2D चित्रों को देखते हैं ताकि यह पहचाना जा सके कि वहाँ कौन सी वस्तुएं मौजूद हैं।
  • हाथ (ज्यामितीय मॉडल): ये मॉडल वस्तुओं के 3D आकार को देखते हैं ताकि उनकी संरचना को समझा जा सके।
  • गोंद (फीचर फ्यूजन): उन्होंने पाया कि केवल आँखों या हाथों का उपयोग करना पर्याप्त नहीं था। असली 'सीक्रेट सॉस' 2D इमेज फीचर्स को 3D पॉइंट-क्लाउड फीचर्स के साथ फ्यूज (fuse) करना था। यह एक ऐसे जासूस की तरह है जो न केवल फोटो से चेहरा पहचानता है बल्कि व्यक्ति के शरीर के आकार को भी समझता है ताकि यह जान सके कि हाथ कैसे मिलाना है।

संख्याओं के विश्लेषण के बाद, टीम ने एक "चैंपियन" कॉन्फ़िगरेशन की खोज की: LLMDet (वस्तुओं को पहचानने के लिए), SAMv2 (वस्तु को बैकग्राउंड से अलग करने के लिए), DINOv2 (बारीक विवरणों को पहचानने के लिए), और GeoTransformer (3D ज्यामिति को समझने के लिए)। जब ये चारों मिलकर काम करते हैं, तो रोबोट 89.12% का ADI (औसत अविभेदित दृश्यों की दूरी) प्राप्त करता है। सरल शब्दों में, इसका अर्थ है कि रोबोट एक बर्तन की स्थिति और कोण का अविश्वसनीय सटीकता के साथ अनुमान लगा सकता था, भले ही वह बर्तन आंशिक रूप से छिपा हुआ हो या अव्यवस्था से घिरा हो।

वास्तविक दुनिया का प्रमाण

सबसे अच्छी बात? वे केवल कंप्यूटर सिमुलेशन तक ही सीमित नहीं रहे। वे इस "चैment" कॉन्फ़िगरेशन को लेकर एक वास्तविक रसोई में एक भौतिक रोबोटिक हाथ पर ले गए। उन्होंने इसे सफलतापूर्वक करते हुए देखा:

  1. बर्तनों को सिंक से डिशवॉशर में स्थानांतरित करना।
  2. काउंटर पर कपों को एक के ऊपर एक रखना (stacking)।
  3. एक अस्त-व्यस्त सिंक से वस्तुओं को उठाना।

रोबोट ने यह सब उस विशिष्ट रसोई के लिए बिना किसी री-ट्रेनिंग (retraining) के किया जिसमें वह था। उसे यह सीखने की आवश्यकता नहीं थी कि उस विशेष घर में "कप" कैसा दिखता है; उसने बस अपने प्री-ट्रेंड फाउंडेशन ज्ञान का उपयोग किया। वास्तविक दुनिया के परीक्षणों की एक श्रृंखला में, रोबोट ने अपने 87.5% प्रयासों में सफलता प्राप्त की (296 परीक्षणों में से 259 सफलताएं)।

जहाँ यह लड़खड़ाता है

यह शोध पत्र इस बात के प्रति ईमानदार है कि यह अभी भी कहाँ पूर्ण नहीं है। विफलता का मुख्य कारण रोबोट का "मस्तिष्क" वस्तु को देखने में विफल होना नहीं था; बल्कि रोबोट का "हाथ" फिसलना था। रोबोट चीजों को धीरे से पकड़ने के लिए एक कंप्लायंट ग्रिपर (एक नरम, अनुकूलन योग्य हाथ) का उपयोग करता है, लेकिन कभी-कभी परिवहन के दौरान वस्तु फिसल जाती थी, विशेष रूप से भीड़भाड़ वाले सिंक में कपों को रखते समय। रोबलेट कभी-कभी गलत जगह पकड़ने की कोशिश भी करता था यदि डिटेक्शन थोड़ा भी गलत हो। हालाँकि, लेखकों का कहना है कि ये ग्रिपर की भौतिक चुनौतियाँ हैं, न कि स्वयं परसेप्शन सिस्टम की विफलताएँ।

यह क्यों महत्वपूर्ण है

यह कार्य बताता है कि हमें हर घर के लिए एक नया, कस्टम रोबोट मस्तिष्क बनाने की आवश्यकता नहीं है। इसके बजाय, हम एक लचीले, मॉड्यूलर सिस्टम का उपयोग कर सकते हैं जो काम को संभालने के लिए सर्वश्रेष्ठ उपलब्ध "फाउंडेशन मॉडल्स" को बदल सकता है। यह सिद्ध करता है कि दृश्य और ज्यामितीय बुद्धिमत्ता के सही मिश्रण को जोड़कर, रोबots बिना किसी शिक्षक द्वारा हर कार्य सिखाए, मानव घरों की अस्त-व्यस्त और अप्रत्याशित वास्तविकता के अनुकूल हो सकते हैं। हालाँकि रोबोट की पकड़ को मजबूत करने और उसकी गतिविधियों को सुचारू बनाने पर अभी भी काम किया जाना बाकी है, लेकिन यह पाइपलाइन उन रोबोटों की ओर एक व्यावहारिक, स्केलेबल मार्ग प्रदान करती है जो वास्तव में बर्तनों के काम में हमारी मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →