SI-Diff: A Framework for Learning Search and High-Precision Insertion with a Force-Domain Diffusion Policy
यह शोध पत्र SI-Diff प्रस्तुत करता है, जो एक एकीकृत बल-डोमेन डिफ्यूजन पॉलिसी फ्रेमवर्क है जो एक नवीन मोड-कंडीशनिंग तंत्र और एक सर्च टीचर पॉलिसी को एकीकृत करता है ताकि मजबूती से सर्च और उच्च-परिशुद्धता इंसर्शन को एक साथ सीखा जा सके, जो मौजूदा बेसलाइनों की तुलना में मिसअलाइनमेंट टॉलरेंस और ज़ीरो-शॉट ट्रांसफ़रेबिलिटी में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक चाबी को ताले में डालने की कोशिश कर रहे हैं, लेकिन आपने मोटे दस्ताने पहने हुए हैं और आप चाबी के छेद को ठीक से देख नहीं पा रहे हैं। आपको छूकर महसूस करना पड़ रहा है। यदि चाबी थोड़ी सी भी केंद्र से हट गई, तो आप उसे सीधे नीचे धकेल सकते हैं और वह फंस सकती है। यदि आपको पता हो कि छेद बिल्कुल कहाँ है, तो आप उसे पूरी तरह से स्लाइड कर सकते हैं। लेकिन क्या होगा अगर आपको एक रोबोट को यह काम करना हो, और रोबोट को ठीक से नहीं पता कि छेद कहाँ है?
यह पेपर SI-Diff पेश करता है, जो रोबोट्स के लिए एक नया "दिमाग" है जो ठीक इसी समस्या को हल करता है। यह रोबोट को दो बहुत अलग चीजें करने के लिए सिखाता है: जब वह खो जाता है तो छेद को खोजना (searching), और एक बार मिल जाने के बाद वस्तु को अंदर स्लाइड करना (inserting)।
यह कैसे काम करता है, इसे सरल उपमाओं के साथ नीचे समझाया गया है:
1. समस्या: दो अलग-अलग चालें
आमतौर पर, रोबोट्स को ये कार्य अलग-अलग सिखाए जाते हैं।
- खोज (The Search): यदि रोबोट खो गया है, तो उसे क्षेत्र में हाथ घुमाना और टटोलना होगा (जैसे अंधेरे में लाइट स्विच को महसूस करने वाला व्यक्ति)।
- इंसर्शन (The Insertion): एक बार मिल जाने के बाद, उसे बहुत नाजुक होना होगा, बस इतना ही हिलना-डुलना जिससे वस्तु बिना फंसे अंदर चली जाए (जैसे सुई में धागा डालना)।
अधिकांश रोबोट्स को ये दोनों काम करने के लिए अलग-अलग "मोड्स" या अलग सॉफ्टवेयर लोड करने पड़ते हैं। लेखक एक ऐसा सिंगल रोबोट ब्रेन बनाना चाहते थे जो बिना गियर बदले दोनों काम कर सके, ठीक एक मानव कर्मचारी की तरह जो बिना किसी औजार को बदले, छेद को महसूस कर सकता है और फिर पेग को अंदर स्लाइड कर सकता है।
2. समाधान: एक "डिफ्यूजन" पॉलिसी
टीम ने डिफ्यूजन पॉलिसी (Diffusion Policy) नामक AI का उपयोग किया।
- उपमा: डिफ्यूजन को एक मूर्तिकार की तरह समझें जो शोर (noise) से भरे मिट्टी के ब्लॉक से शुरू करता है और धीरे-धीरे शोर को हटाता जाता है जब तक कि एक सुंदर मूर्ति उभर न आए।
- रोबोट में: रोबमा अपने हाथ की गति का एक रैंडम अनुमान (guess) से शुरू करता है। यह AI इस अनुमान को "डी-नॉइज़" (denoise) करता है, यानी स्टेप-दर-स्टेप इसे परिष्कृत करता है, जब तक कि यह रोबोट के सेंसर (स्पर्श और बल) से मिली जानकारी के आधार पर खोजने या डालने की सही गति न ढूंढ ले।
3. गुप्त मंत्र: "मोड" स्विच
सबसे बड़ी चुनौती यह थी कि AI को बिना कोड बदले यह सिखाना कि कौन सी चाल चलनी है (खोज बनाम इंसर्शन)।
- उपमा: एक म्यूजिक प्लेयर की कल्पना करें जो "सर्च सॉन्ग" और "इंसर्शन सॉन्ग" दोनों चला सकता है। आमतौर पर, आपको दो अलग-अलग प्लेयर्स की आवश्यकता होगी। SI-Diff एक मोड प्रॉम्प्ट (Mode Prompt) का उपयोग करता है, जो एक "ट्रैक स्विच" बटन की तरह है।
- यह कैसे काम करता है: रोबोट को बताया जाता है, "अभी, आप सर्च मोड में हैं" या "अभी, आप इंसर्शन मोड में हैं।" यह छोटा सा निर्देश AI को उसी सेंसर डेटा को देखने लेकिन उसे अलग तरह से समझने के लिए कहता है। सर्च मोड में, यह उन पैटर्न को देखता है जिनका अर्थ है "खोज जारी रखें"। इंसर्शन मोड में, यह उन पैटर्न को देखता है जिनका अर्थ है "फिट होने के लिए धीरे से हिलाएं"।
4. शिक्षक: एक स्मार्ट गाइड से सीखना
रोबोट विशेषज्ञों को देखकर सबसे अच्छा सीखते हैं। लेखकों ने एक "टीचर पॉलिसी" (नियमों का एक सेट) बनाई है ताकि ट्रेनिंग डेटा जनरेट किया जा सके।
- सर्च टीचर: एक परफेक्ट स्पाइरल (सर्पिल) बनाने के बजाय, यह टीचर थोड़ा अराजक (chaotic) है। यह आठ अलग-अलग सर्च पैटर्न को रैंडम स्पीड और दिशा के साथ आजमाता है। यह एक ऐसे शिक्षक की तरह है जो आपको केवल एक तरीका नहीं दिखाता कि खोई हुई वस्तु को कैसे ढूँढा जाए, बल्कि आपको कई अलग-अलग तरीके दिखाता है ताकि आप अनुकूलन करना सीख सकें।
- इंसर्शन टीचर: यह टीचर जानता है कि एक फंसे हुए पेग को तंग जगह से बाहर निकालने के लिए कैसे हिलना-डुलना है, जो एक मानवीय सहज ज्ञान (instinct) है।
रोबोट इन "सफल" प्रयासों के हजारों उदाहरण देखता है और सफलता के अहसास की नकल करना सीखता है।
5. परिणाम: "शायद" से "निश्चित रूप से" तक
टीम ने अपने रोबोट का परीक्षण वर्तमान सर्वोत्तम तरीकों (जैसे TacDiffusion नामक सिस्टम) के विरुद्ध किया।
- पुराना तरीका: यदि पेग 2 मिलीमीटर (एक क्रेडिट कार्ड की मोटाई के बराबर) से अधिक हट गया था, तो रोबोट आमतौर पर विफल हो जाता था। यह बहुत कठोर था।
- SI-Diff: नया सिस्टम 5 मिलीमीटर तक के मिसअलाइनमेंट को संभाल सकता था। यह गलतियों के प्रति बहुत अधिक उदार था।
- जीरो-शॉट मैजिक (Zero-Shot Magic): भले ही इसे केवल एक वर्गाकार ब्लॉक पर प्रशिक्षित किया गया था, फिर भी यह अनदेखी आकृतियों जैसे सिलेंडर, त्रिकोण और यहाँ तक कि USB कनेक्टर को सफलतापूर्वक डाल सका। इसने केवल विशिष्ट आकार को नहीं, बल्कि खोजने और डालने की अवधारणा (concept) को सीखा।
सारांश
SI-Diff एक रोबोट कंट्रोल सिस्टम है जो एक ही AI मॉडल का उपयोग करके छेद को ढूँढने और किसी वस्तु को उसमें स्लाइड करने, दोनों काम करता है। एक "मोड स्विच" और विविध "टीचर" प्रदर्शनों से सीखकर, यह रोबोट्स को बहुत अधिक सक्षम बनाता है, जिससे वे बड़ी गलतियों को संभाल सकते हैं और उन आकृतियों के साथ काम कर सकते हैं जिन्हें उन्होंने पहले कभी नहीं देखा, और यह सब बिना किसी नए सॉफ्टवेयर या रीप्रोग्रामिंग के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।