ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints
यह शोध पत्र अनिश्चितता वाले एफ़ॉर्डेंस बाधाओं (affordance constraints) वाले गतिशील वातावरण में एम्बोडीड एजेंटों (embodied agents) के मूल्यांकन के लिए DynAfford नामक एक बेंचमार्क पेश करता है, और ADAPT प्रस्तावित करता है, जो एक प्लग-एंड-प्ले मॉड्यूल है जो डोमेन-अनुकूलित विज़न-लैंग्वेज मॉडल द्वारा संचालित स्पष्ट एफ़ॉर्डेंस रीजनिंग को एकीकृत करके प्लानिंग की मजबूती को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट बटलर को अपना घर साफ करने के लिए सिखा रहे हैं। आप उसे एक सरल निर्देश देते हैं: "गंदे कपड़ों को दराज में रख दो।"
एक मानक, "मूर्ख" रोबोट इसे सुनेगा, गंदे मोजे उठाएगा, और उन्हें सीधे दराज में ठूंस देगा। उसने निर्देशों का पूरी तरह से पालन किया, लेकिन वह कॉमन सेंस (सामान्य ज्ञान) की कसौटी में विफल रहा। वास्तविक दुनिया में, आप ऐसा नहीं करेंगे; आप पहले कपड़े धोएंगे।
यह पेपर, ADAPT, रोबots को केवल शाब्दिक अर्थ समझने के बजाय इंसानों की तरह सोचना सिखाने के बारे में है। यह रोबोट्स को टेस्ट करने का एक नया तरीका और उन्हें अस्त-व्यस्त, अप्रत्याशित स्थितियों को संभालने में मदद करने के लिए एक नया "ब्रेन अपग्रेड" पेश करता है।
यहाँ सरल शब्दों में इसका विवरण दिया गया है:
1. समस्या: "शाब्दिक रोबोट" का जाल (The "Literal Robot" Trap)
अधिकांश वर्तमान रोबोटों को आदर्श, पूर्ण दुनिया पर प्रशिक्षित किया जाता है। इन दुनियाओं में:
- माइक्रोवेव हमेशा खाली होता है।
- कपड़ा हमेशा साफ होता है।
- दराज हमेशा खुली होती है।
लेकिन वास्तविक जीवन अस्त-व्यस्त है। कभी-कभी माइक्रोवेव गर्म और भरा हुआ होता है। कभी-कभी कपड़ा चिकना या गंदा होता है। मौजूदा रोबोट ये बदलाव नोटिस नहीं करते। वे बस उस क्रिया को करने की कोशिश करते हैं, असफल होते हैं, और फिर भ्रमित हो जाते हैं या हार मान लेते हैं। उनमें कॉमनसेंस अफोर्डेंस (Commonsense Affordance) की कमी होती—यानी यह समझने की क्षमता कि क्या कोई वस्तु वास्तव में उपयोग के लिए तैयार है।
2. नया टेस्ट: DynAfford (द "रियलिटी चेक" एग्जाम)
लेखकों ने DynAfford नामक एक नया बेंचमार्क बनाया है। इसे रोबोट्स के लिए एक "सरप्राइज पॉप क्विज़" समझें।
- पुराना तरीका: टेस्ट यह मानता है कि किचन हमेशा पूरी तरह से सेट है।
- DynAfford का तरीका: टेस्ट काम करते समय ही चुपके से नियम बदल देता है।
- परिदृश्य: रोबोट को कहा जाता है "एक मग माइक्रोवेव में रखें।"
- ट्विस्ट: माइक्रोवेव पहले से ही अन्य बर्तनों से भरा हुआ है।
- लक्ष्य: एक स्मार्ट रोबोट को कहना चाहिए, "ओह, माइक्रोवेव व्यस्त है। मैं थोड़ी देर प्रतीक्षा करूँगा या कोई दूसरी जगह ढूँढूँगा," बजाय इसके कि वह मग को अंदर ठूंसने की कोशिश करे और उसे तोड़ दे।
यह बेंचमार्क रोबोट्स को यह महसूस करने के लिए मजबूर करता है कि वस्तुओं की "अवस्थाएँ" (states) होती हैं (साफ, गंदी, व्यस्त, खाली) और ये अवस्थाएँ समय के साथ बदलती हैं, और ये अवस्थाएँ महत्वपूर्ण हैं।
3. समाधान: ADAPT (द "स्मार्ट पॉज" बटन)
शाब्दिक रोबोट्स को ठीक करने के लिए, लेखकों ने ADAPT नामक एक मॉड्यूल बनाया है। आप ADAPT को एक ट्रैफिक पुलिस या सुरक्षा निरीक्षक के रूप में देख सकते हैं जो रोबोट के "दिमाग" (प्लानर) और उसके "हाथों" (क्रियाओं) के बीच खड़ा है।
ADAPT इन दो चरणों में कैसे काम करता है:
चरण 1: "क्या यह तैयार है?" की जाँच (Affordance Inference)
इससे पहले कि रोबोट किसी वस्तु को पकड़ने की कोशिश करे, ADAPT पूछता है: "क्या यह वस्तु अभी वास्तव में उपयोग योग्य है?"- यह वस्तु को देखता है (जैसे, क्या कपड़ा गंदा है? क्या माइक्रोवेव भरा हुआ है?)।
- यह एक विशेष AI मॉडल (एक "विज़न-लैंग्वेज मॉडल") का उपयोग करता है जिसे केवल अनुमान लगाने के बजाय विशेष रूप से इन विवरणों को पहचानने के लिए प्रशिक्षित किया गया है।
चरण 2: "अब क्या?" की योजना (Applicability Resolution)
यदि वस्तु तैयार नहीं है (जैसे, कपड़ा गंदा है), तो ADAPT रोबोट को विफल होने नहीं देता। इसके बजाय, यह रुकता है और कहता है: "ठीक है, हम अभी गंदे कपड़े को दराज में नहीं रख सकते। चलो इसे पहले धोते हैं।"- यह योजना में एक नया चरण जोड़ देता है (कपड़ा धोना)।
- एक बार जब शर्त पूरी हो जाती है, तो यह रोबलेट को मूल लक्ष्य के साथ जारी रखने देता है।
4. सीक्रेट सॉस: विशेष प्रशिक्षण (Specialized Training)
लेखकों ने कुछ दिलचस्प पाया: यह जांचने के लिए कि क्या कपड़ा गंदा है, एक विशाल, सामान्य-उद्देश्य वाले AI (जैसे GPT-4o) का उपयोग करना सबसे अच्छा समाधान नहीं था। यह एक कार का टायर पंचर है या नहीं, यह जांचने के लिए एक सुपर-स्मार्ट प्रोफेसर का उपयोग करने जैसा था—वे बहुत कुछ जानते हैं, लेकिन वे इस विशिष्ट कार्य के लिए पर्याप्त विशेषज्ञ नहीं हैं।
लेखकों ने एक छोटे, विशेष AI मॉडल को (एक तकनीक जिसका नाम LoRA है) विशेष रूप से "घरेलू कार्यों" पर प्रशिक्षित किया। यह मॉडल गंदे कपड़ों और व्यस्त माइक्रोवेव को पहचानने में विशेषज्ञ बन गया, जिसने बड़े सामान्य AI मॉडल्स की तुलना में बेहतर सटीकता दिखाई।
5. परिणाम: रोबोट जो हार नहीं मानते
जब उन्होंने इस सिस्टम का परीक्षण किया:
- ADAPT के बिना: रोबोट लगातार विफल होते थे जब चीजें अस्त-व्यस्त होती थीं। वे गंदे कपड़े का उपयोग करने या भरे हुए माइक्रोवेव के साथ कोशिश करते थे और लूप में फंस जाते थे।
- ADAPT के साथ: रोबोट बहुत अधिक मजबूत (robust) हो गए। उन्होंने प्रतीक्षा करके, सफाई करके या विकल्प ढूंढकर "सरप्राइज" स्थितियों को सफलतापूर्वक संभाला।
- एक परीक्षण में, एक रोबोट जो आमतौर पर 797 स्टेप्स में विफल हो जाता था (और हार मान लेता था), उसने केवल 206 स्टेप्स में कार्य पूरा किया क्योंकि उसे पता था कि "व्यस्त माइक्रोवेव" वाली स्थिति को कैसे संभालना है।
बड़ी तस्वीर (The Big Picture)
यह पेपर हमें सिखाता है कि रोबोट्स को वास्तव में हमारे घरों में रहने के लिए, वे केवल आदेशों का पालन नहीं कर सकते। उन्हें संदर्भ (Context) को समझना होगा।
- पुराना रोबोट: "आपने कहा 'इसे दराज में रखो।' मैंने इसे दराज में रख दिया। मैं समाप्त हूँ।" (भले ही वह गंदा हो)।
- ADAPT रोबोट: "आपने कहा 'इसे दराज में रखो।' लेकिन रुको, यह गंदा है! मैं पहले इसे धोऊंगा, फिर इसे दराज में रख दूंगा। लीजिए, अब यह हो गया।"
यह एक ऐसे रोबोट के बीच का अंतर है जो एक अंधा अनुयायी है और एक ऐसे रोबोट के बीच का अंतर है जो एक विचारशील साथी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।