Learning Lifted Action Models from Traces with Minimal Information About Actions and States
यह शोध पत्र कार्यों और अवस्थाओं दोनों के बारे में आंशिक जानकारी वाले ट्रेसेस (traces) से STRIPS+ एक्शन डोमेन सीखने के लिए एल्गोरिदम और पूर्णता परिणाम प्रस्तुत करता है, जो विशिष्ट स्टेट प्रेडिकेट्स की शून्य, पूर्ण या स्थानीय दृश्यता (observability) वाले परिदृश्यों पर विचार करके पिछली सीमाओं को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल बोर्ड गेम, जैसे कि शतरंज या स्लाइडिंग-टाइल पहेली, के नियमों को समझने की कोशिश कर रहे हैं, लेकिन आपके पास एक बहुत ही अजीब समस्या है: आप बोर्ड देख नहीं सकते।
आप केवल खिलाड़ियों द्वारा किए गए मूव्स (moves) को देख सकते हैं। आप देखते हैं कि एक पीस "A" से "B" पर गया, या एक खिलाड़ी एक टोकन उठाता है। लेकिन आपको यह नहीं पता कि कौन सा पीस हिला, वह कहाँ से शुरू हुआ था और कहाँ खत्म हुआ, या मूव से पहले और बाद में बोर्ड कैसा दिखता था। आप केवल क्रियाओं (actions) की एक श्रृंखला को देखकर गेम की रूलबुक को रिवर्स-इंजीनियर करने की कोशिश कर रहे हैं।
यह उस शोध पत्र का मूल आधार है जिसका शीर्षक है "Learning Lifted Action Models from Traces with Minimal Information."
यहाँ लेखकों द्वारा किए गए कार्यों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।
समस्या: "बहुत अधिक जानकारी" का जाल (The "Too Much Information" Trap)
अतीत में, कंप्यूटर वैज्ञानिकों ने AI को ये नियम सिखाने की कोशिश की। उनके पास दो मुख्य दृष्टिकोण थे, लेकिन दोनों में कमियां थीं:
- "फुल बोर्ड" दृष्टिकोण (The "Full Board" Approach): AI को पूरा बोर्ड स्टेट (हर पीस की स्थिति) और मूव दिया जाता था।
- कमी: वास्तविक दुनिया में, हम शायद ही कभी पूरा बोर्ड देख पाते हैं। साथ भी, नियम अक्सर बहुत अधिक विवरण मांगते हैं। उदाहरण के लिए, किसी पहेली में एक टाइल को हिलाने के लिए, पुराने नियमों में आपको टाइल की वर्तमान जगह, उसकी अगली जगह और खाली जगह, तीनों को बताना आवश्यक था। लेकिन निर्णय लेने के लिए, आपको वास्तव में केवल "बाएं मुड़ें" (Move Left) जानने की आवश्यकता होती है। अतिरिक्त विवरण निर्णय लेने वाले के लिए केवल शोर (noise) हैं।
- "केवल एक्शन" दृष्टिकोण (The "Action Only" Approach): AI को केवल मूव्स की सूची दी जाती थी (जैसे, "बाएं मुड़ें," "उठाएं")।
- कमी: बोर्ड देखे बिना, AI यह नहीं समझ पाता कि वह क्या हिला रहा है। उसे यह नहीं पता होता कि "बाएं मुड़ें" का अर्थ रोबोट को हिलाना है, कार को, या किसी बॉक्स को।
समाधान: एक नई भाषा (STRIPS+)
लेखकों ने एक मध्य मार्ग पेश किया जिसे STRIPS+ कहा जाता है। इसे एक स्मार्ट तरीके से नियम लिखने के रूप में सोचें।
पुराने तरीके (STRIPS) में, एक नियम एक सख्त रूप जैसा दिख सकता था:
Move(Robot, CurrentCell, NextCell)
नए तरीके (STRIPS+) में, नियम एक पहेली की तरह है:
Move()
नियम कहता है: "यदि किसी सेल में एक रोबोट है, और उसके दाईं ओर एक सेल है, तो आप हिल सकते हैं।" कंप्यूटर को यह पता लगाना होगा कि कौन सा रोबोट और कौन से सेल उस विवरण में फिट बैठते हैं। यह एक अपराध सुलझाने वाले जासूस की तरह है जहाँ संदिग्ध का वर्णन नाम "जॉन स्मिथ" के बजाय केवल "लाल टोपी पहने व्यक्ति" के रूप में किया गया है।
नए एल्गोरिदम: SIFT+ और SYNTH+
शोध पत्र इन रहस्यों को सुलझाने के लिए दो नए "जासूसों" (एल्गोरिदम) को प्रस्तुत करता है।
1. SIFT+ (द "एक्शन-ओनली" डिटेक्टिव)
- यह क्या करता है: यह केवल मूव्स की सूची को देखकर नियमों को सीखता है, जिसमें बोर्ड का शून्य दृश्य होता है।
- यह कैसे काम करता है: यह "Mutex Features" नामक एक ट्रिक का उपयोग करता है।
- उपमा: कल्पना कीजिए कि आप देखते हैं कि एक खिलाड़ी एक कप उठाता है। आप कप को नहीं देख पा रहे हैं, लेकिन आप जानते हैं कि एक खिलाड़ी एक समय में केवल एक ही कप पकड़ सकता है। यदि खिलाड़ी एक कप उठाता है, तो उसने वह कप रख दिया होगा जो वह पकड़े हुए था।
- SIFT+ इन "परस्पर अनन्य" (mutually exclusive) पैटर्न को खोजता है। यह महसूस करता है, "आह, जब भी यह क्रिया होती है, तो उस वस्तु के बारे में कुछ सच होना चाहिए जिसे पकड़ा जा रहा है।" यह खाली जगहों को भरने के लिए नए "प्रेडिकेट्स" (जैसे
is_holdingजैसे विचार) का आविष्कार करता है।
- परिणाम: यह पूर्ण नियम पुस्तिका सीख सकता है भले ही एक्शन के नामों से लगभग सभी विवरण हटा दिए गए हों।
2. SYNTH+ (द "पार्शियल व्यू" डिटेक्टिव)
- यह क्या करता है: यह तब सीखता है जब वह बोर्ड के कुछ हिस्सों को देख सकता है, लेकिन सभी को नहीं।
- यह कैसे काम करता है: यह नए STRIPS+ भाषा की "पहेली सुलझाने" की क्षमता को SIFT+ के "आविष्कार" कौशल के साथ जोड़ता है।
- उपमा: कल्पना कीजिए कि आप एक डिलीवरी ड्राइवर को देख रहे हैं। आप ड्राइवर की लोकेशन (पूर्णतः दृश्य भाग) देख सकते हैं, लेकिन आप ट्रक के अंदर रखे पैकेज नहीं देख सकते। हालांकि, आप जानते हैं कि एक ड्राइवर एक बार में केवल एक ही पैकेज ले जा सकता है।
- SYNTH+ दृश्य स्थान का उपयोग अदृश्य पैकेज का पता लगाने के लिए करता है। यह पूछता है, "यदि ड्राइवर दरवाजे पर है, और उसने अभी कुछ 'ड्रॉप' किया है, तो उसके हाथ में क्या रहा होगा?"
- ट्विस्ट: शोध पत्र "लोकल ऑब्जर्वेबिलिटी" (Local Observability) पेश करता है। इसका अर्थ है कि आपको पूरा बोर्ड देखने की आवश्यकता नहीं है। आपको केवल वर्तमान क्रिया के लिए प्रासंगिक हिस्से देखने की आवश्यकता है।
- उदाहरण: यदि एक रोबोट "बाएं" मुड़ता है, तो आपको केवल उसके बाईं ओर के सेल को देखने की आवश्यकता है। आपको मैप के दूसरी ओर के सेल को देखने की आवश्यकता नहीं है। यह सीखने की प्रक्रिया को बहुत अधिक वास्तविक बनाता है।
"डिपेंडेंसी ग्राफ" (द रोडमैप)
यह सुनिश्चित करने के लिए कि ये जासूस एक लूप में न फंस जाएं, लेखकों ने एक मानचित्र बनाया जिसे डिपेंडेंसी ग्राफ कहा जाता है।
- इसे एक फ्लोचार्ट के रूप में सोचें। "नियम A" सीखने के लिए, आपको "तथ्य B" जानने की आवश्यकता हो सकती है। "तथ्य B" सीखने के लिए, आपको "नियम C" की आवश्यकता हो सकती है।
- शोध पत्र यह सिद्ध करता है कि जब तक इस फ्लोचार्ट में कोई गोलाकार लूप (जहाँ A को B की आवश्यकता है, B को C की, और C को A की) नहीं है, एल्गोरिदम चरणों में नियम सीख सकता है, जो उन चीजों से शुरू होता है जिन्हें आप देख सकते हैं और पीछे की ओर काम करता है जिन्हें आप नहीं देख सकते।
परिणाम: क्या यह काम कर गया?
लेखकों ने इन जासूसों का परीक्षण Blocksworld (ब्लॉक स्टैकिंग), Delivery (पैकेज भेजना), और Sokoban (बॉक्स धकेलना) जैसे क्लासिक पज़ल्स पर किया।
- परीक्षण: उन्होंने एल्गोरिदम को ऐसे ट्रेसेस (traces) दिए जहाँ 50% से 90% जानकारी छिपी हुई थी।
- परिणाम:
- SIFT+ ने केवल एक्शन लिस्ट से नियमों को सफलतापूर्वक सीखा, और पैटर्न को नोटिस करके गायब विवरणों (जैसे "कौन सा ब्लॉक ऊपर है") को रिकवर कर लिया।
- SYNTH+ ने नियमों को तब भी सीखा जब "बोर्ड" का अधिकांश हिस्सा छिपा हुआ था, बशर्ते कि महत्वपूर्ण हिस्से (जैसे एजेंट का स्थान) दृश्यमान थे।
- लगभग हर परीक्षण में, एल्गोरिदम ने 100% सटीकता प्राप्त की, और छिपी हुई नियम पुस्तिकाओं का सही ढंग से पुनर्निर्माण किया।
सारांश
यह शोध पत्र इस बारे में है कि कंप्यूटर को तब नियम सिखाना जब उन्हें बहुत कम जानकारी दी जाती है।
- पुराना तरीका: "यह रहा बोर्ड, यह रहा मूव। नियम सीखो।" (बहुत अधिक जानकारी की आवश्यकता)।
- नया तरीका: "यह मूव्स की एक सूची है। आप खिलाड़ी का स्थान देख सकते हैं, लेकिन वस्तुओं को नहीं। नियमों को समझें।"
- बड़ी उपलब्धि: एक स्मार्ट भाषा (STRIPS+) और "क्या सच होना ही चाहिए" (Mutex Features) के आधार पर गायब तथ्यों को "आविष्कृत" करने के चतुर तरीके का उपयोग करके, AI पूरी लॉजिक को सीख सकता है, बिना दुनिया का पूर्ण दृश्य प्राप्त किए।
शोध पत्र का दावा है कि यह AI को प्राकृतिक, अपूर्ण अवलोकनों से सीखने में सक्षम बनाने की दिशा में एक बड़ा कदम है, जो मनुष्यों के सीखने के तरीके के समान है—जो एक पूर्ण, डेटा-समृद्ध मैनुअल के बजाय दूसरों को देखकर सीखते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।