← नवीनतम पेपर
🤖 AI

Answer-Set-Programming-based Abstractions for Reinforcement Learning

यह शोध पत्र ब्लॉक्स वर्ल्ड (Blocks World) और मिनीग्रिड (Minigrid) जैसे डोमेन में प्रभावी स्टेट-स्पेस एब्स्ट्रैक्शन के लिए डिक्लेरेटिव लॉजिकल रिप्रेजेंटेशन का लाभ उठाने हेतु रिलेशनल रिइन्फोर्समेंट लर्निंग को बढ़ाने के लिए CARCASS फ्रेमवर्क के एक आंसर-सेट प्रोग्रामिंग (ASP) कार्यान्वयन का प्रस्ताव और मूल्यांकन करता है।

मूल लेखक: Rafael Bankosegger, Thomas Eiter, Johannes Oetsch

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rafael Bankosegger, Thomas Eiter, Johannes Oetsch

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पहेली सुलझाना सिखाने की कोशिश कर रहे हैं, जैसे कि ब्लॉक्स को एक के ऊपर एक रखना या भूलभुलैया (maze) से बाहर निकलना। समस्या यह है कि दुनिया बहुत विशाल है। यदि आप रोबोट को हर एक छोटी स्थिति के बारे में सिखाने की कोशिश करते हैं (हर विशिष्ट ब्लॉक व्यवस्था, हर विशिष्ट दीवार का लेआउट), तो इसमें बहुत लंबा समय लग जाएगा। रोबोट विकल्पों की विशाल संख्या से अभिभूत हो जाएगा, जिसे वैज्ञानिक "कर्स ऑफ डायमेंशनैलिटी" (curse of dimensionality) कहते हैं।

यह शोध पत्र एक चतुर शॉर्टकट प्रस्तावित करता है: रोबोट को हर छोटी बारीकी के बारे में सिखाने के बजाय, उसे बड़ी तस्वीर (big picture) देखना सिखाएं, जिसका उपयोग एन्सर-सेट प्रोग्रामिंग (ASP) नामक तर्क के एक विशेष प्रकार में किया जाता है।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. पुराना तरीका बनाम नया तरीका

  • पुराना तरीका (Prolog): कल्पना कीजिए कि एक रोबोट ब्लॉक्स को स्टैक करना सीख रहा है। पुराना तरीका (CARCASS नामक फ्रेमवर्क में उपयोग किया गया) एक विशाल, कठोर निर्देश पुस्तिका की तरह है जो एक ऐसी भाषा में लिखी गई है जिसमें सख्त क्रम की आवश्यकता होती है। रोबोट को निर्देशों को लाइन-दर-लाइन पढ़ना होता है, और यदि वह एक भी चरण चूक जाता है, तो सब कुछ टूट जाता है। यह काम करता है, लेकिन यह थोड़ा बोझिल है और जटिल नियमों को संभालने के लिए इसमें बहुत अधिक मैन्युअल कोडिंग की आवश्यकता होती है।
  • नया तरीका (ASP): लेखकों ने उस कठोर पुस्तिका को एक घोषणात्मक "विश लिस्ट" (declarative "wish list") से बदल दिया है। रोबोट को यह बताने के बजाय कि उत्तर खोजने के लिए कदम-दर-कदम कैसे खोजा जाए, वे बस रोबोट को यह बताते हैं कि दुनिया के नियम क्या हैं। फिर ASP सिस्टम स्वयं उन नियमों को पूरा करने का सबसे अच्छा तरीका निकाल लेता है। यह एक शेफ को सामग्री की सूची और एक लक्ष्य देने जैसा है ("केक बनाना") न कि एक चरण-दर-चरण रेसिपी देने जैसा। शेफ (कंप्यूटर) सबसे अच्छा रास्ता खोजने के लिए अपने स्वयं के तर्क का उपयोग करता है।

2. "एब्स्ट्रैक्शन" (Abstraction) का कमाल

मुख्य विचार एब्स्ट्रैक्शन (Abstraction) है। इसे एक मानचित्र (map) देखने की तरह समझें।

  • कंक्रीट दृश्य (Concrete View): आप सड़क पर हर एक पेड़, गड्ढा और पक्षी देखते हैं। यह संसाधित करने के लिए बहुत अधिक जानकारी है।
  • एब्स्ट्रैक्ट दृश्य (Abstract View): आप केवल सड़कों, शहरों के नाम और प्रमुख स्थलों को देखते हैं।

लेखकों ने एक प्रणाली बनाई है जो स्वचालित रूप से "कंक्रीट दृश्य" (अव्यवस्थित वास्तविक दुनिया) को सीखने से पहले "एब्स्ट्रैक्ट दृश्य" (सरलीकृत मानचित्र) में अनुवादित करती है।

  • ब्लॉक्स वर्ल्ड में: इस बात की चिंता करने के बजाय कि कौन सा विशिष्ट ब्लॉक किसके ऊपर है, एब्स्ट्रैक्ट दृश्य बस यह पूछता है: "क्या कोई टावर है जिसे पूरा करने की आवश्यकता है?" या "क्या सबसे ऊपर वाला ब्लॉक खाली है?"
  • मिनीग्रिड (MiniGrid - भूलभुलैया) में: हर दीवार के निर्देशांक (coordinates) को ट्रैक करने के बजाय, एब्स्ट्रैक्ट दृश्य पूछता है: "क्या आगे कोई चाबी है?" या "क्या मेरे रास्ते में कोई बंद दरवाजा है?"

3. उन्होंने इसका परीक्षण कैसे किया

उन्होंने इस नए सिस्टम को दो प्रसिद्ध पहेली खेलों में परखा:

  1. ब्लॉक्स वर्ल्ड (Blocks World): एक विशिष्ट क्रम में ब्लॉक्स को स्टैक करना।
  2. मिनीग्रिड (MiniGrid): एक रोबोट भूलभुलैया में चाबी खोजने और दरवाजा खोलने के लिए रास्ता खोज रहा है।

उन्होंने अपने इस नए "ASP एब्स्ट्रैक्ट" रोबोट की तुलना एक "कंक्रीट" रोबोट से की, जिसने सरलीकृत मानचित्र के बिना सीखने की कोशिश की।

4. परिणाम

परिणाम स्पष्ट थे:

  • तेजी से सीखना: एब्स्ट्रैक्ट रोबोट बहुत तेजी से सीख गया। उसे जीतने का तरीका समझने के लिए बहुत कम प्रयासों (samples) की आवश्यकता पड़ी।
  • बेहतर स्थिरता: एब्स्ट्रैक्ट रोबोट आसानी से भ्रमित नहीं हुआ। एक बार जब उसने एक अच्छी रणनीति सीख ली, तो वह उस पर टिका रहा।
  • उच्च गुणवत्ता: एब्स्ट्रैक्ट रोबोट द्वारा सीखी गई रणनीतियाँ बहुत अच्छी थीं, जो अक्सर एक छोटे प्रशिक्षण काल के बाद पहेलियों को सफलतापूर्वक हल करती हैं।

5. यह क्यों महत्वपूर्ण है

शोध पत्र का दावा है कि इस विशिष्ट प्रकार के तर्क (ASP) का उपयोग करके, हम एक ऐसा ढांचा बना सकते हैं जहाँ डोमेन ज्ञान (domain knowledge) (जो हम पहले से दुनिया के बारे में जानते हैं) को रोबोट की सीखने की प्रक्रिया में आसानी से शामिल किया जा सकता है।

इसे इस तरह सोचिए: यदि आप एक बच्चे को गाड़ी चलाना सिखा रहे हैं, तो आप इंजन के दहन (combustion) की भौतिकी समझाने से शुरुआत नहीं करते हैं। आप उन्हें नियम देते हैं: "लाल बत्ती पर रुकें," "दोनों तरफ देखें।" यह पेपर दिखाता है कि कैसे हम रोबोटों को गणितीय रूप से सटीक लेकिन लिखने और समझने में आसान उच्च-स्तरीय नियम दे सकते हैं।

संक्षेप में: लेखकों ने एक ऐसा अनुवादक बनाया है जो जटिल, वास्तविक दुनिया की समस्याओं को साफ, सरल तार्किक पहेलियों में बदल देता है। रोबोट को इन सरल पहेलियों से सीखने देकर, वह जटिल वास्तविक दुनिया की समस्याओं को शून्य से सीखने की तुलना में बहुत तेजी से और अधिक विश्वसनीयता के साथ हल करना सीख जाता है। उन्होंने इसे ब्लॉक-स्टैकिंग और भूलभुलैया वाले कार्यों पर सिद्ध किया है, जो यह दर्शाता है कि यह AI को अधिक स्मार्ट और कुशल बनाने के लिए एक आशाजनक उपकरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →