From Intermediate States to Novel Outcomes: Intervention-Sensitive Visual Process Grounding in an Artificial Cognitive System
यह शोध पत्र एक भाषा-मुक्त कार्य प्रस्तुत करता है जो यह प्रदर्शित करता है कि एक कृत्रिम संज्ञानात्मक प्रणाली नवीन परिणामों को प्राप्त करने के लिए हस्तक्षेप-संवेदनशील दृश्य प्रक्रिया नियमों (विभिन्न मध्यवर्ती अवस्थाओं के बीच अंतर करना) का अनुमान लगा सकती है और उन्हें लागू कर सकती है, जो केवल अंतिम परिणाम-आधारित नियंत्रणों से काफी बेहतर प्रदर्शन करती है और यह दिखाती है कि प्रत्यक्ष हस्तक्षेप पर्यवेक्षण के बिना भी मध्यवर्ती छवि प्रतिस्थापन द्वारा स्पष्ट प्रक्रिया कोड को उलटा जा सकता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
जासूस की दुविधा: क्यों "कैसे" का महत्व "क्या" से अधिक है
कल्पना कीजिए कि आप एक जादू का खेल देख रहे हैं। जादूगर एक लाल गेंद से शुरुआत करता है, कुछ रहस्यमय हरकतें करता है, और अंत में मेज पर एक नीली गेंद छोड़ देता है। यदि आपने केवल शुरुआत और अंत देखा, तो आप सोच सकते हैं, "ठीक है, लाल रंग नीले में बदल गया।" लेकिन क्या होगा अगर जादूगर ने वे हरकतें किसी अलग क्रम में की होतीं? शायद उन्होंने गेंद को मेज पर लुढ़काने से पहले उसे नीला रंग दिया हो, या शायद उन्होंने पहले लाल गेंद को लुrolled किया और फिर उसे नीला रंगा। यदि आप उस जादू को एक नए मंच पर एक नई गेंद के साथ दोहराने की कोशिश करते, तो क्रम सब कुछ बदल देता। यदि आपने पहले रंग भरा होता, तो गेंद का लुढ़कना अलग होता बजाय इसके कि पहले लुढ़काया गया हो।
यह आर्टिफिशियल इंटेलिजेंस (AI) की एक दिलचस्प समस्या का केंद्र है। लंबे समय से, कंप्यूटर "क्या" को पहचानने में बहुत अच्छे रहे हैं—जैसे यह पहचानना कि एक तस्वीर में बिल्ली है या कार। लेकिन वे अक्सर "कैसे" के साथ संघर्ष करते हैं—यानी उन चरणों के क्रम को समझना जिससे वह वस्तु वहां पहुँची। यह शोध पत्र AI के एक विशिष्ट क्षेत्र जिसे विजुअल प्रोसेस कंट्रोल (दृश्य प्रक्रिया नियंत्रण) कहा जाता है, में गहराई से उतरता है। यह एक सरल लेकिन पेचीदा सवाल पूछता है: यदि एक AI शुरुआत और अंत देखता है, तो क्या वह उस छिपे हुए मध्य चरण (middle step) का पता लगा सकता है जो बताता है कि परिवर्तन कैसे हुआ? और अधिक महत्वपूर्ण बात यह है कि, यदि हम उस छिपे हुए मध्य चरण को बदल दें, तो क्या AI अपने अगले कदम के बारे में अपना निर्णय बदल देगा? शोधकर्ता एक ऐसा सिस्टम बनाना चाहते थे जो केवल उत्तर को याद न करे, बल्कि वास्तव में उस 'नुस्खे' (recipe) को समझे, ताकि जब सामग्री बदल जाए, तो वह एक नया व्यंजन बना सके।
"मध्य चरण" का जादू का खेल
इस अध्ययन में, टोक्यो डेनकी यूनिवर्सिटी के एक शोधकर्ता टोमोकी साका ने इस विचार का परीक्षण करने के लिए एक डिजिटल खेल मैदान बनाया। इसे एक वीडियो गेम लेवल की तरह समझें जहाँ आपके पास रंगीन आकृतियों का एक ग्रिड है। चीजों को इधर-उधर ले जाने के लिए खेल के दो नियम हैं:
- रंग-प्रथम नियम (The Color-First Rule): एक विशिष्ट आकृति का रंग बदलें, फिर उस नए रंग की सभी वस्तुओं को हिलाएं।
- मूव-प्रथम नियम (The Move-First Rule): एक विशिष्ट रंग की सभी वस्तुओं को हिलाएं, फिर लक्षित आकृति का रंग बदलें।
यहाँ मोड़ यह है: शोधकर्ताओं ने खेल को इस तरह सेट किया कि यदि आप एक ही तस्वीर से शुरू करते हैं और उसी तस्वीर पर समाप्त करते हैं, तो तकनीकी रूप से दोनों नियम काम कर सकते हैं! शुरुआत और अंत देखने में एक जैसे हैं। एकमात्र अंतर एक एकल "मिडल फ्रेम" (जिसे D1 कहा जाता है) है जो दिखाता है कि वास्तव में किस नियम का उपयोग किया गया था।
लक्ष्य AI को उस मिडल फ्रेम को देखना, यह समझना कि कौन सा नियम उपयोग किया गया था, और फिर उस नियम को एक नए पहेली पर लागू करना सिखाना था। यह एक छात्र को गणित की समस्या दिखाने जैसा है जहाँ वह उत्तर तो देख सकता है, लेकिन विधि का एकमात्र सुराग पृष्ठ के बीच में एक छोटे से निशान के रूप में है। यदि छात्र उस निशान को पढ़ सकता है, तो वह एक नई समस्या हल कर सकता है। यदि नहीं, तो वह केवल अनुमान लगा रहा है।
बड़ी खोज: बिना शॉर्टकट बताए सीखना
इस शोध पत्र का सबसे रोमांचक हिस्सा वह था जो तब हुआ जब शोधकर्ताओं ने AI का "नो-शॉर्टकट" मोड में परीक्षण किया। उन्होंने AI को हजारों उदाहरणों पर प्रशिक्षित किया जहाँ उसे नियमों को सामान्य रूप से सीखना था। उन्होंने इसे मिडल फ्रेम को बदलने पर निपटने के लिए कोई विशेष ट्रिक नहीं सिखाई थी। उन्होंने बस इसे प्राकृतिक पैटर्न सीखने दिया।
फिर, परीक्षण के दौरान उन्होंने एक चाल चली। उन्होंने एक ऐसी पहेली ली जिसे AI ने पहले कभी नहीं देखा था, लेकिन उन्होंने मिडल फ्रेम को विपरीत नियम वाले फ्रेम से बदल दिया। उदाहरण के लिए, उन्होंने एक ऐसी पहेली दिखाई जो "कलर-फर्स्ट" नियम का पालन करती दिख रही थी, लेकिन उन्होंने गुप्त रूप से उसमें "मूव-फर्स्ट" उदाहरण वाला मिडल फ्रेम डाल दिया।
परिणाम आश्चर्यजनक था। भले ही AI को इस बदलाव के प्रति स्पष्ट रूप से नहीं सिखाया गया था, इसने तुरंत अपना निर्णय बदल लिया। इसने नए मिडल फ्रेम को देखा, महसूस किया, "ओह, यह वास्तव में एक मूव-फर्स्ट पहेली है!" और सही नया परिणाम दिया।
संख्याएँ भी इसकी अत्यधिक सटीकता के साथ पुष्टि करती हैं। जब AI को मिडल क्लू (एंडपॉइंट कंट्रोल) के बिना अनुमान लगाने के लिए मजबूर किया गया, तो यह लगभग एक सिक्का उछालने जैसा था, जो केवल 50% बार ही सही हो पा रहा था। लेकिन जब यह मिडल फ्रेम देख सकता था, तो इसने 98.1% बार सही छवि बनाई (इसे इंटरसेक्शन ओवर यूनियन या IoU नामक मीट्रिक द्वारा मापा गया)। इससे भी अधिक प्रभावशाली यह था कि जब शोधकर्ताओं ने मिडल फ्रेम को बदला, तो AI वैकल्पिक सही परिणाम की ओर 0.99988 की संभावना के साथ मुड़ गया। यह लगभग 100% है। यह केवल अनुमान नहीं था; इसने वास्तव में प्रक्रिया के "नुस्खे" को पढ़ना सीख लिया था।
"अनिश्चितता" का आश्चर्य
शोधकर्ताओं ने यह भी परीक्षण किया: क्या होता है यदि आप मिडल फ्रेम को पूरी तरह से छिपा देते हैं? वास्तविक दुनिया में, कभी-कभी आपके पास सभी सुराग नहीं होते। एक स्मार्ट सिस्टम को गलत अनुमान लगाने के बजाय यह कहना चाहिए, "मुझे नहीं पता।"
उन्होंने पाया कि AI स्वाभाविक रूप से यह नहीं सीख पाया कि "मुझे नहीं पता" कैसे कहना है। यहाँ तक कि जब मिडल फ्रेम खाली था, तब भी AI बहुत आश्वस्त था, और उच्च निश्चितता के साथ एक उत्तर या दूसरे को चुन रहा था। वह केवल तभी अनिश्चित होना सीखा (यानी "मैं सुनिश्चित नहीं हूँ" कहना सीखा) जब शोधकर्ताओं ने प्रशिक्षण के दौरान उसे स्पष्ट रूप से अनिश्चित होना सिखाया। यह एक महत्वपूर्ण निष्कर्ष है: चरणों को समझना स्वचालित रूप से यह जानना नहीं है कि आपके पास कोई चरण गायब है। AI को गायब जानकारी को संभालने के लिए एक विशिष्ट सबक की आवश्यकता थी।
"सीक्रेट कोड" बनाम "ओपन बुक"
अंत में, टीम ने AI को खुद से बात करने के दो तरीकों की तुलना की।
- ओपन बुक (स्पष्ट इंटरफ़ेस): AI को एक सरल नोट लिखना था: "नियम A" या "नियम B"। यह मनुष्यों के लिए पढ़ना और समझना आसान है।
- सीक्रेट कोड (लेटेंट इंटरफ़ेस): AI ने संख्याओं की एक जटिल, अदृश्य धारा का उपयोग किया जिसे केवल कंप्यूटर ही समझ सकता था।
"सीक्रेट कोड" वाला संस्करण सही उत्तर प्राप्त करने में थोड़ा बेहतर था (सटीकता में लगभग 0.008 अंक अधिक)। हालाँकि, "ओपन बुक" संस्करण अभी भी अविश्वसनीय रूप से अच्छा था (98.1% सटीकता) और इसमें समझने योग्य होने का बड़ा लाभ था। शोधकर्ताओं ने निष्कर्ष निकाला कि हालांकि सीक्रेट कोड का एक मामूली लाभ है, लेकिन सरल, पठनीय नोट समस्या को लगभग पूरी तरह से हल करने के लिए पर्याप्त था।
भविष्य के लिए इसका क्या अर्थ है
यह शोध दावा नहीं करता है कि इसने मानव भावनाओं या वास्तविक दुनिया के भौतिकी को समझने वाला रोबोट बनाया है। इसने आकृतियों और रंगों के साथ एक बहुत ही सरल, काल्पनिक दुनिया का उपयोग किया। लेकिन इसने एक शक्तिशाली बात साबित की: AI किसी प्रक्रिया के "क्या" के बजाय उसके "कैसे" के प्रति संवेदनशील होना सीख सकता है।
इसने दिखाया कि यदि आप एक ऐसा सिस्टम डिज़ाइन करते हैं जो मध्यवर्ती चरणों को देखता है, तो वह उस ज्ञान को नई स्थितियों में लागू कर सकता है, भले ही आप उन चरणों को बदलकर उसे धोखा देने की कोशिश करें। इसने यह भी दिखाया कि हमें सावधान रहना होगा: सिर्फ इसलिए कि एक AI ने एक प्रक्रिया सीख ली है, इसका मतलब यह नहीं है कि वह जानता है कि उसके पास जानकारी की कमी है।
संक्षेप में, यह शोध एक ऐसा AI बनाने की दिशा में एक कदम है जो केवल खेल के अंतिम स्कोर को याद नहीं करता, बल्कि वास्तव में जीतने के लिए उपयोग की गई रणनीति को समझता है। और मशीन के लिए यह सीखना एक काफी शानदार ट्रिक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।