Learning to Theorize the World from Observation
विकासात्मक संज्ञानात्मक विज्ञान से प्रेरित, यह शोध पत्र "लर्निंग-टू-थ्योराइज़" (सिद्धांत बनाने की सीख) प्रस्तुत करता है, जो न्यूरल थ्योरलाइज़र (NEO) मॉडल द्वारा प्रतिपादित एक प्रतिमान है, जो स्पष्टीकरण-संचालित सामान्यीकरण को सक्षम करने के लिए कच्चे गैर-पाठ्य अवलोकनों से स्पष्ट, निष्पादन योग्य गुप्त प्रोग्रामों का अनुमान लगाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Learning to Theorize the World from Observation" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।
मुख्य विचार: "अनुमान लगाने" से "समझने" तक
कल्पना कीजिए कि आप एक जादूगर को टोपी से खरगोश निकालते हुए देख रहे हैं।
- वर्तमान AI (अनुमान लगाने वाला/The Predictor): अधिकांश आधुनिक AI सिस्टम एक बहुत ही सूक्ष्म अवलोकन करने वाले दर्शक की तरह होते हैं। वे उस ट्रिक को हज़ार बार देखते हैं और अनुमान लगाने में बहुत माहिर हो जाते हैं, जैसे, "ठीक है, अगली बार जब जादूगर अपना हाथ हिलाएगा, तो एक खरगोश दिखाई देगा।" वे भविष्य की भविप्ति (prediction) करने में बेहतरीन हैं, लेकिन उन्हें वास्तव में यह नहीं पता होता कि वह ट्रिक कैसे काम करती है। यदि जादूगर टोपी या खरगोश बदल देता है, तो AI भ्रमित हो जाता है।
- इस पेपर का दृष्टिकोण (सिद्धांत बनाने वाला/The Theorizer): यह पेपर पूछता है: क्या होगा अगर AI केवल खरगोश का अनुमान न लगाए, बल्कि उसके पीछे के तंत्र (mechanism) को समझ ले? क्या होगा अगर उसे समझ आ जाए, "आह, जादूगर के पास टोपी में एक गुप्त डिब्बा है"? यह सिद्धांत सीखना (Learning to Theorize) है। केवल परिणाम को याद करने के बजाय, AI एक आंतरिक "सिद्धांत" (नियमों का एक समूह) बनाता है जो यह समझाता है कि चीजें क्यों होती हैं।
समस्या: "ब्लैक बॉक्स" बनाम "लेगो सेट"
लेखकों का तर्क है कि वर्तमान AI मॉडल ब्लैक बॉक्स की तरह हैं। वे एक इनपुट लेते हैं (बिल्ली की तस्वीर) और एक आउटपुट देते हैं (कुत्ते की तस्वीर), लेकिन उनके अंदर का रूपांतरण गणित की एक उलझी हुई गांठ की तरह होता है।
- उलझी हुई गांठ: यदि आप AI को एक नई ट्रिक दिखाते हैं (जैसे, कुत्ते का बिल्ली में बदलना), तो वह विफल हो जाता है क्योंकि उसने कभी व्यक्तिगत चरणों को नहीं सीखा; उसने केवल विशिष्ट "बिल्ली-से-कुत्ता" वाली गांठ को याद किया था।
- लेगो सेट (Lego Set): लेखक चाहते हैं कि AI एक बच्चे की तरह सीखे जो लेगो ब्रिक्स (Lego bricks) के साथ खेल रहा है। एक पूरा किला याद रखने के बजाय, बच्चा व्यक्तिगत ईंटों (दीवारें, खिड़कियाँ, छतें) और उन्हें आपस में जोड़ने के तरीके को सीखता है। यदि बच्चा एक नया किला देखता है, तो वह उसे बना सकता है क्योंकि वह ईंटों को समझता है, न कि इसलिए कि उसने उस विशिष्ट किले को याद किया है।
समाधान: "न्यूरल थ्योराइज़र" (NEO)
इसे साकार करने के लिए, शोधकर्ताओं ने एक नया AI मॉडल बनाया जिसे NEO (Neural Theorizer) कहा जाता है। यह कैसे काम करता है, इसे खाना पकाने की उपमा से समझते हैं:
- सामग्री (प्रिमिटिव्स/Primitives): कल्पना कीजिए कि आपको केक बनते हुए देखने का एक वीडियो दिया गया है, लेकिन आपको रेसिपी नहीं बताई गई है। आप केवल कच्चे आटे को केक में बदलते हुए देखते हैं। NEO का काम बुनियादी "सामग्री" या "चालों" (जैसे, "मिलाना", "गर्म करना", "चीनी डालना") का पता लगाना है। इसे ये शब्द पहले से नहीं पता; यह इन्हें अपने आप खोज लेता है।
- रेसिपी (प्रोग्राम): एक बार जब NEO बुनियादी चालों को खोज लेता है, तो वह उन्हें एक क्रम (प्रोग्राम) में व्यवस्थित करने की कोशिश करता है जो आटे को केक में बदल दे।
- "सबसे छोटा रास्ता" नियम (MDL): NEO एक नियम का पालन करता है जिसे मिनिमम डिस्क्रिप्शन लेंथ (Minimum Description Length) कहा जाता है। इसे एक सख्त संपादक के रूप में सोचें। यदि NEO केक को तीन चरणों में समझा सकता है, तो वह दस चरणों का उपयोग नहीं करेगा। यह सबसे सरल, सबसे कुशल रेसिपी खोजने की कोशिश करता है। यह इसे वास्तविक मौलिक चालों को खोजने के लिए मजबूर करता है, न कि जटिल, अनावश्यक चरण बनाने के लिए।
उन्होंने इसका परीक्षण कैसे किया: "OTIB" बेंचमार्क
इसे सिद्ध करने के लिए, उन्होंने OTIB (Observation-to-Theory Induction Benchmark) नामक एक परीक्षण बनाया। उन्होंने AI को कोई निर्देश, लेबल या "सही उत्तर" नहीं दिए। उन्होंने बस "पहले" और "बाद के" चित्रों के जोड़े दिए (जैसे कि एक ग्रिड वर्ल्ड जहाँ एक ब्लॉक हिलता है, या संख्याएँ जिन्हें गुणा किया जाता है)।
उन्होंने AI का तीन तरीकों से परीक्षण किया:
- वही पुराना सामान: क्या यह उस ट्रिक को समझा सकता है जिसे इसने प्रशिक्षण के दौरान देखा था? (आसान)
- नया मिश्रण: क्या यह एक ऐसी ट्रिक को समझा सकता है जिसे इसने कभी नहीं देखा, लेकिन जो उन्हीं बुनियादी चालों से बनी है? (उदाहरण के लिए, यदि इसने "ऊपर जाना" और "दाएं जाना" सीखा है, तो क्या यह "ऊपर-दाएं जाना" समझ सकता है?)
- लंबी अवधि: क्या यह एक ऐसी ट्रिक को समझा सकता है जो इसके द्वारा देखी गई किसी भी चीज़ से बहुत लंबी है? (उदाहरण के लिए, यदि इसने 3-चरणीय ट्रिक्स सीखी हैं, तो क्या यह 10-चरणीय ट्रिक को समझ सकता है?)
परिणाम: यह क्यों मायने रखता है
परिणाम स्पष्ट थे:
- पुराने AI मॉडल: वे "वही पुराने सामान" के लिए बेहतरीन थे लेकिन नए मिश्रणों और लंबी ट्रिक्स में पूरी तरह विफल रहे। वे केवल पैटर्न को याद कर रहे थे, नियमों को नहीं समझ रहे थे।
- NEO (द थ्योराइज़र): यह नए मिश्रणों और लंबी ट्रिक्स में उत्कृष्ट रहा। क्योंकि इसने "लेगो ब्रिक्स" (प्रिमिटिव्स) को खोज लिया था और उन्हें आपस में जोड़ना सीख लिया था, इसलिए यह उन चीजों के लिए भी स्पष्टीकरण बना सकता था जिन्हें इसने पहले कभी नहीं देखा था।
"अहा!" क्षण (The "Aha!" Moment):
पेपर दिखाता है कि NEO ने केवल उत्तर को याद नहीं किया; इसने वास्तव में दुनिया के छिपे हुए "व्याकरण" को खोज लिया। उदाहरण के लिए, एक गणित कार्य में, इसने पता लगाया कि दुनिया "2 से गुणा करें", "3 से गुणा करें", आदि से बनी है, भले ही इसे ये शब्द कभी नहीं बताए गए थे। फिर इसने उन बिल्डिंग ब्लॉक्स का उपयोग उन जटिल गणितीय समस्याओं को हल करने के लिए किया जिनका इसने पहले कभी सामना नहीं किया था।
सारांश
यह पेपर AI के सीखने के एक नए तरीके का परिचय देता है। केवल एक भविष्यवक्ता होने के बजाय जो यह अनुमान लगाता है कि आगे क्या होगा, AI एक वैज्ञानिक बन जाता है। यह दुनिया को देखता है, जटिल घटनाओं को सरल, पुन: प्रयोज्य बिल्डिंग ब्लॉक्स में तोड़ता है, और दुनिया कैसे काम करती है, इसे समझाने के लिए अपना स्वयं का "सिद्धांत" (एक प्रोग्राम) लिखता है। यह इसे उन सरल नियमों को पुनर्संयोजित करके नई, अजीब स्थितियों को समझने की अनुमति देता है जिन्हें यह पहले से जानता है, ठीक वैसे ही जैसे एक मानव बच्चा सोचने के लिए सीखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।