From Kepler to Newton: Inductive Biases Guide Learned World Models in Transformers
यह शोध पत्र यह प्रदर्शित करता है कि तीन न्यूनतम इंडक्टिव बायस (inductive biases)—स्थानिक सुगमता (spatial smoothness), स्थिरता (stability) और टेम्पोरल लोकैलिटी (temporal locality)—को पेश करके, जेनेरिक ट्रांसफॉर्मर्स केवल कर्व-फ़िटर्स (curve-fitters) से विकसित होकर न्यूटनियन बलों जैसे मौलिक भौतिक नियमों की खोज करने में सक्षम एजेंट बन सकते हैं, जिससे उच्च भविष्य कहने वाली सटीकता और वास्तविक कारण संबंधी समझ (causal understanding) के बीच के अंतर को पाटा जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट छात्र है। आप उसे सिखाना चाहते हैं कि ग्रह सूर्य के चारों ओर कैसे घूमते हैं। आप उसे ग्रहों के इतिहास की एक विशाल किताब देते हैं कि वे कहाँ रहे हैं, और उससे पूछते हैं कि वे आगे कहाँ होंगे इसका अनुमान लगाने को।
बड़ा सवाल जो यह शोध पत्र पूछता है, वह यह है: क्या यह रोबोट छात्र केवल रास्ते को रट सकता है, या क्या वह वास्तव में भौतिकी (physics) के उन नियमों को समझ सकता है जो इस गति का कारण बनते हैं?
लेखकों ने पाया कि बिना कुछ विशेष "प्रशिक्षण पहियों" (जिन्हें वे इंडक्टिव बायस/inductive biases कहते हैं) के, रोबोट एक शानदार रटने वाला तो है लेकिन एक बुरा भौतिक विज्ञानी है। वह पथ (path) को तो पूरी तरह से खींच लेता है, लेकिन उसे यह पता ही नहीं होता कि वह ग्रह उस तरह से क्यों घूम रहा है।
यहाँ बताया गया है कि उन्होंने रोबोट को कैसे सुधारा, जिसे तीन सरल पाठों में विभाजित किया गया है।
समस्या: रोबोट एक "कर्व-फिटर" (वक्र बनाने वाला) है, "भौतिक विज्ञानी" नहीं
रोबोट के मस्तिष्क को एक विशाल पुस्तकालय के रूप में सोचें।
- केपलर दृष्टिकोण (जो रोबोट ने स्वाभाविक रूप से किया): रोबोट ग्रह की यात्रा के पिछले 1,000 बिंदुओं को देखता है। वह कहता है, "आहा! मुझे पैटर्न दिख गया। यह एक अंडाकार आकार है। मैं बस इसी अंडाकार को बनाना जारी रखूँगा।" यह एक बच्चे द्वारा चित्र ट्रेस करने जैसा है। वह चित्र को सही बनाता है, लेकिन यदि आप उससे पूछें, "यह अंडाकार क्यों है?" या "कौन सा बल इसे खींच रहा है?", तो रोबोट के पास कोई उत्तर नहीं होता। वह बस आकार को जानता है।
- न्यूटन दृष्टिकोण (जो हम चाहते हैं): हम चाहते हैं कि रोबोट कहे, "सूर्य ग्रह को गुरुत्वाकर्षण के साथ खींच रहा है। यदि मुझे ग्रह की वर्तमान गति और स्थिति पता है, तो मैं खिंचाव की गणना कर सकता हूँ और अगले कदम की भविष्यवाणी कर सकता हूँ।" यह केवल प्रभाव को नहीं, बल्कि कारण को समझने के बारे में है।
शोध पत्र दिखाता है कि मानक AI मॉडल (ट्रांसफॉर्मर्स) स्वाभाविक रूप से "ट्रेसर" (केपलर) बन जाते हैं और "कैलकुलेटर" (न्यूटन) बनने में विफल रहते हैं। इसे ठीक करने के लिए, लेखकों ने तीन विशिष्ट "प्रशिक्षण पहिए" जोड़े।
पाठ 1: "पिक्सेलेटेड मैप" की समस्या (स्थानिक सहजता/Spatial Smoothness)
उपमा: कल्पना करें कि आप एक रोबोट को शहर में नेविगेट करना सिखा रहे हैं।
- गलती: आप रोबोट को एक ऐसा नक्शा देते हैं जहाँ सड़क का हर कोना पूरी तरह से अलग, यादृच्छिक (random) रंग का है। "लाल" 1st और Main का कोना है। "नीला" 1st और 2nd का कोना है। भले ही ये कोने एक-दूसरे के ठीक बगल में हैं, रोबोट उन्हें पूरी तरह से असंबंधित देखता है। उसे हर बार "लाल" और "नीले" के बीच के संबंध को शून्य से सीखना पड़ता है।
- सुधार: लेखकों ने महसूस किया कि जब उन्होंने ग्रह की स्थिति को छोटे "बिनों" (जैसे पिक्सल) में विभाजित किया, तो उन्होंने स्थान की प्राकृतिक सहजता को तोड़ दिया।
- समाधान: उन्होंने "बिनों" को बड़ा बनाया (कम रंग) या बिनों का उपयोग करना ही बंद कर दिया और सीधे रोबोट को सटीक निर्देशांक (जैसे GPS) दिए। इससे रोबोट यह देख सका कि "बिंदु A" ठीक "बिंदु B" के बगल में है, जिससे उसे एक भ्रमित करने वाले यादृच्छिक कोड के बजाय स्थान का एक वास्तविक मानसिक मानचित्र बनाने में मदद मिली।
पाठ 2: "डोमिनो इफेक्ट" की समस्या (स्थानिक स्थिरता/Spatial Stability)
उपमा: कल्पना करें कि आप "टेलीफोन" का खेल खेल रहे हैं जहाँ आप अगले व्यक्ति को एक नंबर फुसफुसाते हैं।
- गलती: यदि पहला व्यक्ति "50.1" फुसफुसाता है और दूसरा "50.2" सुनता है, तो तीसरा व्यक्ति "50.5" सुन सकता है, और अंत तक पहुँचते-पहुँचते वह नंबर "100" हो सकता है। भौतिकी में, यदि रोबोट ग्रह की स्थिति की भविष्यवाणी करने में एक छोटी सी गलती करता है, तो वह गलती हर कदम के साथ बढ़ती जाती है, जब तक कि ग्रह अंतरिक्ष में दूर न चला जाए या सूर्य से न टकरा जाए।
- सुधार: लेखकों ने महसूस किया कि मानक AI प्रशिक्षण बहुत "परफेक्ट" है। यह केवल पूर्ण पिछले डेटा से सीखता है।
- समाधान: उन्होंने जानबूझकर रोबोट के प्रशिक्षण डेटा को "खराब" करना शुरू किया। उन्होंने उस इतिहास में थोड़ा सा 'स्टैटिक नॉइज़' (जैसे रेडियो पर शोर) जोड़ा जिसे रोबोट पढ़ रहा था। इसने रोबोट को छोटी गलतियों से उबरना सीखने के लिए मजबूर किया, जिससे वह भविष्य की भविष्यवाणी करने के लिए पर्याप्त मजबूत बन गया, ताकि त्रुटियाँ जमा न हों।
पाठ 3: "लंबी स्मृति" बनाम "छोटी स्मृति" की समस्या (सामयिक स्थानीयता/Temporal Locality)
उपमा: यह सबसे महत्वपूर्ण हिस्सा है।
- लंबी स्मृति (केपलर): कल्पना करें कि एक रोबोट जो पिछले एक घंटे में जो कुछ भी हुआ उसे याद रखता है। जब वह अगले कदम का अनुमान लगाने की कोशिश करता है, तो वह एक बड़ा वक्र (curve) बनाने के लिए एक घंटे के पूरे इतिहास को देखता है। यह एक रोलरकोस्टर ट्रैक को देखने जैसा है ताकि यह अनुमान लगाया जा सके कि गाड़ी आगे कहाँ जाएगी। यह वक्र के लिए तो काम करता है, लेकिन यह भौतिकी को नहीं समझता।
- छोटी स्मृति (न्यूटन): अब, कल्पना करें कि एक रोबोट को केवल पिछले दो सेकंड को याद रखने की अनुमति है। वह पूरा ट्रैक नहीं देख सकता। उसे यह देखना ही होगा कि कार्ट अभी कहाँ है और वह अभी कितनी तेज़ चल रही है ताकि वह जान सके कि आगे कहाँ जाना है।
- समाधान: लेखकों ने रोबोट की स्मृति को छोटा करने के लिए मजबूर किया। उन्होंने उससे कहा, "तुम केवल तत्काल अतीत को देख सकते हो।"
- परिणाम: क्योंकि रोबोट अब "बड़ी तस्वीर" वाले वक्र पर निर्भर नहीं रह सका, इसलिए उसे खेल के नियमों को समझना पड़ा। उसे अगले कदम की भविष्यवाणी करने के लिए अभी ग्रह पर लगने वाले अदृश्य "खिंचाव" (गुरुत्वाकर्षण) की गणना करनी ही पड़ी। अचानक, रोबोट ने अंडाकार बनाना बंद कर दिया और बलों की गणना करने लगा। वह एक भौतिक विज्ञानी बन गया।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि आप AI के मस्तिष्क को कैसे डिज़ाइन करते हैं, यह निर्धारित करता है कि वह क्या सीखता है।
- यदि आप इसे सब कुछ देखने देते हैं और एक पिक्सेलेटेड मैप का उपयोग करते हैं, तो यह एक कर्व-फिटर (केपलर) बन जाता है। यह सुंदर चित्र बनाता है लेकिन ब्रह्मांड को नहीं समझता।
- यदि आप इसे एक स्मूथ मैप देते हैं, इसे गलतियों को संभालने के लिए सिखाते हैं, और इसे छोटी स्मृति रखने के लिए मजबूर करते हैं, तो यह एक भौतिक विज्ञानी (न्यूटन) बन जाता है। यह अपने आप गुरुत्वाकर्षण के नियमों की खोज कर लेता है।
लेखक दिखाते हैं कि आपको AI में भौतिकी के नियमों को प्रोग्राम करने की आवश्यकता नहीं है। आपको बस उसे सही "इंडक्टिव बायस" (सही प्रशिक्षण बाधाएं) देने की आवश्यकता है, और वह स्वयं नियमों की खोज कर लेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।