← नवीनतम पेपर
🤖 machine learning

Transformers as Implicit State Estimators: In-Context Learning in Dynamical Systems

यह शोध पत्र यह प्रदर्शित करता है कि इन-कॉन्टेक्स्ट लर्निंग सेटिंग में उपयोग किए जाने वाले फ्रोजन ट्रांसफॉर्मर्स, शोरयुक्त अवलोकनों (noisy observations) से रैखिक और गैर-रैखिक दोनों गतिशील प्रणालियों के आउटपुट की सटीक भविष्यवाणी करने के लिए अंतर्निहित छिपी हुई अवस्थाओं (hidden states) का अनुमान लगा सकते हैं, जो बिना किसी टेस्ट-टाइम ग्रेडिएंट अपडेट या सिस्टम मॉडल के स्पष्ट ज्ञान के, इष्टतम और ह्यूरिस्टिक बायेसियन फिल्टरों के तुलनीय प्रदर्शन प्राप्त करते हैं।

मूल लेखक: Usman Akram, Haris Vikalo

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Usman Akram, Haris Vikalo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप घने कोहरे में चलती हुई एक कार के रास्ते का अनुमान लगाने की कोशिश कर रहे हैं। आप कार को सीधे देख नहीं सकते, लेकिन आपके पास अलग-अलग समय पर ली गई धुंधली तस्वीरों (अवलोकनों) की एक श्रृंखला है, और आप भौतिकी के नियमों (physics) के बारे में थोड़ा बहुत जानते हैं।

द दशकों से, इंजीनियरों ने इस समस्या को हल करने के लिए कलमन फ़िल्टर (Kalman Filter) नामक एक गणितीय उपकरण का उपयोग किया है। यह एक सुपर-स्मार्ट, नियम-पालन करने वाले जासूस की तरह है जो कार के सटीक स्थान और उसके अगले कदम का अनुमान लगाने के लिए आपके धुंधले दृश्यों को भौतिकी के नियमों के साथ जोड़ता है। यह स्वर्ण मानक (gold standard) है, लेकिन इसके लिए आपको कार के इंजन के सटीक नियमों और हवा में मौजूद कोहरे (शोर/noise) की सटीक मात्रा को जानना आवश्यक है। यदि कार कुछ अजीब व्यवहार करने लगती है (नॉन-लीनियर व्यवहार), तो जासूस भ्रमित हो जाता है और उसे जटिल, मैनुअल समायोजनों की आवश्यकता होती है।

ट्रांसफॉर्मर (Transformer) से मिलिए।

आप ट्रांसफॉर्मर को उन AI चैटबॉट्स के दिमाग के रूप में जानते होंगे जिनके पीछे मैं हूँ। वे "इन-कॉन्टेक्स्ट लर्निंग" (ICL) के लिए प्रसिद्ध हैं। इसका अर्थ यह है कि यदि आप एक प्रॉम्प्ट में ट्रांसफॉर्मर को कुछ उदाहरणों के माध्यम से एक पैटर्न दिखाते हैं, तो वह उस पैटर्न को समझ सकता है और उसे आगे बढ़ा सकता है, बिना किसी पुन: प्रशिक्षण (retraining) के।

यह शोध पत्र एक दिलचस्प सवाल पूछता है: क्या एक ट्रांसफॉर्मर उस जासूस की तरह कार्य कर सकता है, लेकिन बिना यह जाने कि कार के नियम या कोहरे के नियम क्या हैं?

मुख्य विचार: "सहज" जासूस (The "Intuitive" Detective)

लेखकों ने पाया कि यदि आप ट्रांसफॉर्मर को "इनपुट -> आउटपुट" जोड़ों का एक संक्षिप्त इतिहास (जैसे "कार यहाँ थी, फिर वह वहाँ चली गई") देते हैं, तो ट्रांसफॉर्मर सिस्टम की छिपी हुई स्थिति (hidden state) को अंतर्निहित रूप से (implicitly) समझ सकता है। इसे कलमन फ़िल्टर के समीकरणों के साथ प्रोग्राम करने की आवश्यकता नहीं है। यह केवल उदाहरणों को देखकर खुद को एक कलमन फ़िल्टर की तरह ढाल लेता है।

यहाँ शोध पत्र इसे कुछ रोजमर्रा के उपमाओं का उपयोग करके समझाता है:

1. रैखिक प्रणालियों का "जादुई चमत्कार" (सीधा रास्ता)

कल्पना कीजिए कि कार एक बिल्कुल सीधे, अनुमानित रास्ते पर चल रही है।

  • पुराना तरीका: आपको एक मैनुअल कैलकुलेटर (कलमन फ़िल्टर) की आवश्यकता होती है जिसे आप कार की गति और कोहरे के घनत्व के साथ प्रोग्राम करते हैं।
  • ट्रांसफॉर्मर का तरीका: आप ट्रांसफॉर्मर को कार की पिछली गतिविधियों के कुछ उदाहरण दिखाते हैं।
  • परिणाम: ट्रांसफॉर्मर तुरंत पैटर्न को समझ जाता है। यह अगले कदम की भविष्यवाणी लगभग उतनी ही सटीकता से करता है जितना कि एक मैनुअल कैलकुलेटर।
  • खास बात: भले ही आप ट्रांसफॉर्मर से "गति" या "कोहरे के घनत्व" के नंबर छिपा दें, वह घबराता नहीं है। वह इतिहास को देखता है और चलते-चलते उन गायब संख्याओं का अनुमान लगा लेता है। यह एक ऐसे जासूस की तरह है जो केवल टायर के निशान देखकर यह बता सकता है कि कार कितनी तेज चल रही थी, भले ही किसी ने उसे गति सीमा न बताई हो।

2. गैर-रैखिक प्रणालियों की "अतरंगी सवारी" (रोलरकोस्टर)

अब, कल्पना कीजिए कि कार एक रोलरकोस्टर पर चल रही है, जहाँ वह तेजी से मुड़ रही है और लूप बना रही है। नियम जटिल हैं और लगातार बदल रहे हैं।

  • पुराना तरीका: आपको एक बहुत अधिक जटिल जासूस (एक्सटेंडेड कलमन फ़िल्टर या पार्टिकल फ़िल्टर) की आवश्यकता होती है जो वक्रों (curves) का अनुमान लगाने की कोशिश करता है। इन्हें बनाना कठिन है और ये अक्सर गलतियाँ करते हैं।
  • ट्रांसफॉर्मर का तरीका: आप ट्रांसफॉर्मर को कार के लूप बनाने और मुड़ने के उदाहरण दिखाते हैं।
  • परिणाम: ट्रांसफॉर्मर घुमावों के बीच नेविगेट करने में इतनी कुशलता से सीख जाता है कि वह अक्सर जटिल, मैन्युअल रूप से डिज़ाइन किए गए जासूसों से बेहतर प्रदर्शन करता है। ऐसा लगता है कि उसने उस अराजकता के लिए एक "सहज ज्ञान" (intuition) विकसित कर लिया है जिसे कठोर गणितीय सूत्र छोड़ देते हैं।

3. आकार मायने रखता है ("मस्तिष्क शक्ति" की उपमा)

शोध पत्र में पाया गया कि ट्रांसफॉर्मर का आकार मायने रखता है, ठीक वैसे ही जैसे मानव मस्तिष्क का आकार।

  • छोटे ट्रांसफॉर्मर: वे एक सूत्र को रटने की कोशिश करने वाले छात्र की तरह कार्य करते हैं। वे सरल ट्रिक्स (जैसे बुनियादी रिग्रेशन) का उपयोग करते हैं और छिपी हुई स्थिति (hidden state) को समझने में संघर्ष करते हैं।
  • बड़े ट्रांसफॉर्मर: वे एक अनुभवी विशेषज्ञ की तरह कार्य करते हैं। पर्याप्त "मस्तिष्क शक्ति" (परतें) और पर्याप्त इतिहास (संदर्भ) के साथ, वे केवल रटना बंद कर देते हैं और अनुमान (infer) लगाना शुरू कर देते हैं। वे छिपी हुई स्थिति का एक मानसिक मॉडल बनाते हैं, प्रभावी रूप से एक कलमन फ़िल्टर बन जाते हैं, बिना कभी यह जाने कि कलमन फ़िल्टर क्या है।

यह एक बड़ी बात क्यों है

  1. मैनुअल ट्यूनिंग की आवश्यकता नहीं: आमतौर पर, किसी सिस्टम को काम करने के योग्य बनाने के लिए, आपको एक इंजीनियर की आवश्यकता होती है जो सटीक समीकरण लिखे और शोर के स्तर को ट्यून करे। यह शोध पत्र दिखाता है कि एक ट्रांसफॉर्मर कुछ उदाहरणों को देखकर ही "खेल के नियम" सीख सकता है।
  2. मजबूती (Robustness): यदि आप ट्रांसफॉर्मर को "शोर का स्तर" या "मुड़ने की दर" बताना भूल जाते हैं, तो यह क्रैश नहीं होता है। यह संदर्भ से उन गायब हिस्सों को अनुकूलित और अनुमानित करता है, ठीक वैसे ही जैसे एक इंसान करेगा।
  3. एक मॉडल जो सब पर शासन करे: हर नई कार, विमान या रोबोट के लिए एक विशिष्ट कलमन फ़िल्टर बनाने के बजाय, आपको बस एक बड़ा ट्रांसफॉर्मर चाहिए होगा जिसे कई अलग-अलग उदाहरणों पर प्रशिक्षित किया गया हो। यह किसी भी गतिशील प्रणाली (dynamic system) के लिए एक सार्वभौमिक फ़िल्टर बन जाता है।

निष्कर्ष

यह शोध पत्र सिद्ध करता है कि ट्रांसफॉर्मर केवल टेक्स्ट जनरेटर नहीं हैं; वे शक्तिशाली, अंतर्निहित स्टेट एस्टिमेटर्स (state estimators) भी हैं।

इसे इस तरह सोचें: यदि आप किसी बच्चे को एक गेंद के उछलने के कुछ वीडियो दिखाते हैं, तो उन्हें गुरुत्वाकर्षण और लोच (elasticity) के भौतिकी समीकरण जानने की आवश्यकता नहीं होती कि गेंद कहाँ गिरेगी। वे बस इसे "समझ" जाते हैं। यह शोध पत्र दिखाता है कि AI ट्रांसफॉर्मर जटिल इंजीनियरिंग प्रणालियों के लिए भी यही कर सकते हैं। वे अतीत को देखकर दुनिया की छिपी हुई स्थिति को सीख लेते हैं, जिससे वे सदियों पुरानी गणितीय इंजीनियरिंग के लिए एक लचीला, "प्लग-एंड-प्ले" विकल्प बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →