← नवीनतम पेपर
🤖 machine learning

Zero-shot generalization of transformer neural operators to larger domains

यह शोधपत्र एक नवीन ट्रांसफार्मर-आधारित न्यूरल ऑपरेटर प्रस्तावित करता है जो मूल आर्किटेक्चर को बदले बिना स्थानिक स्थानीयता (spatial locality) और अनुवाद समानता (translation equivariance) को लागू करने के लिए रोटरी पोजीशनल एम्बेडिंग्स और अटेंशन लॉजिट्स में एक विघटनीय बायस (decomposable bias) को शामिल करके काफी बड़े स्थानिक डोमेन तक ज़ीरो-शॉट सामान्यीकरण प्राप्त करता है।

मूल लेखक: Armand de Villeroché, Sibo Cheng, Vincent Le Guen, Marc Bocquet, Rem-Sophia Mouradi, Patrick Armand, Alban Farchi, Patrick Massin

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Armand de Villeroché, Sibo Cheng, Vincent Le Guen, Marc Bocquet, Rem-Sophia Mouradi, Patrick Armand, Alban Farchi, Patrick Massin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक छोटे, 10-फुट के स्विमिंग पूल में पानी के बहाव की भविष्यवाणी करना सिखा रहे हैं। आप उसे लहरों के टकराने, लहरों के फैलने और उस विशिष्ट 10-फुट के बॉक्स के भीतर धाराओं के घूमने के हजारों सिमुलेशन दिखाते हैं। रोबोट उस छोटे पूल के नियमों को पूरी तरह से सीख जाता है।

अब, कल्पना कीजिए कि आप उसी रोबोट से एक विशाल नदी के बहाव की भविष्यवाणी करने के लिए कहते हैं जो 100 मील लंबी है, बिना उसे कोई नया ट्रेनिंग डेटा दिए। यह वही है जिसे पेपर में "डोमेन एक्सटेंशन" (domain extension) कहा गया है। यह एक बाथटब से महासागर तक एक्सट्रपलेशन (extrapolate) करने के लिए पूछने जैसा है।

समस्या: "घोस्ट" इंटरैक्शन (The "Ghost" Interactions)

शोधकर्ताओं ने पाया कि मानक AI मॉडल (विशेष रूप से "ट्रांसफॉर्मर न्यूरल ऑपरेटर्स") इस कार्य में विफल हो जाते हैं। इसका कारण यहाँ दिया गया है:

AI के 'अटेंशन मैकेनिज्म' को एक भीड़ भरे कमरे में बातचीत सुनने की कोशिश करने वाले व्यक्ति की तरह समझें।

  • मानक AI (RoPE): यह AI दूरी को समझने के लिए एक "पीरियोडिक" (periodic) तरीके का उपयोग करता है। यह एक घड़ी के चेहरे की तरह है। यदि आप 12 घंटे आगे बढ़ते हैं, तो आप वापस शुरुआत में पहुँच जाते हैं। AI के दिमाग में, 100 मील दूर का बिंदु 1 मील दूर के बिंदु के गणितीय रूप से समान दिख सकता है क्योंकि "घड़ी" घूमकर वापस आ गई थी।
  • परिणाम: जब AI एक विशाल डोमेन देखता है, तो वह दूर स्थित बिंदुओं को ऐसे जोड़ने लगता है जैसे वे पड़ोसी हों। यह "घोस्ट इंटरैक्शन" (ghost interactions) पैदा करता है। इसे लगता है कि 100 मील लंबी नदी के बाईं ओर की एक लहर तुरंत दाईं ओर की लहर से बात कर रही है, भले ही भौतिकी कहती है कि वे अभी तक जुड़े नहीं होने चाहिए। इसके कारण भविष्यवाणी निरर्थक (nonsense) हो जाती है।

समाधान: एक "लोकल नेबरहुड" नियम

लेखकों ने, EDF R&D और CEREA के सहयोगियों के साथ मिलकर, एक समाधान प्रस्तावित किया। उन्होंने महसूस किया कि वास्तविक भौतिक दुनिया में, चीजें आमतौर पर केवल अपने तत्काल पड़ोसियों को प्रभावित करती हैं। यहाँ एक लहर का प्रभाव वहाँ नहीं पड़ता जब तक कि उसे यात्रा करने में समय न लगे।

उन्होंने एक नई विधि पेश की जिसे LAAPE (Local Anisotropic Asymmetric Positional Encoding) कहा जाता है।

यहाँ इसकी उपमा दी गई है:

  • पुराना तरीका: AI के पास एक "ग्लोबल मैप" था जहाँ हर बिंदु दूसरे हर बिंदु से बात कर सकता था, लेकिन वह पैमाने (scale) को लेकर भ्रमित हो जाता था।
  • नया तरीका (LAAPE): उन्होंने AI को एक "लोकल नेबरहुड नियम" दिया। उन्होंने AI को बताया: "आप केवल एक निश्चित त्रिज्या (radius) के भीतर के बिंदुओं को ही सुन सकते हैं। यदि कोई बिंदु बहुत दूर है, तो सिग्नल शून्य हो जाएगा।"

लेकिन उन्होंने केवल एक सख्त घेरा नहीं बनाया। उन्होंने इसे स्मार्ट बनाया:

  1. डिकम्पोजेबल (Decomposable): उन्होंने इस नियम को ऐसे गणित के साथ बनाया जो मौजूदा, सुपर-फास्ट कंप्यूटर चिप्स (जैसे FlashAttention) में पूरी तरह फिट बैठता है। यह एक कैमरा लेंस में नया फिल्टर जोड़ने जैसा है बिना पूरे कैमरे को फिर से बनाए।
  2. एसिमेट्रिक (Asymmetric): वास्तविक दुनिया में, हवा बाईं से दाईं ओर बह सकती है, जिससे प्रदूषण नीचे की ओर (downstream) बहता है। AI को यह जानने की आवश्यकता है कि "डाउनस्ट्रीम" "अपस्ट्रीम" से अलग है। नया तरीका "सुनने की त्रिज्या" को विभिन्न दिशाओं में खींचने या सिकोड़ने की अनुमति देता है, ठीक वैसे ही जैसे एक वास्तविक हवा का क्षेत्र होता है।

प्रयोग: बाथटब से शहरों तक

टीम ने तीन अलग-अलग चुनौतियों पर इसका परीक्षण किया:

  1. उथला पानी (1D): एक लंबे चैनल में पानी की ऊंचाई का सिमुलेशन।
  2. ग्रे-स्कॉट (2D): रासायनिक प्रतिक्रियाओं का सिमुलेशन जो पैटर्न बनाते हैं (जैसे तेंदुए पर धब्बे)।
  3. शहरी हवा (3D): एक वास्तविक औद्योगिक चुनौती, जिसमें इमारतों के बीच से बहने वाली हवा का सिमुलेशन किया गया है। यह सबसे कठिन परीक्षण है क्योंकि हवा इमारतों के साथ जटिल, एकतरफा तरीकों से परस्पर क्रिया करती है (एसिमेट्री)।

परिणाम:

  • मानक AI (RoPE): जब डोमेन का आकार बढ़ा (जैसे, 1x से 5x), तो त्रुटि (error) तेजी से बढ़ गई। भविष्यवाणियाँ अराजक और बेकार हो गईं।
  • नया AI (LAAPE): जब डोमेन का आकार बढ़ा, तो त्रुटि कम और स्थिर रही। AI ने उस विशाल शहर के सिमुलेशन में प्रवाह की सफलतापूर्वक भविष्यवाणी की, जिसे उसने ट्रेनिंग के दौरान कभी नहीं देखा था।

मुख्य निष्कर्ष (The Bottom Line)

पेपर का दावा है कि AI को स्पेशियल लोकैलिटी (spatial locality) (केवल पास की चीजों पर ध्यान देने) का सम्मान करने के लिए मजबूर करके और उस अटेंशन को एसिमेट्रिक (asymmetric) (विभिन्न दिशाओं में अलग-अलग) होने की अनुमति देकर, वे एक छोटे डेटासेट पर मॉडल को प्रशिक्षित कर सकते हैं और इसे एक विशाल, अनदेखे डोमेन पर पूरी तरह से काम करने के लिए तैयार कर सकते हैं।

उन्होंने केवल AI को "स्मार्टर" नहीं बनाया; उन्होंने उसे दूरी की बेहतर समझ दी। उन्होंने दिखाया कि यदि आप AI को दूर के बिंदुओं के बीच संबंध की कल्पना (hallucinate) करने से रोकते हैं, तो यह बिना पुन: प्रशिक्षण के वास्तविक दुनिया के पैमाने पर सामान्यीकरण (generalize) कर सकता है।

सीमाओं पर नोट: लेखक स्वीकार करते हैं कि जबकि यह स्केल बढ़ाने के लिए बहुत अच्छा काम करता है, यदि समस्या की भौतिकी वास्तव में लंबी दूरी के कनेक्शन की आवश्यकता रखती है जो ट्रेनिंग डेटा से अधिक लंबे हैं (जो दुर्लभ है लेकिन संभव है), तो यह विधि उन्हें मिस कर सकती है। साथ ही, हालांकि गणित तेज़ कंप्यूटिंग की अनुमति देता है, उन्होंने अभी तक कोड को सुपर-फास्ट बनाने के लिए पूरी तरह से अनुकूलित नहीं किया है; उन्होंने पहले यह साबित करने पर ध्यान केंद्रित किया कि अवधारणा काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →