← नवीनतम पेपर
💻 computer science

PJ-RoPE: A Fourier-Jet-Affine Position Space for Relative Attention

यह शोध पत्र PJ-RoPE को प्रस्तुत करता है, जो एक एकीकृत सीखने योग्य सापेक्ष-स्थिति ढांचा (unified learnable relative-position framework) है जो भाषा और संगीत जैसे विविध कार्यों में अटेंशन मैकेनिज्म को अनुकूल रूप से अनुकूलित करने के लिए RoPE के फूरियर फेजेस (Fourier phases), Jordan-RoPE के फाइनाइट जेट्स (finite jets) और ALiBi के एफाइन रिसेंसी (affine recency) को एक एकल डिफरेंस मॉड्यूल में बीजगणितीय रूप से एकीकृत करता है।

मूल लेखक: Yaobo Zhang

प्रकाशित 2026-06-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yaobo Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक लंबी कहानी या संगीत के एक जटिल टुकड़े को समझना सिखाने की कोशिश कर रहे हैं। रोबोट को न केवल यह जानने की आवश्यकता है कि कौन से शब्द या स्वर (notes) उपयोग किए जा रहे हैं, बल्कि यह भी कि वे अनुक्रम (sequence) में कहाँ दिखाई देते हैं। क्या वह नोट अभी हो रहा है, या बहुत समय पहले था? क्या यह शब्द वाक्य का पहला शब्द है, या सौवां?

AI की दुनिया में, इसे पोजीशनल एनकोडिंग (positional encoding) कहा जाता है। "PJ-RoPE" नामक शोध पत्र इन स्थितियों के बारे में रोबोट को सिखाने का एक नया, एकीकृत तरीका प्रस्तावित करता है। लेखक तर्क देते हैं कि अलग-अलग कामों के लिए अलग-अलग, प्रतिस्पर्धी उपकरणों के बजाय, हम एक विशाल, लचीला "पोजीशन टूलबॉक्स" बना सकते हैं जो यह सीख सके कि किस विशिष्ट कार्य के लिए किस उपकरण का उपयोग करना है।

यहाँ उनके विचार का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. टूलबॉक्स में तीन उपकरण

लेखकों ने पहचान की है कि AI मॉडल ऐतिहासिक रूप से स्थिति को समझने के तीन मुख्य तरीके रखते हैं, और वे उन्हें एक ही घर के विभिन्न "कमरों" के रूप में देखते हैं:

  • "लहराने वाला" कमरा (Fourier/RoPE):
    कल्पना कीजिए कि एक लाइटहाउस की किरण घूम रही है। यह एक दोहराव वाला तरंग पैटर्न (wave pattern) बनाती है। यह उन चीजों के लिए बेहतरीन है जो दोहराती हैं, जैसे संगीत में एक लय या वाक्य में एक पैटर्न। यह AI को बताता है, "यह नोट उस नोट से 3 बीट्स दूर है।"

    • पेपर का शब्द: फूरियर कैरेक्टर्स (Fourier characters)।
  • "मोटा होने वाला" कमरा (Jordan-RoPE/Finite Jets):
    कभी-कभी, एक साधारण लहर पर्याप्त नहीं होती है। शायद पैटर्न केवल एक लहर नहीं है; शायद लहर थोड़ी विकृत हो रही है या अपना आकार बदल रही है। कल्पना कीजिए कि आप उस लाइटहाउस की किरण को "मोटा" या धुंधला बना रहे हैं ताकि वह अतिरिक्त जानकारी ले जा सके कि पैटर्न कैसे बदल रहा है (जैसे कि एक डेरिवेटिव)। यह AI को अधिक जटिल, बदलते संबंधों को समझने में मदद करता है।

    • पेपर का शब्द: फाइनाइट जेट्स (Finite jets)।
  • "तत्परता" वाला कमरा (Affine/ALiBi):
    कभी-कभी, सबसे महत्वपूर्ण बात बस यह होती है कि: "यह कितना हालिया है?" बातचीत में, पिछले कुछ शब्द उन शब्दों से अधिक महत्वपूर्ण होते हैं जो दस मिनट पहले बोले गए थे। यह उपकरण एक सीधी रेखा है जो कहती है: "आप अंत के जितने करीब हैं, उतने ही महत्वपूर्ण हैं।" यह तत्परता का एक सरल, रैखिक (linear) बोध है।

    • पेपर का शब्द: एफाइन रिसेंसी (Affine recency)।

2. बड़ा विचार: एक घर, कई कमरे

इस शोध पत्र से पहले, शोधकर्ता अक्सर इस बात पर बहस करते थे कि इनमें से कौन सा उपकरण "सर्वश्रेष्ठ" है। लेखक कहते हैं, "क्यों चुनना? आइए एक ऐसा घर बनाएं जिसमें ये तीनों कमरे हों।"

वे इस घर को PJ-RoPE कहते हैं।

  • P का अर्थ है पोइन्केरे-टाइप (Poincaré-type): इसे एक फैंसी भौतिकी शब्द के रूप में सोचें जिसका अर्थ है "हमने घूमती हुई लहर वाले कमरे को सीधी रेखा वाली तत्परता वाले कमरे के साथ मिलाकर एक पूर्ण संरचना बनाई है।"
  • J का अर्थ है जेट (Jet): यह "मोटा होने वाला" कमरा है जो जटिल परिवर्तनों को संभालता है।
  • RoPE मूल घूमती हुई लहर है।

PJ-RoPE का जादू यह है कि यह AI को एक चुनने के लिए मजबूर नहीं करता है। इसके बजाय, यह AI को प्रत्येक कमरे के लिए एक डिमर स्विच (dimmer switch) (जिसे "सेक्टर गेट्स" कहा जाता है) देता है। जब AI संगीत के किसी टुकड़े को देखता है, तो वह "लहराने वाले" और "मोटा होने वाले" प्रकाश को ऊँचा कर सकता है क्योंकि संगीत में जटिल लय होती है। जब वह एक लंबी कहानी को देखता है, तो वह "तत्परता" वाले प्रकाश को ऊँचा कर सकता है क्योंकि हाल के शब्द सबसे अधिक मायने रखते हैं।

3. "लाइट-कोन" सुरक्षा वाल्व (The "Light-Cone" Safety Valve)

"मोटा होने वाले" कमरे के साथ एक समस्या है। यदि कहानी या गाना बहुत लंबा हो जाता है, तो उन जटिल परिवर्तनों के लिए गणित विस्फोट कर सकता है, जिससे संख्याएं इतनी बड़ी हो सकती हैं कि कंप्यूटर उन्हें संभाल न सके (जैसे कि एक गुब्बारा फूलकर फट जाता है)।

इसे ठीक करने के लिए, लेखकों ने एक लाइट-कोन (LC) सुरक्षा वाल्व जोड़ा है।

  • उपमा: कल्पना कीजिए कि आप कार चला रहे हैं। यदि आप निरंतर गति से चलते हैं, तो घर से आपकी दूरी हमेशा बढ़ती रहती है। लेकिन यदि आपके पास एक गति सीमा है जो आगे जाने पर कम होती जाती है, तो आप बिना पेट्रोल खत्म हुए या दुर्घटनाग्रस्त हुए हमेशा के लिए गाड़ी चला सकते हैं।
  • यह कैसे काम करता है: LC विधि "दूरी" के गणित को संकुचित (compress) करती है। यह AI को लंबी दूरियों को समझने में मदद करती है बिना संख्याओं के खतरनाक रूप से बड़े हुए। हालाँकि, इसमें एक समझौता (trade-off) है: दूरी को संकुचित करके, आप इस बात की सटीकता खो देते है कि कोई चीज़ वास्तव में कितनी दूर है। यह स्थिरता (stability) (क्रैश न होना) और रिज़ॉल्यूशन (resolution) (बारीक विवरण देखना) के बीच का समझौता है।

4. प्रयोगों ने क्या दिखाया

लेखकों ने यह परीक्षण करने के लिए कि AI वास्तव में किन "कमरों" का उपयोग करता है, विभिन्न कार्यों के साथ इस "एक-घर" वाले विचार का परीक्षण किया:

  • सिंथेटिक टेस्ट (Synthetic Tests): जब उन्होंने AI को केवल "लहरों" का उपयोग करने के लिए डिज़ाइन किए गए एक नकली कार्य में दिया, तो AI ने "लहराने वाला" कमरा चालू कर दिया। जब उन्होंने इसे "तत्परता" के लिए डिज़ाइन किए गए कार्य में दिया, तो AI ने "तत्परता" वाला कमरा चालू कर दिया। इसने साबित किया कि AI वास्तव में सही उपकरण चुनने में सक्षम है।
  • भाषा (टेक्स्ट पढ़ना): जब AI ने लंबे टेक्स्ट (जैसे वॉर एंड पीस) को पढ़ा, तो उसने मुख्य रूप से तत्परता (Urgency) कमरे का उपयोग किया। उसे हाल के शब्दों की सबसे अधिक चिंता थी, जो पढ़ने के संदर्भ में समझ में आता है।
  • संगीत (शीट म्यूजिक पढ़ना): जब AI ने संगीत के टोकन को सुना, तो उसने एक मिश्रण का उपयोग किया। उसे तत्परता कमरे की पसंद थी, लेकिन उसने लहराने वाले और मोटा होने वाले कमरों को भी थोड़ा खुला रखा। यह समझ में आता है क्योंकि संगीत में दोहराव वाले पैटर्न (लहरें) और जटिल संरचनाएं (मोटा होना) होती हैं जिन्हें शुद्ध तत्परता नहीं पकड़ सकती।
  • स्थिरता परीक्षण (Stability Test): उन्होंने पुष्टि की कि बिना लाइट-कोन सुरक्षा वाल्व के, AI बहुत लंबे अनुक्रमों को पढ़ते समय क्रैश हो गया। वाल्व के साथ, यह स्थिर रहा, हालांकि इसने दूर के नोट्स के लिए थोड़ी सटीकता खो दी।

सारांश

यह शोध पत्र तर्क देता है कि हमें इस बात पर लड़ने की ज़रूरत नहीं है कि कौन सी पोजीशनल-एनकोडिंग विधि सबसे अच्छी है। इसके बजाय, हमें एक यूनिवर्सल पोजीशन स्पेस बनाना चाहिए जिसमें सभी विधियाँ (लहरें, जटिल परिवर्तन और तत्परता) शामिल हों। हम AI को यह सीखने देते हैं कि काम के हिसाब से उस स्पेस के किस हिस्से का उपयोग करना है।

  • पढ़ने के लिए: यह "तत्परता" पर निर्भर करता है।
  • संगीत के लिए: यह "तत्परता" को "लहरों" और "जटिल परिवर्तनों" के साथ संतुलित करता है।
  • बहुत लंबे कार्यों के लिए: यह गणित को फटने से बचाने के लिए "सुरक्षा वाल्व" का उपयोग करता है, स्थिरता के लिए सूक्ष्म विवरणों के छोटे से नुकसान को स्वीकार करते हुए।

यह शोध पत्र मूल रूप से एक स्मार्ट और अधिक अनुकूलनीय तरीके के लिए ब्लूप्रिंट है जिससे AI अनुक्रम में चीजों के "स्थान" को समझ सके, जो यह सिद्ध करता है कि विभिन्न कार्यों के लिए स्थिति जागरूकता के विभिन्न "फ्लेवर्स" की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →