← नवीनतम पेपर
💬 NLP

PaTH Attention: Position Encoding via Accumulating Householder Transformations

यह शोध पत्र PaTH को प्रस्तुत करता है, जो संचित हाउसहोल्डर रूपांतरणों (accumulated Householder transformations) पर आधारित एक लचीला, डेटा-निर्भर स्थिति एन्कोडिंग (position encoding) तंत्र है, जो भाषा मॉडलिंग कार्यों में मानक रोटरी पोजीशन एन्कोडिंग (RoPE) से बेहतर प्रदर्शन करता है और साथ ही कुशल समानांतर प्रशिक्षण और प्रीट्रेन्ड RoPE मॉडल को परिवर्तित करने की क्षमता भी प्रदान करता है।

मूल लेखक: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

प्रकाशित 2026-02-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Songlin Yang, Yikang Shen, Kaiyue Wen, Shawn Tan, Mayank Mishra, Liliang Ren, Rameswar Panda, Yoon Kim

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "PaTH Attention" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करते हुए स्पष्टीकरण दिया गया है।

बड़ी समस्या: "अंधी" स्मृति (The "Blind" Memory)

कल्पना कीजिए कि एक बड़ा लैंग्वेज मॉडल (जैसे कि वह जिससे आप अभी बात कर रहे हैं) एक बहुत ही बुद्धिमान लाइब्रेरियन की तरह है जो आपके सवालों के जवाब देने के लिए एक लंबी किताब पढ़ रहा है। कहानी को समझने के लिए, लाइब्रेरियन को न केवल यह जानने की ज़रूरत है कि शब्द क्या हैं, बल्कि यह भी कि वे किताब में कहाँ दिखाई देते हैं।

वर्तमान मॉडल शब्दों की स्थिति को याद रखने के लिए RoPE (रोटरी पोजीशन एनकोडिंग) नामक एक प्रणाली का उपयोग करते हैं। RoPE को एक निश्चित, पहले से छपे हुए रूलर (पैमाने) की तरह समझें।

  • यदि आप एक शब्द को पेज 1 से पेज 2 पर ले जाते हैं, तो रूलर उसे एक तय मात्रा में खिसका देता है।
  • दोष: यह रूलर कंटेंट (सामग्री) के प्रति "अंधा" है। यह "apple" शब्द और "rocket" शब्द के साथ बिल्कुल एक जैसा व्यवहार करता है क्योंकि वे एक ही स्थान पर हैं। इसे इस बात से कोई फर्क नहीं पड़ता कि कहानी एक फल के बारे में है या एक अंतरिक्ष यान के बारे में। इस कारण से, जब कहानी में जटिल, चरण-दर-चरण तर्क (जैसे कि एक लंबी सूची में कौन सी चीज़ किसकी है, इसे ट्रैक करना) की आवश्यकता होती है, तो लाइब्रेरियन कभी-कभी भ्रमित हो जाता है।

समाधान: PaTH (एक "स्मार्ट" रूलर)

लेखकों ने PaTH पेश किया है, जो स्थिति को याद रखने का एक नया तरीका है। एक निश्चित रूलर के बजाय, Paв एक डायनेमिक, आकार बदलने वाला रूलर है जो उस कहानी के आधार पर अपना आकार बदल लेता है जिसे वह पढ़ रहा है।

  • यह कैसे काम करता है: जैसे-जैसे लाइब्रेरियन प्रत्येक शब्द को पढ़ता है, PaTH पिछले शब्दों की स्मृति पर एक विशेष गणितीय "ट्विस्ट" (जिसे हाउसहोल्डर ट्रांसफॉर्मेशन कहा जाता है) लागू करता है।
  • उपमा (Analogy): कल्पना कीजिए कि आप शीशों वाले एक गलियारे (hallway) से गुजर रहे हैं।
    • RoPE: शीशे स्थिर हैं। आप कुछ भी पहनें, आपका प्रतिबिंब एक जैसा ही दिखता है।
    • PaTH: शीशे स्मार्ट हैं। यदि आपने लाल टोपी पहनी है, तो शीशा आपके प्रतिबिंब को एक दिशा में घुमा देगा। यदि आपने नीली टोपी पहनी है, तो वह उसे दूसरी दिशा में घुमा देगा। यह "ट्विस्ट" वास्तविक सामग्री (टोपी) पर निर्भर करता है जो आपने पहनी हुई है।

यह मॉडल को स्मृति का एक "पथ" (path) बनाने की अनुमति देता है जो उसके द्वारा प्रोसेस किए जा रहे विशिष्ट डेटा के अनुकूल होता है, जिससे यह उन पहेलियों को सुलझाने में बहुत बेहतर हो जाता है जिनमें स्टेट्स (states) को ट्रैक करने की आवश्यकता होती है (जैसे कि कंप्यूटर कोड में एक वेरिएबल की वैल्यू को याद रखना)।

जादुई ट्रिक: इसे तेज़ करना

आमतौर पर, हर एक शब्द के लिए आकार बदलने वाला रूलर बनाना अविश्वसनीय रूप से धीमा और गणनात्मक रूप से महंगा होगा। यह हर कदम उठाने पर पूरे गलियारे के दर्पण के कोणों की पुनर्गणना करने जैसा होगा।

पेपर का दूसरा प्रमुख योगदान एक स्पीड-अप एल्गोरिदम है (जो 'फ्लैश अटेंशन' जैसी किसी चीज़ के समान है)।

  • उपमा: हर बार पूरे गलियारे की पुनर्गणना करने के बजाय, लेखकों ने एक चतुर शॉर्टकट खोजा। उन्होंने महसूस किया कि यदि वे शीशों को छोटे ब्लॉकों में समूहबद्ध करते हैं, तो वे एक संक्षिप्त गणितीय सूत्र का उपयोग करके एक साथ पूरे ब्लॉक के लिए "ट्विस्ट" की गणना कर सकते हैं।
  • परिणाम: उन्होंने एक ऐसा सिस्टम बनाया जो पुराने निश्चित-रूलर सिस्टम (RoPE) जितना ही तेज़ चलता है, लेकिन नए सिस्टम के "स्मार्ट, बदलने वाले" लाभों को भी बनाए रखता है।

उन्होंने क्या सिद्ध किया?

लेखकों ने इस नए सिस्टम का परीक्षण दो तरीकों से किया:

  1. सिंथेटिक पहेलियाँ (The "Training Wheels"):
    उन्होंने मॉडल को सरल तर्क खेल दिए, जैसे कि एक "फ्लिप-फ्लॉप" खेल जहाँ उसे यह याद रखना होता है कि स्विच आखिरी बार कब बदला गया था, या जटिल गणितीय नियमों से जुड़ा एक "वर्ड प्रॉब्लम" गेम।

    • परिणाम: पुराने मॉडल (RoPE) अक्सर इन पहेलियों में विफल रहे, क्योंकि वे अनुक्रम (sequence) को लेकर भ्रमित हो गए। नया PaTH मॉडल उन्हें लगभग पूरी तरह से हल करता है, भले ही उसमें दूसरों की तुलना में कम "ब्रेन लेयर्स" हों।
  2. वास्तविक भाषा कार्य (Real Language Tasks):
    उन्होंने वास्तविक टेक्स्ट (किताबें, कोड, बातचीत) पर मॉडल को प्रशिक्षित किया।

    • परिणाम: PaTH मॉडल लंबे संदर्भों (बहुत लंबी किताबें पढ़ने और शुरुआत को न भूलने) को समझने में बेहतर थे और तर्क संबंधी कार्यों, विशेष रूप से कोडिंग और गणित में बेहतर प्रदर्शन करते थे।
    • बोनस: उन्होंने दिखाया कि आप मौजूदा मॉडल जिसे पुराने "निश्चित रूलर" (RoPE) के साथ प्रशिक्षित किया गया है, उसे थोड़े से अतिरिक्त प्रशिक्षण के साथ "स्मार्ट रूलर" (PaTH) में बदल सकते हैं, बिना शून्य से शुरुआत किए।

निष्कर्ष (The Bottom Line)

PaTH शब्दों के क्रम को याद रखने का एक नया तरीका है। एक कठोर, एक ही आकार के सिस्टम के बजाय, यह एक लचीला सिस्टम उपयोग करता है जो स्वयं शब्दों के आधार पर बदलता है। लेखकों ने यह पता लगाया कि इस लचीले सिस्टम को व्यावहारिक बनाने के लिए इसे तेज़ कैसे चलाया जाए, जिसके परिणामस्वरूप AI मॉडल तर्क करने, लंबी दूरी तक जानकारी को ट्रैक करने और जटिल अनुक्रमों को समझने में बेहतर होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →