← नवीनतम पेपर
💻 computer science

Move the Query, Not the Cache: Characterizing Cross-Instance Latent Attention Redistribution Across GPU Fabrics

यह शोध पत्र यह प्रदर्शित करके फ्रंटियर LLMs में क्रॉस-इंस्टेंस अटेंशन को अभिलक्षित करता है कि कंप्रेस्ड क्वेरी वेक्टर्स को रूट करना अक्सर GPU फैब्रिक्स के माध्यम से KV-कैश ब्लॉक्स को स्थानांतरित करने की तुलना में अधिक कुशल होता है, और वास्तविक मल्टी-नोड H100 क्लस्टर्स पर इस विकल्प को अनुकूलित करने के लिए एक मान्य टोपोलॉजी-अवेयर कॉस्ट मॉडल और निर्णय प्रेडिकेट प्रदान करता है।

मूल लेखक: Bole Ma, Jan Eitzinger, Harald Köstler, Gerhard Wellein

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bole Ma, Jan Eitzinger, Harald Köstler, Gerhard Wellein

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Move the Query, Not the Cache" पेपर का एक सरल भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।

बड़ी समस्या: पुस्तकालय बनाम पाठक

कल्पना कीजिए कि एक विशाल पुस्तकालय (AI का ज्ञान आधार) है जो इतना बड़ा है कि वह एक इमारत में नहीं समा सकता। यह कई अलग-अलग पुस्तकालय शाखाओं (विभिन्न GPUs) में फैला हुआ है।

अब, कल्पना कीजिए कि एक पाठक (सवाल प्रोसेस करने वाला AI) शाखा A में बैठा है। उसे एक विशिष्ट तथ्य को खोजने की आवश्यकता है जो शाखा B के शेल्फ पर रखी एक किताब में संग्रहीत है।

पुराना तरीका (कैश को मूव करना - Moving the Cache):
अतीत में, मानक समाधान यह था कि शाखा B तक एक ट्रक भेजा जाए, शाखा B की पूरी किताब ट्रक पर लाद दी जाए, उसे शाखा A में वापस लाया जाए, और फिर पाठक को पढ़ने दिया जाए।

  • समस्या: किताबें भारी और बड़ी होती हैं। भले ही पाठक को केवल एक वाक्य की आवश्यकता हो, आपको पूरी किताब को ले जाना पड़ता है। यदि पुस्तकालय बहुत बड़ा है, तो यह ट्रकिंग प्रक्रिया बहुत समय लेती है और सड़कों को जाम कर देती है।

नया विचार (क्वेरी को मूव करना - Moving the Query):
यह पेपर एक स्मार्ट दृष्टिकोण का सुझाव देता है: किताब लाने के लिए ट्रक भेजने के बजाय, शाखा B को एक छोटा, हल्का नोट (the "Query") भेजें। नोट कहता है, "कृपया अपनी किताब में यह विशिष्ट वाक्य देखें और उत्तर को एक पोस्टकार्ड पर लिख दें।"

  • लाभ: नोट बहुत छोटा है (लग लगभग 1 किलोबाइट)। किताब बहुत बड़ी है (लाखों बाइट्स)। लाइब्रेरी को पोस्टकार्ड भेजना और जवाब प्राप्त करना, ट्रक को बार-बार लाने-ले जाने से कहीं अधिक तेज़ है।

गुप्त मंत्र: "MLA" (संकुचित पुस्तक - The Compressed Book)

यह अब क्यों काम कर रहा है जबकि पहले नहीं कर रहा था? यह पेपर एक विशेष प्रकार के AI आर्किटेक्चर पर ध्यान केंद्रित करता है जिसे Multi-head Latent Attention (MLA) कहा जाता है।

MLA को एक विशेष संपीड़न तकनीक (compression technique) के रूप में समझें। पुराने AI मॉडल में, "किताब" (डेटा) बहुत बड़ी और बोझिल थी। लेकिन MLA के साथ, AI किताब के हर पन्ने को एक छोटे, सघन सारांश (dense summary) में संकुचित कर देता है।

  • क्योंकि डेटा इतना संकुचित है, "किताब" अभी भी बड़ी है, लेकिन जिस "वाक्य" को पाठक को खोजना है, वह अविश्वसनीय रूप से छोटा है।
  • यह एक बड़ा असंतुलन पैदा करता है: Query (नोट) बहुत छोटा है, लेकिन Cache (किताब) अभी भी बड़ी है। यह नोट भेजना स्पष्ट रूप से बेहतर विकल्प बनाता है।

प्रयोग: सड़कों का परीक्षण करना

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने वास्तविक, उच्च गति वाले सुपरकंप्यूटरों (NVIDIA H100 चिप्स का उपयोग करके) पर इसका परीक्षण किया। उन्होंने दो मुख्य चीजों को देखा:

  1. सड़क का प्रकार (नेटवर्क - The Network): उन्होंने कंप्यूटरों को जोड़ने वाले विभिन्न "रास्तों" का परीक्षण किया, स्थानीय केबलों (NVLink) से लेकर दूसरे भवनों को जोड़ने वाले फाइबर ऑप्टिक्स (InfiniBand) तक।

    • निष्कर्ष: सबसे तेज़ सड़कों पर भी, बड़ी किताब को मूव करना धीमा है क्योंकि इसमें "लोडिंग समय" (किताब को ले जाने के लिए तैयार करने का समय) लगता है। छोटा नोट भेजना तेज़ है क्योंकि यह एक त्वरित यात्रा है।
    • आश्चर्य: बहुत तेज़ सड़कों पर भी, सड़क की गति उतनी महत्वपूर्ण नहीं थी जितनी कि "ट्रक ड्राइवर" की गति (डेटा ट्रांसफर शुरू करने की कंप्यूटर की क्षमता)। एक छोटा नोट धीमी सड़क पर भी उतनी ही तेज़ी से चलता है जितनी तेज़ सड़क पर, क्योंकि नोट इतना छोटा है कि उसे पूरी सड़क की ज़रूरत नहीं पड़ती।
  2. "स्प्लिस" टैक्स (The "Splice" Tax):

    • जब आप एक किताब को एक शाखा से दूसरी शाखा में ले जाते हैं, तो आपको अक्सर उसे फिर से बांधना पड़ता है या पन्नों को व्यवस्थित करना पड़ता है ताकि वे नए शेल्फ में फिट हो सकें। पेपर इसे "स्प्लिस" (splice) कहता है। किताब को तैयार करने में ही लगभग 3 मिलीसेकंड (कंप्यूटर की दुनिया में एक लंबा समय) लग जाते हैं।
    • नोट को मूव करने से इस टैक्स से पूरी तरह बचा जा जा सकता है। नोट पहुँचता है, उसका उत्तर मिलता है, और वह चला जाता है।

AI मैनेजर के लिए नियम

पेपर AI सिस्टम के "मैनेजर" के लिए निर्णय लेने हेतु सरल नियमों का एक सेट देता है:

  • नियम 1: बातचीत की शुरुआत में (Decoding), हमेशा नोट भेजें।
    यदि AI चरण-दर-चरण सवाल का जवाब दे रहा है, तो "नोट" इतना छोटा है और "किताब" इतनी बड़ी है कि नोट भेजना किताब को मूव करने की तुलना में 60 से 100 गुना तेज़ है।
  • नियम 2: किताब को तभी मूव करें जब आप उसे बहुत बार पढ़ने वाले हों।
    यदि AI को लंबे समय तक उसी स्थान पर उसी किताब की आवश्यकता होने वाली है, तो एक बार किताब को मूव करके वहीं रखना सार्थक हो सकता है। लेकिन त्वरित, एक बार के सवालों के लिए, नोट भेजें।
  • नियम 3: सड़क की गति की चिंता न करें।
    इन छोटे नोट्स के लिए, एक धीमी सड़क तेज़ सड़क के लगभग बराबर ही है। बाधा (bottleneck) सड़क नहीं है; बाधा नोट लिखने में लगने वाला समय है।

"एजेंट" परिदृश्य (The "Agent" Scenario)

पेपर एक विशिष्ट उपयोग मामला बताता है: एजेंटिक वर्कलोड (Agentic Workloads)। कल्पना कीजिए कि डिजिटल सहायकों (एजेंटों) की एक टीम एक ही विशाल कोड मैनुअल या कानूनी अनुबंध को पढ़ने की कोशिश कर रही है।

  • पुराना तरीका: हर बार जब कोई एजेंट सवाल पूछता है, तो सिस्टम उस मैनुअल के प्रासंगिक हिस्से को उस एजेंट के कंप्यूटर तक खींचने की कोशिश करता है।
  • नया तरीका: सिस्टम एजेंट का सवाल उस कंप्यूटर को भेजता है जहाँ मैनुअल रखा है। वह कंप्यूटर उसका उत्तर देता है और छोटा परिणाम वापस भेज देता है। मैनुअल अपनी जगह पर ही रहता है। यह सैकड़ों एजेंटों को नेटवर्क को जाम किए बिना एक साथ सवाल पूछने की अनुमति देता है।

सारांश

यह पेपर सिद्ध करता है कि आधुनिक, संकुचित AI मॉडल के लिए, डेटा को सवाल के पास भेजने के बजाय, सवाल को डेटा के पास भेजना लगभग हमेशा तेज़ होता है।

उन्होंने एक गणितीय सूत्र (एक "कॉस्ट मॉडल") बनाया है जो कंप्यूटर सिस्टम को ठीक से बताता है कि यह कब करना है। यह पता चला है कि AI द्वारा सोचते समय पूछे जाने वाले छोटे, तेज़-तर्रार सवालों के लिए, "क्वेरी को मूव करना" स्पष्ट रूप से विजेता है, जिससे बहुत अधिक समय और ऊर्जा की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →