← नवीनतम पेपर
💬 NLP

HiCI: Hierarchical Construction-Integration for Long-Context Attention

यह शोध पत्र HiCI का प्रस्ताव करता है, जो संज्ञानात्मक सिद्धांतों से प्रेरित एक पैरामीटर-कुशल पदानुक्रमित अटेंशन मॉड्यूल है, जो LLaMA-2 की कॉन्टेक्स्ट विंडो को 100K टोकन तक प्रभावी ढंग से विस्तारित करने के लिए सेगमेंट-स्तरीय निरूपणों (representations) का निर्माण और एकीकरण करता है और विभिन्न लॉन्ग-कॉन्टेक्स्ट कार्यों पर मजबूत बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Xiangyu Zeng, Qi Xu, Yunke Wang, Chang Xu

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangyu Zeng, Qi Xu, Yunke Wang, Chang Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ HiCI पेपर का स्पष्टीकरण दिया गया है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) में अनुवादित किया गया है।

बड़ी समस्या: "लाइब्रेरी ऑफ बाबेल" (The Library of Babel)

कल्पना कीजिए कि आपके पास एक सुपर-इंटेलिजेंट लाइब्रेरियन (एक AI) है जिसने दुनिया की हर किताब पढ़ ली है। लेकिन एक पेंच है: इस लाइब्रेरियन का ध्यान बहुत जल्दी भटक जाता है। वह एक बार में केवल 4,000 शब्द ही अपने दिमाग में रख सकता है। यदि आप उसे 1,00,000 शब्दों का एक उपन्यास देते हैं, तो वह घबरा जाता है। वह शुरुआत और अंत को तो याद रख सकता है, लेकिन वह बीच के हिस्से को पूरी तरह भूल जाता है, या वह इस बात में भ्रमित हो जाता है कि कौन क्या बोल रहा है।

वर्तमान AI मॉडल इसी समस्या का सामना करते हैं। जैसे-जैसे टेक्स्ट लंबा होता जाता है, कंप्यूटर धीमा होता जाता है (क्योंकि वह हर शब्द को दूसरे हर शब्द के साथ जोड़ने की कोशिश करता है) और AI "मूर्ख" हो जाता है क्योंकि वह पूरी कहानी के माध्यम से कड़ियों को जोड़ने में असमर्थ होता है।

समाधान: HiCI (Hierarchical Construction–Integration)

HiCI के पीछे के शोधकर्ताओं ने यह देखा कि इंसान लंबी कहानियों को कैसे समझते हैं। हम एक साथ उपन्यास के हर एक शब्द को याद रखने की कोशिश नहीं करते। इसके बजाय, हम एक अध्याय पढ़ते हैं, मुख्य बिंदुओं का सारांश (summary) बनाते हैं, और फिर अगले अध्याय पर बढ़ जाते हैं, जिससे हमारे दिमाग में एक "बड़ी तस्वीर" (big picture) बनी रहती है।

HiCI AI को भी यही करने के लिए सिखाता है। यह लंबे टेक्स्ट को प्रबंधनीय टुकड़ों (chunks) में तोड़ता है और मानव मनोविज्ञान से प्रेरित तीन चरणों वाली प्रक्रिया का उपयोग करता है: निर्माण (Construction), एकीकरण (Integration), और प्रसार (Broadcast)


HiCI के तीन चरण

1. लोकल कंस्ट्रक्शन (Local Construction): "अध्याय सारांशकर्ता" (The Chapter Summarizer)

उपमा: कल्पना कीजिए कि आप 500 पन्नों की एक किताब पढ़ रहे हैं। हर वाक्य को याद करने के बजाय, आप एक अध्याय (एक "सेगमेंट") पढ़ते हैं और एक स्टिकी नोट पर उसके 5 वाक्यों का सारांश लिखते हैं।
HiCI इसे कैसे करता है: AI लंबे टेक्स्ट को छोटे टुकड़ों में विभाजित करता है। प्रत्येक टुकड़े के लिए, यह एक छोटा, संकुचित "सारांश" (एक स्थानीय प्रतिनिधित्व/local representation) बनाता है। यह हर विवरण को नहीं रखता; यह केवल उस खंड के सबसे महत्वपूर्ण "भाव" (vibe) को रखता है। यह पूरे अध्याय को एक एकल स्टिकी नोट में समेटने जैसा है।

2. ग्लोबल इंटीग्रेशन (Global Integration): "सारांशों का मिलन" (The Meeting of the Summaries)

उपमा: अब, कल्पना कीजिए कि आपके पास हर अध्याय के लिए स्टिकी नोट्स हैं। आप उन सभी को एक मेज पर रखते हैं और उन्हें एक साथ देखते हैं। आप पैटर्न देखते हैं: "ओह, विलेन अध्याय 3 में आया था, और हीरो अध्याय 10 में उसे ढूंढ रहा है।" आप इन सारांशों के आधार पर पूरी कहानी का एक मास्टर मैप (Master Map) तैयार करते हैं।
HiCI इसे कैसे करता है: AI उन सभी छोटे "स्टिकी नोट" सारांशों को लेता है और उन्हें एक ग्लोबल कॉन्टेक्स्ट (Global Context) में मिला देता है। यह एक एकल, संक्षिप्त "मस्तिष्क" है जो पूरे 1,00,000 शब्दों के दस्तावेज़ का सार जानता है। यह एक साझा कार्यक्षेत्र (shared workspace) की तरह है जहाँ पूरी कहानी एक संकुचित रूप में रहती है।

3. टॉप-डाउन ब्रॉडकास्ट (Top-Down Broadcast): "टॉर्च की रोशनी" (The Flashlight)

उपमा: अब, आप अध्याय 10 के एक विशिष्ट वाक्य को फिर से पढ़ने जाते हैं। लेकिन इस बार, आप इसे शून्य में नहीं पढ़ रहे हैं। आपके पास मास्टर मैप (ग्लोबल कॉन्टेक्स्ट) और अध्याय 10 का सारांश (लोकल कॉन्टेक्स्ट) ठीक आपके बगल में है। आप उस वाक्य पर टॉर्च की रोशनी डालते हैं, और उस रोशनी का रंग पूरी कहानी से प्रभावित होता है। आप तुरंत समझ जाते हैं कि हीरो विलेन को क्यों ढूंढ रहा है क्योंकि आपके पास पूरी तस्वीर मौजूद है।
HiCI इसे कैसे करता है: जब AI किसी विशिष्ट शब्द को प्रोसेस करता है, तो वह केवल अपने आस-पास के शब्दों को ही नहीं देखता। यह ग्लोबल मैप और लोकल सारांश को उस शब्द तक "ब्रॉडकास्ट" (प्रसारित) करता है। यह शब्द को एक "सुपरपावर" देता है: अब वह पूरी कहानी में अपने स्थान को समझता है, न कि केवल तत्काल पैराग्राफ को।


यह एक बड़ी बात क्यों है?

1. यह अत्यंत कुशल है (द स्मार्ट वे - The "Smart" Way)
पुराने तरीके कोशिश करते थे कि लाइब्रेरियन पूरी किताब को एक साथ पढ़े, जिसमें बहुत समय लगता और उनका दिमाग थक जाता। HiCI एक टीम के सहायकों को काम पर रखने जैसा है। प्रत्येक सहायक एक अध्याय का सारांश बनाता है, वे एक मैप बनाने के लिए मिलते हैं, और फिर वे लाइब्रेरियन को विवरण पढ़ने में मदद करते हैं।

  • परिणाम: अब AI बिना धीमे हुए या भ्रमित हुए 1,00,000 शब्द (7B मॉडल के लिए) और 64,000 शब्द (13B मॉडल के लिए) संभाल सकता है।

2. यह सस्ता है (द बजट वे - The "Budget" Way)
आमतौर पर, AI को स्मार्ट बनाने के लिए, आपको उसका पूरा दिमाग फिर से बनाना पड़ता है, जिसमें कंप्यूटिंग पावर के करोड़ों डॉलर खर्च होते हैं। HiCI मौजूदा AI पर एक नया, स्मार्ट "चश्मा" लगाने जैसा है।

  • परिणाम: उन्होंने मौजूदा LLaMA-2 मॉडल्स में केवल लगभग 5.5% अधिक "मस्तिष्क कोशिकाएं" (parameters) जोड़ीं। यह एक विशाल क्षमता वृद्धि के लिए एक बहुत छोटा अपग्रेड है।

3. यह वास्तव में काम करता है (द प्रूफ - The "Proof")
शोधकर्ताओं ने कठिन कार्यों पर इसका परीक्षण किया:

  • "नीडल इन अ हेस्टैक" टेस्ट (The "Needle in a Haystack" Test): उन्होंने 32,000 शब्दों के दस्तावेज़ में एक गुप्त कोड छिपाया। HiCI ने इसे 100% समय खोज निकाला, जबकि अन्य मॉडल खो गए।
  • "कोड" टेस्ट (The "Code" Test): यह कंप्यूटर कोड को समझने में GPT-3.5-Turbo-16K (एक बहुत प्रसिद्ध, महंगा मॉडल) से भी बेहतर रहा।
  • "विषय" टेस्ट (The "Topic" Test): यह किसी भी अन्य ओपन-सोर्स मॉडल की तुलना में लंबी बातचीत में विशिष्ट विषयों को बेहतर ढंग से खोज सका।

निष्कर्ष (The Bottom Line)

HiCI एक चतुर तकनीक है जो AI को लंबे टेक्स्ट से अभिभूत (overwhelmed) होने से रोकती है। सब कुछ एक साथ याद रखने के बजाय, यह सारांश निकालने, जोड़ने और फिर बड़ी तस्वीर के लाभ के साथ पुन: पढ़ने का तरीका सीखती है। यह एक छात्र को अंतिम परीक्षा के लिए अध्ययन करने का तरीका सिखाने जैसा है—किताब को अध्यायों में तोड़ना, एक स्टडी गाइड बनाना, और फिर उस गाइड का उपयोग करके परीक्षा में अव्वल आना।

यह दृष्टिकोण ओपन-सोर्स मॉडल्स को सबसे महंगे, प्रोप्रायटरी (proprietary) AI मॉडल्स के साथ प्रतिस्पर्धा करने की अनुमति देता है, जिससे लंबे-कॉन्टेक्स्ट को समझना सभी के लिए सुलभ हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →