← नवीनतम पेपर
💻 computer science

Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols

यह शोध पत्र सेल्फ-सिंथेसाइजिंग रीजनिंग प्रोटोकॉल (SSRP) को प्रस्तुत करता है, जो एक मेटाकॉग्निटिव फ्रेमवर्क है जो स्वायत्त LLM एजेंटों में "अटेंशन लैच" विफलता मोड से उबरने के लिए आर्किटेक्चरल प्लानिंग को प्रोसीजरल एक्जीक्यूशन से अलग करता है, और कई आर्किटेक्चर और डेटासेट्स में बेसलाइन मॉडल्स की तुलना में 715 गुना लचीलापन सुधार प्रदर्शित करता है।

मूल लेखक: Dahlia Shehata, Ming Li

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dahlia Shehata, Ming Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "मेमोरी लैच" (याददाश्त का अटकना)

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़ी भूलक्कड़ डिजिटल असिस्टेंट के साथ काम कर रहे हैं। आप उसे एक काम देते हैं: "लंदन के लिए एक फ्लाइट बुक करो।" वह काम करना शुरू करता है। फिर, बातचीत के बीच में ही, आप कहते हैं, "दरअसल, इसे छोड़ो। इसके बजाय पेरिस के लिए फ्लाइट बुक करो।"

एक आदर्श दुनिया में, असिस्टेंट को तुरंत लंदन की योजना छोड़ देनी चाहिए और पेरिस पर ध्यान केंद्रित करना चाहिए। लेकिन यह पेपर तर्क देता है कि वर्तमान AI मॉडल अक्सर "अटेंशन लैच" (Attention Latch) नामक एक गड़बड़ी का शिकार होते हैं।

AI की याददाश्त को एक भारी, चिपचिपे चुंबक की तरह समझें। आप जो पहले निर्देश देते हैं (लंदन की योजना), वह चुंबक से इतनी मजबूती से चिपक जाता है कि जब आप नया निर्देश चिल्लाते हैं ("पेरिस!"), तो चुंबक उसे छोड़ने से इनकार कर देता है। AI उस पुराने विचार पर "लैच" (अटक) जाता है। ऐसा नहीं है कि AI नई रिक्वेस्ट को समझ नहीं सकता; बल्कि यह है कि पुरानी बातचीत का भार इतना भारी है कि वह नई बात को सुनने ही नहीं देता।

लेखक इसे "इन्फॉर्मेशन ओवर-स्क्वैशिंग" (Information Over-squashing) कहते हैं। कल्पना कीजिए कि आप एक फुसफुसाहट (नया निर्देश) सुनने की कोशिश कर रहे हैं, जबकि कोई आपके कान के पास ज़ोर-ज़ोर से गाना गा रहा है (पुराने निर्देश)। वह फुसफुसाहट शोर में खो जाती है।

खोज: "क्लिफ" (चट्टान/खाई)

शोधकर्ताओं ने पाया कि यह समस्या एक विशिष्ट बिंदु पर विनाशकारी हो जाती है। वे इसे "अटेंशन स्टेबिलिटी बाउंड्री" (ASB) कहते हैं।

उन्होंने AI का परीक्षण उन कार्यों के साथ किया जिसमें एक लंबी बातचीत (जैसे 10,000 शब्दों का दस्तावेज़) के भीतर गहराई में दबी तीन अलग-अलग जानकारियों को जोड़ने की आवश्यकता थी।

  • परिणाम: जब AI को इस "थ्री-हॉप" लॉजिक पहेली को हल करना था, तो मानक AI मॉडल क्रैश हो गए। उनकी सफलता दर गिरकर 0.1% रह गई।
  • उपमा: यह एक ड्राइवर से एक जटिल भूलभुलैया (maze) में रास्ता खोजने के लिए कहने जैसा है, जबकि उसने ऐसी पट्टी (blinders) पहनी हुई है जिससे वह केवल वही रास्ता देख सकता है जिस पर वह 10 मिनट पहले चल रहा था। वह उस मोड़ को देखने में पूरी तरह असमर्थ है जिसे उसे अभी लेना है।

समाधान: "आर्किटेक्ट" और "एग्जीक्यूटिव"

इसे ठीक करने के लिए, लेखकों ने एक नया सिस्टम बनाया जिसे "सेल्फ-सिंथेसाइजिंग रीजनिंग प्रोटोकॉल्स" (SSRP) कहा जाता है। AI को सब कुछ एक बार में करने देने के बजाय, उन्होंने काम को दो अलग-अलग भूमिकाओं में विभाजित कर दिया, जैसे कि एक निर्माण स्थल (construction site) पर होता है:

  1. द आर्किटेक्ट (दिमाग): यह एक उच्च-स्तरीय विचारक है। इसका एकमात्र काम शोर को अनदेखा करना, अव्यवस्थित बातचीत को देखना और एक स्पष्ट, चरण-दर-चरण "स्टैंडर्ड ऑपरेटिंग प्रोसीजर" (SOP) लिखना है। यह एक प्रोजेक्ट मैनेजर की तरह कार्य करता है जो कहता है, "पुराने ब्लूप्रिंट को देखना बंद करो। यह रहा नया, साफ प्लान। बाकी सब भूल जाओ।"
  2. द एग्जीक्यूटिव (वर्कर): यह AI का तेज़ और क्रिया-उन्मुख हिस्सा है। यह पूरी बातचीत को याद रखने की कोशिश नहीं करता। यह बस आर्किटेक्ट के नए, साफ प्लान का शब्द-दर-शब्द पालन करता है।

रूपक (Metaphor):
कल्पना कीजिए कि आप एक किताब पढ़ने की कोशिश कर रहे हैं, लेकिन कोई आपके कान में लगातार अजीब तथ्य चिल्ला रहा है।

  • पुराना तरीका (वैनिला AI): आप किताब पढ़ने की कोशिश करते हैं और साथ में चिल्लाते हैं, "रुको, मैंने बिल्ली के बारे में कुछ सुना!" आप भ्रमित हो जाते हैं और पढ़ना बंद कर देते हैं।
  • नया तरीका (SSRP): आपका एक दोस्त (द आर्किटेक्ट) चिल्लाहट को सुनता है, शोर को फ़िल्टर करता है, और एक स्टिकी नोट लिखता है: "बिल्ली अप्रासंगिक है। कहानी कुत्ते के बारे में है। पेज 5 पढ़ना जारी रखें।" आप (द एग्जीक्यूटिव) बस उस स्टिकी नोट को पढ़ते हैं और आगे बढ़ते हैं।

उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने 9,000 अलग-अलग परिदृश्य चलाए यह देखने के लिए कि क्या यह "दो-सदस्य टीम" एक अकेले AI की तुलना में बेहतर काम करती है।

  • परीक्षण: उन्होंने AI को बेवकूफ बनाने के लिए सही उत्तर को एक लंबी, शोर भरी बातचीत के बीच में दबा दिया, जिसके चारों ओर नकली सुराग थे।
  • परिणाम:
    • मानक AI: जब कार्य कठिन था, तो यह लगभग पूरी तरह विफल रहा (0.1% सफलता)।
    • SSRP AI: मानक AI की तुलना में 715 गुना अधिक बार सफल हुआ।
    • मॉडल्स के बीच: यह विभिन्न प्रकार के AI (Gemini, Claude, GPT, DeepSeek) के लिए भी काम कर गया, जिससे साबित हुआ कि यह एक संरचनात्मक सुधार है, न कि किसी एक विशेष मॉडल के लिए मिली कोई किस्मत वाली सफलता।

"ग्राउंडिंग पैराडॉक्स" (Grounding Paradox)

एक दिलचस्प खोज यह थी कि कुछ बहुत ही "सुरक्षित" (safe) AI मॉडल नए प्लान का पालन करने से इनकार कर देते थे।

  • विरोधाभास: AI अपने सुरक्षा नियमों का पालन करने और अपनी मूल ट्रेनिंग पर टिके रहने में इतना अच्छा था कि उसने एक नया रास्ता अपनाने से इनकार कर दिया, भले ही वह नया रास्ता ही सही था। यह एक ऐसे रोबोट की तरह था जो गलती करने के डर से इतना डरा हुआ था कि उसने हिलने से मना कर दिया, भले ही उसे जाने के लिए कहा गया था।
  • समाधान: शोधकर्ताओं ने पाया कि नए प्लान को एक "सुझाव" के बजाय एक "प्रशासनिक आदेश" (जैसे बॉस द्वारा सीधा कमांड देना) के रूप में पेश करने से, AI आखिरकार अपनी जिद छोड़ देता और आर्किटेक्ट के नए SOP का पालन करता।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि जैसे-जैसे AI स्मार्ट होता जा रहा है, उसे केवल अधिक मेमोरी की आवश्यकता नहीं है; उसे अपनी मेमोरी को व्यवस्थित (organize) करने के बेहतर तरीके की आवश्यकता है। "प्लान के बारे में सोचने" को "काम करने" से अलग करके, हम AI को पुराने विचारों में फंसने से रोक सकते हैं और उसे वर्तमान में महत्वपूर्ण चीज़ों पर ध्यान केंद्रित करने में मदद कर सकते हैं।

संक्षेप में: AI अतीत में अटक रहा था। समाधान यह था कि एक "प्रोजेक्ट मैनेजर" को नियुक्त किया जाए जो मानसिक अव्यवस्था को साफ करे और वर्कर को एक ताज़ा, साफ 'टू-डू लिस्ट' सौंप दे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →