← नवीनतम पेपर
🤖 AI

Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift

यह शोध पत्र ग्राफ-रेगुलराइज्ड एजेंटिक कॉन्टेक्स्ट इवोल्यूशन (GRACE) प्रस्तुत करता है, जो अपडेट के स्थानीय सत्यापन को सक्षम करने के लिए निरंतर सिस्टम निर्देशों को टाइप किए गए सिमेंटिक ग्राफ के रूप में संरचित करता है, जिससे फ्लैट-टेक्स्ट बेसलाइन की तुलना में डिस्ट्रीब्यूशन शिफ्ट के तहत एलएलएम (LLM) एजेंटों की लॉन्ग-होरिज़न विश्वसनीयता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Dan C. Hsu, Luke Lu

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dan C. Hsu, Luke Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक टेलीकॉम कंपनी के लिए कॉल संभालने वाले एक सुपर-स्मार्ट रोबोट असिस्टेंट को प्रशिक्षित कर रहे हैं। आप हर दिन रोबोट के दिमाग को रीप्रोग्राम नहीं कर सकते, और न ही आप उसके द्वारा उपयोग किए जाने वाले टूल्स को बदल सकते हैं। आप केवल उसकी "नियम पुस्तिका" (rulebook) में बदलाव कर सकते हैं—निर्देशों की एक लंबी सूची जो उसे बताती है कि उसे कैसे व्यवहार करना है, क्या कहना है, और किन चीजों से बचना है।

यह शोध पत्र, GRACE, एक सरल लेकिन पेचीदा सवाल पूछता है: आप उस नियम पुस्तिका को लंबे समय तक बिना किसी अव्यवस्थित या विरोधाभासी आपदा में बदले, कैसे अपडेट रख सकते हैं?

समस्या: "फ्लैट-टेक्स्ट" का जाल (The "Flat Text" Trap)

ज्यादातर लोग पूरी नियम पुस्तिका को फिर से लिखकर या एक लंबे टेक्स्ट डॉक्यूमेंट के अंत में नए पैराग्राफ जोड़कर अपडेट करने की कोशिश करते हैं। लेखक इसे "फ्लैट-टेक्स्ट मेंटेनेंस" कहते हैं।

इसे एक ग्रुप चैट की तरह समझें जहाँ हर कोई बस अंत में नए नियम टाइप करता जा रहा है। शुरुआत में, यह बहुत अच्छा काम करता है। लेकिन कुछ हफ्तों के बाद, चैट 500 पन्नों की हो जाती है। आपके पास पेज 10 पर एक नियम है जो कहता है "हमेशा विनम्र रहें," और पेज 499 पर एक नया नियम है जो कहता है "गुस्से में स्पष्टवादी (blunt) बनें।" चैट को यह पता नहीं चलता कि ये दोनों आपस में विरोधाभासी हैं। रोबोट भ्रमित हो जाता है, गलतियाँ करने लगता है, और अंततः पूरा सिस्टम टूट जाता है। शोध पत्र दिखाता है कि जब आप केवल टेक्स्ट जोड़ते रहते हैं, तो रोबोट की विश्वसनीयता वास्तव में कुछ समय बाद गिर जाती है।

समाधान: "स्मार्ट मैप" (GRACE)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे GRACE (Graph-Regularized Agentic Context Evolution) कहा जाता है। टेक्स्ट की एक लंबी सूची के बजाय, वे नियम पुस्तिका को एक स्ट्रक्चर्ड मैप (ग्राफ) में बदल देते हैं।

कल्पना कीजिए कि नियम केवल टेक्स्ट की पंक्तियाँ नहीं हैं, बल्कि एक मैप पर नोड्स (बिंदु) हैं, जो लाइनों से जुड़े हुए हैं जो दिखाते हैं कि वे एक-दूसरे से कैसे संबंधित हैं।

  • एक बिंदु एक "नियम" (जैसे, "विनम्र रहें") है।
  • दूसरा बिंदु एक "तथ्य" (जैसे, "ग्राहक थके हुए हैं") है।
  • एक लाइन उन्हें जोड़ती है जो कहती है, "यह तथ्य इस नियम का समर्थन करता है।"

जब रोबोट कोई गलती करता है, तो सिस्टम केवल एक नया पैराग्राफ नहीं लिखता। यह मैप को देखता है। यह उस विशिष्ट बिंदु (नियम) को ढूंढता है जिसने परेशानी पैदा की और उसके आस-पास के पड़ोस (neighbors) की जांच करता है।

  • क्या यह नया विचार अपने आस-पास के नियमों के साथ टकरा रहा है? (विरोधाभास की जांच)
  • क्या यह नया विचार पुराने विचार की केवल एक पुनरावृत्ति है? (पुनरावृत्ति की जांच)

यदि नया विचार मैप के स्थानीय परिवेश (local neighborhood) में फिट बैठता है, तो इसे जोड़ा जाता है। यदि यह मैप के तर्क को तोड़ता है, तो इसे तुरंत खारिज या ठीक कर दिया जाता है। अंत में, सिस्टम अपडेटेड मैप को वापस उस टेक्स्ट में बदल देता है जिसे रोबोट वास्तव में पढ़ता है।

प्रयोग: एक खींचतान (A Tug-of-War)

शोधकर्ताओं ने एक विशिष्ट रोबोट मॉडल (Gemini 2.5 Flash) का उपयोग करके एक सिम्युलेटेड टेलीकॉम वातावरण (एक नकली फोन कंपनी) में इसका परीक्षण किया। परिणामों की पुष्टि के लिए उन्होंने सिमुलेशन को पाँच बार चलाया। उन्होंने रोबोट के सामने आने वाले कॉल के प्रकारों को हर कुछ राउंड के बाद बदला ताकि यह देखा जा सके कि क्या नियम पुस्तिका बिना बिखरे अनुकूलित हो सकती है।

यहाँ क्या हुआ:

  1. शुरुआती बिंदु: किसी भी अपडेट से पहले, रोबलेट विश्वसनीयता के मामले में बहुत खराब था। वह सख्त टेस्ट (लगातार तीन बार काम सही करना) को केवल 0.091 बार (लगभग 9% बार) पास कर पाया।
  2. "फ्लैट टेक्स्ट" टीम (HCE): उन्होंने केवल टेक्स्ट जोड़ने का पुराना तरीका अपनाया। रोबोट पहले थोड़ा बेहतर हुआ, 0.215 तक पहुँचा, लेकिन फिर यह फिसलने लगा। अंत तक, यह वापस 0.191 पर आ गया। नियम पुस्तिका बहुत अव्यवस्थित हो गई, और रोबोट निरंतरता बनाए रखना भूल गया।
  3. "चेक के बिना मैप" टीम: उन्होंने मैप का उपयोग किया लेकिन विरोधाभासों या पुनरावृत्ति की जांच नहीं की। उन्हें 0.458 का अच्छा उछाल मिला, लेकिन फिर वे बुरी तरह गिर गए, जो 0.248 पर समाप्त हुआ। मैप ने चीजों को व्यवस्थित करने में मदद की, लेकिन "नेबरहुड चेक" के बिना, नियम फिर से ढेर होकर कचरा बन गए।
  4. GRACE टीम: इस टीम ने मैप और सख्त नेबरहुड चेक्स दोनों का उपयोग किया। वे 0.091 से शुरू हुए और लगातार ऊपर चढ़े। अंतिम चेकपॉइंट तक, वे सख्त टेस्ट को 0.673 बार (लगभग 67%) पास कर रहे थे।

बड़ा मुकाबला: यहाँ तक कि एक बिल्कुल नया, बहुत स्मार्ट रोबोट मॉडल (Gemini 3.1 Pro) जो बिना किसी अपडेट के शुरू से काम कर रहा था, वह केवल 0.242 ही प्रबंध कर पाया। GRACE टीम, जिसने एक पुराने रोबोट मॉडल का उपयोग किया लेकिन एक स्मार्ट अपडेट सिस्टम का उपयोग किया, ने नए रोबोट को बड़े अंतर से पीछे छोड़ दिया।

इसका क्या अर्थ है (और क्या नहीं है)

शोध पत्र सुझाव देता है कि यदि आप चाहते हैं कि एक रोबोट लंबे समय तक बिना टूटे विकसित होता रहे, तो आप केवल टेक्स्ट का ढेर नहीं लगा सकते। आपको एक संरचना (जैसे एक मैप) की आवश्यकता है जो आपको यह जांचने की अनुमति दे कि क्या नए विचार पुराने विचारों के साथ स्थानीय स्तर पर (locally) फिट बैठते हैं।

हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह हर चीज़ के लिए जादुई समाधान नहीं है।

  • उन्होंने इसे केवल एक टेलीकॉम कस्टमर सर्विस सिमुलेशन में टेस्ट किया है। वे अभी नहीं जानते कि क्या यह कोडिंग, चिकित्सा सलाह, या कार चलाने के लिए भी काम करता है।
  • उन्होंने इसे केवल एक विशिष्ट रोबोट मॉडल और एक विशिष्ट सेट टूल्स के साथ टेस्ट किया है।
  • परिणाम सिमुलेशन (कंप्यूटर टेस्ट) पर आधारित हैं, वास्तविक मनुष्यों के साथ वास्तविक फोन कॉल पर नहीं।

लेकिन सबक स्पष्ट है: यदि आप चाहते हैं कि एक रोबोट महीनों या वर्षों में अपना व्यक्तित्व और नियम विकसित करे, तो आपको उसके निर्देशों को एक डायरी की तरह नहीं, बल्कि एक सुव्यवस्थित मैप की तरह मानना होगा। यदि आप एक नया घर जोड़ने से पहले उसके पड़ोस की जांच नहीं करते हैं, तो पूरा शहर अंततः ढह जाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →