← नवीनतम पेपर
🤖 machine learning

Toward Reliable Context Compression for Long-Horizon Agents: An Empirical Study of Execution Instability

यह शोध पत्र लॉन्ग-होरिजन एजेंटों में आवर्तक संदर्भ संपीड़न (recurrent context compression) के कारण होने वाली निष्पादन अस्थिरता की जांच करता है और TRACE का प्रस्ताव करता है, जो मॉडल के भार (weights) को अपडेट किए बिना कार्य प्रदर्शन और विश्वसनीयता बढ़ाने के लिए बाउंड्री-लोकल मूल्यांकन के माध्यम से संपीड़न प्रॉम्प्ट्स को अनुकूलित करने वाला एक वेरीफायर-गाइडेड फ्रेमवर्क है।

मूल लेखक: Guanghui Min, Liang Wu, Mayank Darbari, Chen Chen, Liangjie Hong

प्रकाशित 2026-08-10
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanghui Min, Liang Wu, Mayank Darbari, Chen Chen, Liangjie Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट असिस्टेंट से बात कर रहे हैं जो एक विशाल, बहु-चरणीय पहेली को हल करने की कोशिश कर रहा है। अपना काम करने के लिए, रोबोट को यह याद रखने की ज़रूरत है कि अब तक क्या-क्या हुआ है: उसे मिले सुराग, उसके द्वारा किए गए मूव्स, उसके द्वारा सुधारी गई गलतियाँ और उसके द्वारा निर्धारित लक्ष्य। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस स्मृति को "कॉन्टेक्स्ट" (context) कहा जाता है। लेकिन यहाँ एक पेच है: रोबोटों का एक सीमित "मस्तिष्क आकार" (context window) होता है। यदि कहानी बहुत लंबी हो जाती है, तो रोबोट चीजें भूलने लगता है या अभिभूत हो जाता है। इसे ठीक करने के लिए, वैज्ञानिक "कंप्रेशन" (compression) का उपयोग करते हैं, जो कि रोबोट को अपने लंबे साहसिक कार्य का एक संक्षिप्त सारांश लिखने के लिए कहने जैसा है ताकि वह पूरी कहानी को फिर से अपने मस्तिष्क में फिट कर सके।

लंबे समय तक, लोगों ने यह मान लिया था कि यदि आप उस सारांश में केवल सबसे महत्वपूर्ण तथ्यों को रखते हैं, तो रोबोट उतना ही स्मार्ट होगा जितना कि यदि उसने पूरी कहानी पढ़ी होती। लेकिन यह नया अध्ययन बताता है कि यह पूरी तरह सच नहीं है। वास्तव में, रोबोट की यात्रा का सारांश बनाना उस शहर में नेविगेट करने की कोशिश करने जैसा है जहाँ आप केवल उन लैंडमार्क्स के मानचित्र का उपयोग कर रहे हैं जिनसे आप पहले गुजर चुके हैं, बिना यह याद रखे कि आपने अभी कौन सी गली मुड़ी थी। रोबोट को यह तो पता हो सकता है कि उसने क्या किया, लेकिन वह यह खो देता है कि वह अभी कहाँ है, जिससे वह भ्रमित हो जाता है, कदम दोहराता है, या पूरी तरह से हार मान लेता है। यह पेपर अन्वेषण करता है कि ऐसा क्यों होता है और उन सारांशों को लिखने का एक बेहतर तरीका बनाने की कोशिश करता है ताकि रोबोट ट्रैक पर बना रहे।


समस्या: जब सारांश रोबोटों को उनका स्थान भुला देते हैं

शोधकर्ताओं ने, जो सॉफ्टवेयर अनुप्रयोगों के साथ बातचीत करने वाले AI एजेंटों के साथ काम कर रहे थे, पाया कि ये रोबोट लंबे कार्यों को कैसे संभालते हैं इसमें एक छिपी हुई समस्या है। जब किसी रोबोट की मेमोरी बहुत भर जाती है, तो वह आमतौर पर नए विवरणों के लिए जगह बनाने के लिए बातचीत के सबसे पुराने हिस्सों को हटा देता है। कभी-कभी, केवल पुराने टेक्स्ट को हटाने के बजाय, यह पूरे इतिहास को एक व्यवस्थित, संक्षिप्त सारांश से बदल देता है।

टीम ने पाया कि हालांकि ये सारांश कागज़ पर बहुत अच्छे लगते हैं, लेकिन वास्तव में ये रोबोट के व्यवहार को बहुत अधिक अस्थिर बना देते हैं। यह एक ऐसी किताब पढ़ने जैसा है जहाँ लेखक अचानक अध्याय के बीच में कूद जाता है और कहता है, "और फिर, नायक खुश था।" आप जानते हैं कि नायक खुश था, लेकिन आप यह नहीं जानते कि वह क्यों खुश था या उस क्षण से ठीक पहले क्या हुआ था। इसके कारण, रोबमाट अपनी "लोकल पोजीशन" (स्थानीय स्थिति) खोने लगता है। उसे लग सकता है कि उसे वह कार्य करने की आवश्यकता है जिसे वह पहले ही पूरा कर चुका है, या वह इसलिए फंस सकता है क्योंकि वह दुनिया की उस विशिष्ट स्थिति को याद नहीं रख पाता जिसे वह पीछे छोड़ गया था।

अपने प्रयोगों में, उन्होंने देखा कि जब रोबोटों ने इन सारांशों का उपयोग किया, तो वे "रिग्रेसिव एक्सप्लोरेशन" (regressive exploration) करने लगे। यह एक फैंसी तरीका है यह कहने का कि रोबोट उन चीजों को फिर से करने की कोशिश करने लगा जो वह पहले ही कर चुका था, या वह किसी महत्वपूर्ण विवरण को भूल जाने के कारण रुक गया। इससे भी बदतर, रोबोट अविश्वसनीय हो गया। यदि आप इसे एक ही पहेली को दो बार हल करने के लिए कहते हैं, तो यह पहली बार में सफल हो सकता है लेकिन दूसरी बार विफल हो सकता है, केवल इसलिए क्योंकि सारांश ने इसे इस बारे में थोड़ा भ्रमित कर दिया कि यह कहाँ खड़ा है। अध्ययन ने दिखाया कि यह केवल तथ्यों को खोने के बारे में नहीं था; यह क्रिया के प्रवाह (flow) को खोने के बारे में था।

समाधान: TRACE और "बाउंड्री" टेस्ट

इसे ठीक करने के लिए, शोधकर्ताओं ने TRACE नामक एक नया फ्रेमवर्क बनाया। TRACE को एक सख्त संपादक के रूप में समझें जो न केवल यह जाँचता है कि सारांश कैसा सुनाई देता है, बल्कि वास्तव में यह परीक्षण भी करता है कि क्या वह सारांश वास्तविक जीवन में काम करता है।

TRACE कैसे काम करता है, एक सरल उदाहरण का उपयोग करते हुए: कल्पना कीजिए कि आप एक कुत्ते को गेंद लाने के लिए प्रशिक्षित कर रहे हैं।

  1. पुराना तरीका: आप दिन के अंत में बस कुत्ते को देख सकते हैं और कह सकते हैं, "अच्छा काम किया अगर इसने गेंद पकड़ ली।" लेकिन क्या होगा अगर कुत्ता बीच में ही कहीं खो गया था? आपको पता नहीं चलेगा।
  2. TRACE का तरीका: हर बार जब आप कुत्ते के रास्ते का सारांश बनाते हैं, तो आप फिल्म को रोक देते हैं। आप ठीक उसी स्थान पर वापस जाते हैं जहाँ आपने रुकने का निर्णय लिया था। फिर, आप दो समानांतर फिल्में चलाते हैं:
    • फिल्म A (कंट्रोल): कुत्ता पथ की पूर्ण, बिना संपादित स्मृति के साथ आगे बढ़ता है।
    • फिल्म B (टेस्ट): कुत्ता आगे बढ़ता है, लेकिन इस बार इसके पास केवल नया सारांश है जो आपने अभी लिखा है।

TRACE दोनों फिल्मों को देखता है। यदि फिल्म B वाला कुत्ता गोल-गोल दौड़ने लगता है, दीवार पर भौंकने लगता है, या उस गेंद को लाने की कोशिश करता है जो पहले से ही टोकरी में है, तो TRACE जान जाता है कि सारांश खराब है। यह मापता है कि सारांश ने कितनी "अतिरिक्त मेहनत" या "फंसने वाले व्यवहार" को जन्म दिया।

इस पद्धति का उपयोग करके, TRACE केवल यह अनुमान नहीं लगाता कि एक अच्छा सारांश कैसा दिखता है। यह एक "वेरिफायर" (verifier) का उपयोग करता है जो सारांश के विभिन्न संस्करणों की तुलना करता है और उस संस्करण को चुनता है जो रोबोट को बिना भ्रमित हुए आगे बढ़ाता है। यह एक कोच की तरह है जो कहता है, "ठीक है, इस सारांश ने रोबोट को एक ऐसा दरवाजा खोलने के लिए प्रेरित किया जो पहले से खुला था। आइए सारांश को बदलकर कहें, 'दरवाजा खुला है,' न कि केवल 'हम गलियारे में हैं'।"

परिणाम: स्मार्ट रोबोट, कम गलतियाँ

टीम ने इस नई पद्धति का परीक्षण AppWorld नामक एक बेंचमार्क पर किया, जो एक वीडियो गेम की तरह है जहाँ रोबोट को विभिन्न ऐप्स (जैसे फोन, म्यूजिक प्लेयर, या बैंक) का उपयोग करके कार्य पूरे करने होते हैं। उन्होंने अपने नए TRACE पद्धति की तुलना मेमोरी को कंप्रेस करने के अन्य लोकप्रिय तरीकों से की।

परिणाम उत्साहजनक थे। TRACE-अनुकूलित सारांशों का उपयोग करने वाले रोबोट:

  • अधिक कार्यों को हल करते हैं: वे मानक सारांशों या केवल पुराने टेक्स्ट को हटाने वाले रोबोटों की तुलना में अधिक बार सफल होते हैं।
  • अधिक विश्वसनीय थे: यदि आप रोबोट को कार्य दो बार करने के लिए कहते हैं, तो भ्रम के कारण विफल होने के बजाय, इसकी सफलता की संभावना बहुत अधिक थी।
  • कुशल बने रहे: उन्हें अपनी गलतियों को सुधारने के लिए अतिरिक्त कदम उठाने की आवश्यकता नहीं पड़ी।

सबसे दिलचस्प निष्कर्षों में से एक यह था कि इन सारांशों को लिखने के "नियम", जिन्हें TRACE सिस्टम ने एक विशिष्ट रोबोट मॉडल का उपयोग करके सीखा था, वास्तव में तब भी अच्छी तरह से काम करते थे जब उन्हें एक दूसरे रोबोट मॉडल को दिया गया। यह सुझाव देता है कि विधि एक विशिष्ट रोबोट की विशेषताओं को याद करने के बजाय, यह सीख रही है कि रोबोट की मेमोरी को उपयोगी बनाए रखने के लिए एक सार्वभौमिक सत्य क्या है।

इसका भविष्य के लिए क्या अर्थ है

यह पेपर दावा नहीं करता है कि इसने रोबोटों के लिए दीर्घकालिक स्मृति की समस्या को हमेशा के लिए हल कर दिया है। वास्तव में, शोधकर्ता सावधानी बरतते हुए कहते हैं कि हालांकि TRACE वर्तमान में हमारे पास जो है उससे बेहतर है, फिर भी यह पूर्ण नहीं है। सारांश का उपयोग करने और पूर्ण, मूल इतिहास का उपयोग करने के बीच अभी भी एक अंतर है। हालाँकि, यह अध्ययन एक बड़ा कदम है क्योंकि यह इस समस्या के बारे में हमारी सोच को बदल देता है।

केवल यह पूछने के बजाय कि, "क्या यह सारांश महत्वपूर्ण तथ्यों को रखता है?" अब हम जानते हैं कि हमें यह भी पूछना चाहिए कि, "क्या यह सारांश रोबोट के इस बोध को बनाए रखता है कि वह अभी कहाँ है?" सारांश बनाए जाने के क्षण पर ध्यान केंद्रित करके और यह परीक्षण करके कि यह अगले कदम को कैसे प्रभावित करता है, TRACE फ्रेमवर्क हमारे AI सहायकों को लंबी, जटिल यात्राओं को बिना भटके संभालने में मदद करने का एक नया, अधिक विश्वसनीय तरीका प्रदान करता है। यह एक याद दिलाता है कि एक रोबोट के लिए, यह याद रखना महत्वपूर्ण है कि क्या हुआ, लेकिन यह याद रखना कि वह कहानी में कहाँ है, वास्तव में उसे आगे बढ़ने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →