← नवीनतम पेपर
💬 NLP

Self-Compacting Language Model Agents

यह शोध पत्र SelfCompact को पेश करता है, जो एक प्रशिक्षण-मुक्त स्कैफोल्डिंग फ्रेमवर्क है जो एजेंट ट्रेसेस के अनुकूली (adaptive), संदर्भ-जागरूक सारांश के लिए एक मॉडल-इवोक्ड कॉम्पेक्शन टूल को एक हल्के रूब्रिक के साथ जोड़ता है, जो फिक्स्ड-इंटरवल दृष्टिकोणों की तुलना में गणित और सर्च बेंचमार्क पर प्रदर्शन में सुधार करते हुए टोकन लागत को काफी कम कर देता है।

मूल लेखक: Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई जटिल गणित की समस्या या कोई गहरी वेब खोज। आपके पास एक शानदार सहायक (एक AI) है जो इस पर काम कर रहा है। लेकिन यहाँ एक पेच है: सहायक की अल्पकालिक स्मृति (short-term memory) बहुत कम है। वह एक बार में अपने दिमाग में केवल एक निश्चित मात्रा में जानकारी ही रख सकता है।

जैसे-जैसे सहायक काम करता है, वह अपने विचार लिखता है, सुरागों की खोज करता है और नोट्स बनाता है। अंततः, यह "रफ कार्य-पत्र" (scratchpad) इतना भर जाता है कि यह बाहर छलकने लगता है। जब ऐसा होता है, तो सहायक को नए नोट्स के लिए जगह बनाने के लिए पुराने नोट्स फेंकने पड़ते हैं।

समस्या: "सड़ने वाला" रफ कार्य-पत्र (The "Rotting" Scratchpad)
यह घटना कार्य-पत्र को "कॉन्टेक्स्ट रोट" (Context Rot) कहती है।

कल्पना कीजिए कि आपका सहायक एक कहानी लिख रहा है। यदि वे बिना कभी संपादन (edit) किए लिखते रहते हैं, तो कहानी की शुरुआत उनकी याददाश्त से इतनी पीछे छूट जाती है कि वे मुख्य पात्र का नाम भी भूल जाते हैं। या इससे भी बुरा, वे एक घंटे पहले एक मृत-अंत वाले विचार (dead-end idea) के बारे में लिखने में इतने व्यस्त हो सकते हैं कि वे पाँच मिनट पहले मिले किसी महत्वपूर्ण सुराग को भूल जाएं।

वर्तमान प्रणालियाँ इसे ठीक करने का प्रयास करती हैं, लेकिन एक कठोर टाइमर (rigid timer) का उपयोग करके। वे कहते हैं, "हर 10,000 शब्द लिखने के बाद, रुकें और अब तक जो कुछ भी लिखा गया है उसका सारांश (summarize) दें।"

  • दोष: यह एक शेफ को प्याज काटने के बीच में रोकने जैसा है क्योंकि उसने 10 मिनट तक खाना पकाया है। वे शायद एक बेहतरीन रेसिपी स्टेप के बीच में हों, और सारांश देने के लिए मजबूर करने से वे आधा कटा हुआ प्याज और अभी-अभी डाला गया विशेष मसाला भी खो देते हैं। वे अपना स्थान खो देते हैं और अनुमान लगाने लगते हैं।

समाधान: SELFCOMPACT (स्व-संपादन करने वाला सहायक)
लेखक एक नई प्रणाली प्रस्तावित करते हैं जिसे SELFCOMPACT कहा जाता है। टाइमर के बजाय, वे सहायक को दो नए उपकरण देते हैं:

  1. एक "सारांशित करें" (Summarize) बटन: सहायक अपनी टिप्पणियों का सारांश चुनने की क्षमता रखता है।
  2. एक "रूब्रिक" (नियम पुस्तिका - Rubric): यह एक सरल चेकलिस्ट है जिसे सहायक बटन दबाने से पहले पढ़ता है।

नियम पुस्तिका सहायक से सारांश करने से पहले तीन प्रश्न पूछती है:

  • क्या मैंने अभी एक विशिष्ट चरण पूरा किया है? (उदाहरण के लिए, "मुझे इस उप-प्रश्न का उत्तर मिल गया है।")
  • क्या मैं एक लूप (loop) में फँस गया हूँ? (उदाहरण के लिए, "मैं बार-बार एक ही खोज दोहरा रहा हूँ।")
  • क्या पुराने नोट्स को फेंक देना सुरक्षित है? (उदाहरण के लिए, "मेरे पास इस भाग के लिए सभी आवश्यक तथ्य हैं।")

उपमा: जासूस की केस फ़ाइल (The Detective's Case File)
एक AI को एक रहस्य सुलझाने वाले जासूस के रूप में सोचें।

  • पुराना तरीका (निश्चित टाइमर): हर घंटे, एक सख्त सुपरवाइजर आता है और कहता है, "रुको! अपनी केस फ़ाइल का सारांश दो।" जासूस दो सुरागों को जोड़ने के बीच में हो सकता है। सुपरवाइजर उसे सारांश करने के लिए मजबूर करता है, और जासूस अनजाने में एक अधूरा कनेक्शन फेंक देता है। जासूस भ्रमित हो जाता है और अनुमान लगाने लगता है।
  • नया तरीका (SELFCOMPACT): जासूस के पास एक नियम पुस्तिका है। वे केवल तभी सारांशित करते हैं जब उन्होंने सफलतापूर्वक एक विशिष्ट सुराग सुलझा लिया हो (जैसे "बटलर ने यह किया") या जब उन्हें एहसास हो कि वे एक बंद गली (dead-end) में फंस गए हैं।
    • यदि उन्होंने अभी एक सुराग सुलझाया है, तो वे सारांशित करते हैं: "ठीक है, बटलर ने यह किया। अब मुझे मकसद (motive) ढूंढना है।" वे बटलर के बहाने (alibi) के बारे में बिखरे हुए नोट्स फेंक देते हैं क्योंकि वे अब ठोस तथ्य बन चुके हैं।
    • यदि वे अभी भी यह समझने की कोशिश कर रहे हैं कि किसने यह किया, तो नियम पुस्तिका कहती है, "अभी सारांश न करें! आप अभी भी सोच रहे हैं।"

शोधकर्ताओं को क्या पता चला
शोधकर्ताओं ने सात अलग-अलग AI मॉडलों पर कठिन गणितीय समस्याओं और जटिल वेब खोजों पर इसका परीक्षण किया।

  • बेहतर परिणाम: "नियम पुस्तिका" (SELFCOMPACT) का उपयोग करने वाले AI ने "टाइमर" या "कभी सारांश न करने वाले" AI की तुलना में अधिक उत्तर सही दिए। गणित की समस्याओं पर, इसने स्कोर में 18 अंक तक सुधार किया।
  • सस्ता: क्योंकि AI केवल तभी सारांशित करता है जब वास्तव में आवश्यक हो, इसलिए वह सारांश करने में समय और पैसा बर्बाद नहीं करता है। इसने कुछ न करने की तुलना में लागत में 30% से 70% की बचत की।
  • प्रशिक्षण की आवश्यकता नहीं: सबसे अच्छी बात यह है कि उन्हें AI को यह कैसे करना है, यह सिखाने की आवश्यकता नहीं थी। उन्होंने बस उसे उपकरण और नियम पुस्तिका दी, और AI ने अपने आप इसका उपयोग करना सीख लिया।

बड़ी सीख (The Big Takeaway)
यह शोध पत्र दिखाता है कि AI मॉडल वास्तव में काफी अच्छे होते हैं यह जानने में कि वे कब "फँसे हुए" हैं या कब उनके पास "एक चरण पूरा हो गया है," लेकिन उन्हें यह पहचानने के लिए थोड़े से धक्के (नियम पुस्तिका) की आवश्यकता होती है। उन्हें यह तय करने की अनुमति देकर कि वे अपनी मेमोरी को कब साफ़ करें, न कि उन पर एक शेड्यूल थोपकर, हमें अधिक स्मार्ट, सस्ता और विश्वसनीय परिणाम मिलते हैं।

यह पेपर क्या दावा नहीं करता है

  • यह दावा नहीं करता कि यह चिकित्सा निदान (medical diagnosis) या क्लिनिकल उपयोगों के लिए काम करता है।
  • यह दावा नहीं करता कि यह हमेशा के लिए सभी AI समस्याओं को ठीक कर देगा।
  • यह दावा नहीं करता कि AI मानव अर्थों में "चेतन" (conscious) या "जागरूक" है; यह केवल प्रदान किए गए नियमों का बहुत अच्छी तरह से पालन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →