← नवीनतम पेपर
🤖 AI

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

यह शोध पत्र Agent-Omit को पेश करता है, जो एक एकीकृत प्रशिक्षण ढांचा (unified training framework) है जो कोल्ड-स्टार्ट फाइन-ट्यूनिंग और ओमिट-अवेयर रीइन्फोर्समेंट लर्निंग के माध्यम से LLM एजेंटों को अनावश्यक विचारों और अवलोकनों को अनुकूल रूप से छोड़ने में सक्षम बनाकर उनकी दक्षता को बढ़ाता है, जिससे कई बेंचमार्क में बेहतर प्रभावशीलता-दक्षता ट्रेड-ऑफ प्राप्त होता है।

मूल लेखक: Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Agent-Omit: Efficient LLM Agents के लिए Adaptive Context Omission" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

समस्या: "ज़रूरत से ज़्यादा समझाने वाला" एजेंट (The "Over-Explainer" Agent)

कल्पना कीजिए कि आपने इंटरनेट पर किसी विशिष्ट तथ्य को खोजने के लिए एक बहुत ही बुद्धिमान, लेकिन थोड़े जुनूनी शोध सहायक (research assistant) को काम पर रखा है।

  • अच्छी खबर: वे प्रतिभाशाली हैं। वे उत्तर ढूँढ लेते हैं।
  • बुरी खबर: वहाँ पहुँचने के लिए, वे अपने हर एक कदम के लिए 50 पन्नों की डायरी लिखते हैं। वे लिखते हैं, "मैं नीले बटन पर क्लिक करने के बारे में सोच रहा हूँ," फिर वे उसे क्लिक करते हैं। फिर वे लिखते, "मैं स्क्रीन पर लिखे टेक्स्ट को पढ़ रहा हूँ," फिर वे उसे पढ़ते हैं। यहाँ तक कि जब वे केवल एक ऐसा बटन दबा रहे होते हैं जो पिछले कदम से स्पष्ट था, तब भी वे इसके बारे में पूरा पैराग्राफ लिखते हैं।

वर्तमान AI एजेंट बिल्कुल यही करते हैं। वे बहुत सारे "विचार" (reasoning) और "अवलोकन" (actions के परिणाम पढ़ना) उत्पन्न करते हैं। हालाँकि यह उन्हें कठिन समस्याओं को हल करने में मदद करता है, लेकिन यह भारी मात्रा में "डिजिटल कचरा" (digital clutter) पैदा करता है। यह कचरा:

  1. बहुत अधिक पैसा खर्च करता है (क्योंकि AI कंपनियाँ शब्द/टोकन के हिसाब से शुल्क लेती हैं)।
  2. सब कुछ धीमा कर देता है।
  3. AI को भ्रमित कर देता है क्योंकि बातचीत का इतिहास इतना लंबा हो जाता है कि वह शुरुआत को भूल जाता है।

अंतर्दृष्टि: सभी विचार समान नहीं होते (Not All Thoughts Are Created Equal)

इस पेपर के पीछे के शोधकर्ताओं ने एक सरल प्रश्न पूछा: "क्या हमें वास्तव में उस 50 पन्नों की डायरी का हर एक पन्ना पढ़ने की ज़रूरत है?"

उन्होंने AI की यात्रा का विश्लेषण किया और पाया कि इन विचारों और अवलोकनों का महत्व इस बात पर निर्भर करता है कि वे कब होते हैं:

  • शुरुआत में: AI को अपना रास्ता तय करने के लिए गहराई से सोचने की आवश्यकता होती है। (उच्च मूल्य)।
  • बीच में: AI केवल बटन क्लिक कर रहा होता है या सरल खोज परिणाम पढ़ रहा होता है। अक्सर, इसे डायरी लिखने की आवश्यकता नहीं होती; यह बस क्रिया कर सकता है। (कम मूल्य)।
  • अंत में: AI को निष्कर्षों का सारांश देने की आवश्यकता होती है। इसे अंतिम परिणामों की आवश्यकता है, लेकिन इसे तीन घंटे पहले के खोज परिणामों को फिर से पढ़ने की आवश्यकता नहीं है। (पुराने डेटा के लिए कम मूल्य)।

उपमा (Analogy): कल्पना कीजिए कि आप एक रेसिपी (विधि) का पालन कर रहे हैं। आपको शुरुआत में निर्देशों को ध्यान से पढ़ने की आवश्यकता है (योजना बनाना)। लेकिन जब आप 10वें मिनट में बर्तन को चला रहे होते हैं, तो आपको यह लिखने की आवश्यकता नहीं है कि आप कैसे चला रहे हैं। आप बस चलाते हैं। यदि आप चलाने के बारे में लिखना जारी रखते हैं, तो खाना पकाने से पहले ही आपके पास कागज खत्म हो जाएगा।

समाधान: Agent-Omit

टीम ने Agent-Omit नामक एक नया प्रशिक्षण ढांचा (training framework) बनाया है। इसे AI को एक नई सुपरपावर सिखाने के रूप में समझें: "क्या छोड़ना है, यह जानने की कला।"

AI को सब कुछ लिखने के लिए मजबूर करने के बजाय, Agent-Omit इसे सिखाता है कि, "मुझे पता है मैं क्या कर रहा हूँ, मुझे इसे लिखने की ज़रूरत नहीं है," या "मुझे उस पुराने नोट को फिर से पढ़ने की ज़रूरत नहीं है।"

उन्होंने इसे दो चरणों में किया:

चरण 1: "कोल्ड स्टार्ट" (बुनियादी बातें सिखाना)

सबसे पहले, उन्होंने विशेष अभ्यास समस्याओं का एक सेट बनाया। उन्होंने मैन्युअल रूप से AI को उदाहरण दिखाए कि:

  • "यहाँ एक समय था जब आपने बहुत अधिक सोचा। अगली बार, बस विचार को छोड़ दें।"
  • "यहाँ एक समय था जब आपने एक पुराना अवलोकन पढ़ा जो मददगार नहीं था। अगली बार, इसे पढ़ना छोड़ दें।"

उन्होंने AI को वे विशिष्ट "हाथ के संकेत" (विशेष कोड) सिखाए जिनका उपयोग वह तब करेगा जब वह किसी चरण को छोड़ना चाहता है। यह एक छात्र को सिखाने जैसा है कि कभी-कभी, "मुझे उत्तर पता है" एक वैध प्रतिक्रिया है, और उन्हें हर गणित के सवाल के लिए अपना काम दिखाने की ज़रूरत नहीं है।

चरण 2: "पुरस्कार प्रणाली" (Reinforcement Learning)

इसके बाद, उन्होंने AI को गेम खेलने दिया (जैसे वेबसाइट नेविगेट करना या विज्ञान की पहेली सुलझाना) और उसे एक विशेष पुरस्कार प्रणाली दी:

  • सही उत्तर पाने के लिए पुरस्कार।
  • कम शब्दों का उपयोग करने के लिए बोनस पुरस्कार।

यदि AI ने लापरवाही की और कोई आवश्यक चरण छोड़ दिया, तो उसे खराब स्कोर मिला। लेकिन यदि उसने सही ढंग से एक अनावश्यक चरण की पहचान की और उसे छोड़ दिया, जिससे पैसा और समय बचा, तो उसे भारी बोनस मिला। समय के साथ, AI ने एक "स्मार्ट मिनिमलिस्ट" बनना सीख लिया—काम करना लेकिन उसके बारे में कम लिखना।

परिणाम: "गोल्डिलॉक्स" एजेंट (The "Goldilocks" Agent)

शोधकर्ताओं ने इस नए AI (जिसे Agent-Omit कहा जाता है) का परीक्षण सात अन्य शीर्ष-स्तरीय AI एजेंटों के विरुद्ध किया।

  • प्रदर्शन (Performance): इसने समस्याओं को "सुपर-स्मार्ट" दिग्गजों (जैसे DeepSeek-R1 या o3) की तरह ही अच्छी तरह से हल किया।
  • दक्षता (Efficiency): वहाँ पहुँचने के लिए इसने काफी कम शब्दों (टोकन) का उपयोग किया।
  • संतुलन (The Trade-off): इसने सही संतुलन पाया। यह इतना आलसी नहीं था कि विफल हो जाए, और इतना बातूनी भी नहीं था कि पैसे बर्बाद करे।

उपमा: कल्पना कीजिए कि दो ड्राइवर एक ही गंतव्य तक पहुँचने की कोशिश कर रहे हैं।

  • ड्राइवर A (पुराना AI): पूरे रास्ते गाड़ी चलाता है और हर मोड़, हर ट्रैफिक लाइट और हर बादल का वर्णन करता है। वे पहुँच तो जाते हैं, लेकिन बहुत अधिक ईंधन जलाते हैं और उन्हें बहुत समय लगता है।
  • ड्राइवर B (Agent-Omit): पूरे रास्ते गाड़ी चलाता है, लेकिन केवल तभी बोलता है जब उसे कोई जटिल निर्णय लेने की आवश्यकता होती है या मैप चेक करने की आवश्यकता होती है। वे भी उतनी ही तेज़ी से पहुँचते हैं, लेकिन बहुत कम ईंधन का उपयोग करते हैं।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि AI को अनावश्यक संदर्भ को "छोड़ने" (omit) के लिए सिखाकर, हम इन एजेंटों को बना सकते हैं:

  1. चलाने के लिए सस्ता।
  2. तेज़।
  3. उतने ही स्मार्ट।

उन्होंने गणितीय रूप से सिद्ध किया कि यह स्किप करना AI की सही ढंग से सोचने की क्षमता को नुकसान नहीं पहुँचाता है, जब तक कि वह सही चीजों को छोड़ता है। उन्होंने दिखाया कि AI ने स्वाभाविक रूप से किसी कार्य के बीच में 3 से 4 राउंड की अनावश्यक बातचीत को छोड़ना सीख लिया, जो ठीक वहीं होता है जहाँ काम के "उबाऊ" हिस्से होते हैं।

संक्षेप में, Agent-Omit एक प्रशिक्षण विधि है जो AI एजेंटों को ज़रूरत से ज़्यादा समझाने से रोकती है, जिससे उनकी बुद्धिमत्ता खोए बिना समय और पैसे की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →