SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents
SWE-MeM एक प्रशिक्षण ढांचा है जो सॉफ्टवेयर इंजीनियरिंग एजेंटों को एक लचीले टूल और मेमोरी-अवेयर GRPO के माध्यम से अनुकूलन योग्य, ऑन-डिमांड मेमोरी प्रबंधन क्षमताओं के साथ सुसज्जित करता है, जिससे वे संदर्भ उपयोग को गतिशील रूप से अनुकूलित कर सकते हैं और मौजूदा स्थिर विधियों की तुलना में लंबी अवधि के कोडिंग कार्यों पर बेहतर प्रदर्शन प्राप्त कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
समस्या: "बहुत अधिक जानकारी" का ट्रैफिक जाम
कल्पना कीजिए कि आप एक शानदार सॉफ्टवेयर डिटेक्टिव (एक AI एजेंट) हैं, जिसे एक विशाल, जटिल इमारत (एक कोड रिपॉजिटरी) में बग ठीक करने के लिए काम पर रखा गया है। आप अपनी जांच शुरू करते हैं, लेकिन जैसे-जैसे आप काम करते हैं, आप अपने द्वारा उठाए गए हर कदम के नोट्स, फोटो और रिकॉर्डिंग का एक निशान पीछे छोड़ते जाते हैं।
- समस्या: वास्तविक दुनिया में, ये "नोट्स" (बातचीत का इतिहास) जमा होते जा रहे हैं। अंततः, यह ढेर इतना बड़ा हो जाता है कि दरवाजे को ब्लॉक कर देता है। आपके डिटेक्टिव दिमाग (AI मॉडल) के पास एक साथ चीजों को देखने के लिए सीमित जगह (कंटेक्स्ट विंडो) होती है। यदि ढेर बहुत बड़ा हो जाता है, तो या तो आप नए सुराग नहीं देख पाते, या आप पुराने, अप्रासंगिक विवरणों से इतने अभिभूत हो जाते हैं कि आप भूल जाते हैं कि आप वास्तव में क्या हल करने की कोशिश कर रहे थे।
- पुराना तरीका: पिछले तरीकों ने इसे कठोर होकर हल करने की कोशिश की। वे एक सख्त लाइब्रेरियन की तरह थे जो कहता है, "हर बार जब आप 100 पन्ने लिखेंगे, मैं स्वचालित रूप से पहले 50 पन्ने फेंक दूंगा और उन्हें एक सामान्य सारांश से बदल दूंगा।" यह बुरा है क्योंकि कभी-कभी पहले 50 पन्नों में वह एकमात्र सुराग होता है जिसकी आपको आवश्यकता होती है, और कभी-कभी आखिरी 50 पन्ने केवल आपके मौसम के बारे में शिकायत करने के होते हैं (जिसे आप सुरक्षित रूप से फेंक सकते हैं)।
समाधान: SWE-MeM (स्मार्ट पर्सनल असिस्टेंट)
लेखकों ने SWE-MeM बनाया है, एक नया ट्रेनिंग फ्रेमवर्क जो AI एजेंट को अपना स्मार्ट पर्सनल असिस्टेंट बनने की शिक्षा देता है। एक सख्त लाइब्रेरियन के बजाय, एजेंट सक्रिय रूप से अपने स्वयं के मेमोरी को प्रबंधित करना सीखता है।
यह कैसे काम करता है, यहाँ तीन सरल भागों में दिया गया है:
1. लचीला टूल (कब और क्या तय करना)
SWE-MeM एजेंट को compress नामक एक विशेष टूल देता है। एजेंट इसे उपयोग करने से पहले खुद से तीन प्रश्न पूछना सीखता है:
- कब? क्या मुझे अभी सफाई करने की आवश्यकता है? (क्या मेरी डेस्क बहुत गंदी हो रही है?)
- क्या? मेरे नोट्स के कौन से हिस्से बेकार हैं? (क्या यह विफल परीक्षण प्रयासों की एक लंबी सूची है, या यह एक महत्वपूर्ण कोड स्निपेट है?)
- कैसे? मैं इसे कैसे सारांशित करूँ? (क्या मैं केवल निष्कर्ष को रखूँ, या मैं विशिष्ट त्रुटि संदेश को भी रखूँ?)
उपमा: कल्पना कीजिए कि आप एक डायरी लिख रहे हैं। एक कठोर प्रणाली हर बार नया पन्ना लिखने पर पहला पन्ना हटा देती है। SWE-MeM एक स्मार्ट संपादक की तरह है जो आपकी डायरी को देखता है और कहता है, "हे, आपने तीन दिन सिर्फ खाली दीवार को घूरने में बिताए (कम मूल्य)। आइए इसे 'दिन 3: अटके हुए' के रूप में सारांशित करें। लेकिन आपने दिन 5 पर टूटा हुआ पाइप पाया (उच्च मूल्य)। आइए इस विवरण को बिल्कुल वैसा ही रखें जैसा यह है।"
2. प्रशिक्षण विधि (करके सीखना)
आप एक AI को इतना स्मार्ट कैसे बनाते हैं? आप इसे केवल बता नहीं सकते; इसे अभ्यास करना होगा। लेखकों ने तीन-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:
- सिंथेसाइजिंग ट्राजेक्टरीज (सिमुलेशन): उन्होंने हजारों नकली "डिटेक्टिव केस" बनाए। उन्होंने एक सुपर-स्मार्ट AI का उपयोग एक जज के रूप में किया, यह तय करने के लिए कि डिटेक्टिव को कब अपने नोट्स साफ करने चाहिए थे। उन्होंने एक ऐसा डेटासेट बनाया जहाँ एजेंट सही समय पर सही चीजों को कंप्रेस करने का अभ्यास करता है।
- करिकुलम लर्निंग (स्कूली शिक्षा): उन्होंने एजेंट को चरणों में सिखाया। पहले, उन्होंने उसे बुनियादी बातें सिखाईं: "यहाँ बताया गया है कि आप सारांश कैसे लिखते हैं।" एक बार जब उसने वह सीख लिया, तो वे उन्नत कक्षा में चले गए: "अब, स्थान समाप्त होने से पहले, सारांश लिखना सीखें, न कि केवल तब जब आप मजबूर हों।" यह एक छात्र को यात्रा से पहले सूटकेस पैक करना सिखाने जैसा है, बजाय इसके कि बैग फटने का इंतजार किया जाए।
- मेमोरी-अवेयर GRPO (पुरस्कार प्रणाली): यह सबसे तकनीकी हिस्सा है, लेकिन इसे एक वीडियो गेम स्कोरिंग सिस्टम के रूप में सोचें।
- सामान्य प्रशिक्षण में, AI को केवल तभी "जीत" का अंक मिलता है जब वह अंत में बग को ठीक कर देता है।
- SWE-MeM में, सिस्टम पूरी यात्रा को देखता है। यदि AI ने बीच में एक बेहतरीन कंप्रेशन निर्णय लिया जिसने बाद में समस्या को हल करने में मदद की, तो उसे बोनस अंक मिलता है। यदि उसने कुछ महत्वपूर्ण कंप्रेस कर दिया और फंस गया, तो उसे पेनल्टी मिलती है। यह AI को सिखाता है कि अच्छा मेमोरी प्रबंधन गेम जीतने का एक हिस्सा है।
3. परिणाम (गेम जीतना)
लेखकों ने SWE-Bench Verified पर SWE-MeM का परीक्षण किया, जो एक कठिन बेंचमार्क है जहाँ AI एजेंटों को वास्तविक दुनिया के सॉफ्टवेयर बग्स को ठीक करना होता है।
- स्कोर: एक छोटे मॉडल (4 बिलियन पैरामीटर्स) के साथ, SWE-MeM ने 43.4% समस्याओं को हल किया। एक बड़े मॉडल (30 बिलियन) के साथ, इसने 60.2% समस्याओं को हल किया।
- दक्षता: न केवल इसने अधिक समस्याओं को हल किया, बल्कि इसने अन्य तरीकों की तुलना में कम टोकन (शब्द/वर्ण) का उपयोग किया और कम स्टेप्स लिए।
- तुलना: इसने सभी पिछले "कठोर लाइब्रेरियन" तरीकों को हरा दिया। इसने साबित कर दिया कि एजेंट को यह तय करने देना कि वह अपनी मेमोरी को कब साफ करे, उसे एक निर्धारित शेड्यूल पर सफाई करने के लिए मजबूर करने से कहीं बेहतर है।
सारांश
SWE-MeM एक डिटेक्टिव को अपग्रेड करने जैसा है, जो डेस्क भर जाने पर कागजात को पागलों की तरह फाड़ने वाले व्यक्ति से, एक ऐसे डिटेक्टिव में बदल जाता है जो जानता है कि किन सुरागों को रखना है, किन्हें सारांशित करना है, और अपनी जगह खत्म होने से पहले डेस्क को व्यवस्थित करने का सही समय क्या है। यह AI को सक्रिय, लचीला और कुशल बनना सिखाता है, जिसके परिणामस्वरूप कम बर्बाद प्रयास के साथ बेहतर कोड फिक्स मिलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।