← नवीनतम पेपर
🤖 AI

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

यह शोध पत्र SPARE को प्रस्तुत करता है, जो एक KL-निर्देशित ढांचा है जो आवश्यक दृश्य साक्ष्य को संरक्षित करते हुए मल्टीमॉडल लार्ज लैंग्वेज मॉडल एजेंटों में अनावश्यक तर्क टेक्स्ट को प्रभावी ढंग से कम (प्रून) करता है, जिससे दीर्घ-अवधि वाले मल्टीमॉडल टूल-उपयोग परिदृश्यों में कार्य सटीकता में सुधार होता है और "टेक्स्टुअल डेट" (textual debt) की समस्या को कम किया जाता है।

मूल लेखक: Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

प्रकाशित 2026-08-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के तेजी से विकसित होते क्षेत्र में, एक विशिष्ट प्रकार का कंप्यूटर प्रोग्राम उभरा है जो एक डिजिटल सहायक के रूप में कार्य करता है जो देख और सोच सकता है। ये सिस्टम, जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल (multimodal large language models) के रूप में जाना जाता है, छवियों को देखने, उनके बारे में प्रश्नों को समझने और उत्तर खोजने के लिए बाहरी उपकरणों का उपयोग करने के लिए डिज़ाइन किए गए हैं। जटिल समस्याओं को हल करने के लिए, वे केवल अनुमान नहीं लगाते; वे कार्य को चरणों की एक श्रृंखला में तोड़ देते हैं, और जैसे-जैसे वे आगे बढ़ते हैं, अपने स्वयं के विचारों और योजनाओं को लिखते जाते हैं। तर्क लिखने की यह प्रक्रिया उन्हें व्यवस्थित रहने और विभिन्न कार्यों में समन्वय करने में मदद करती है, ठीक वैसे ही जैसे कोई मनुष्य पहेली सुलझाते समय नोट्स लिखता है। हालाँकि, जैसे-जैसे ये डिजिटल सहायक लंबे और कठिन कार्यों पर काम करते हैं, उनके द्वारा उत्पन्न टेक्स्ट जमा होने लगता है। इन स्व-लिखित नोट्स का संचय अंततः इतना बड़ा हो जाता है कि यह मूल छवि और उपकरणों द्वारा प्रदान किए गए नए दृश्य संकेतों को दबा देता है, जिससे सिस्टम सामने मौजूद ताज़ा साक्ष्य के बजाय अपने पिछले शब्दों पर बहुत अधिक निर्भर हो जाता है।

हांगकांग यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी के शोधकर्ताओं ने इस घटना को "टेक्स्टुअल डेट" (textual debt - भाषाई ऋण) के रूप में पहचाना है, जो एक ऐसी स्थिति है जहाँ बातचीत का इतिहास उस दृश्य वास्तविकता को डुबो देता है जिसका विश्लेषण एजेंट को करना चाहिए। जब कोई एजेंट किसी शुरुआती, गलत विचार पर अटक जाता है, तो उस विचार को पुख्ता करने वाले टेक्स्ट की भारी मात्रा उसे नई जानकारी को देखने से अंधा कर सकती है, जिससे गलतियाँ होती हैं। इसे हल करने के लिए, टीम ने SPARE नामक एक विधि विकसित की, जो एजेंट की स्मृति के लिए एक चयनात्मक संपादक (selective editor) के रूप में कार्य करती है। पुराने टेक्स्ट को केवल हटाने या छवियों को कंप्रेस करने के बजाय, SPARE एजेंट के पिछले तर्क की सावधानीपूर्वक समीक्षा करता है ताकि यह तय किया जा सके कि क्या अभी भी उपयोगी है और क्या अनावश्यक हो गया है। यह एक सरल प्रश्न पूछकर काम करता है: यदि एजेंट अपनी वर्तमान स्थिति का सारांश कुछ वाक्यों में लिखे, तो क्या उसे अगले चरण को समझने के लिए पहले लिखे गए तर्क के उस विशिष्ट पैराग्राफ को पढ़ने की आवश्यकता होगी?

इस प्रक्रिया में एक चतुर नैदानिक जांच (diagnostic check) शामिल है जहाँ सिस्टम अपने ही विचारों के दो संस्करणों की तुलना करता है। एक संस्करण में, एजेंट अपने विचारों और कार्यों के पूर्ण इतिहास को पढ़ता है। दूसरे में, वह उसी इतिहास को पढ़ता है लेकिन उसमें वर्तमान कार्य की स्थिति का एक संक्षिप्त सारांश जोड़ा गया होता है। सिस्टम फिर यह मापता है कि उस सारांश की उपस्थिति अगले शब्द के लिए एजेंट के पूर्वानुमानों को कितना बदलती है। यदि सारांश एजेंट की सोच में महत्वपूर्ण बदलाव लाता है, तो इसका अर्थ है कि उस पैराग्राफ में अद्वितीय, महत्वपूर्ण विवरण हैं जो सारांश में छूट गए हैं, इसलिए पैराग्राफ को रखा जाता है। यदि सारांश लगभग कोई बदलाव नहीं लाता है, तो इसका अर्थ है कि पुराना पैराग्राफ केवल उस जानकारी को दोहरा रहा है जो सारांश में पहले से ही समाहित है, जिससे उसे हटाना सुरक्षित है। यह सिस्टम को "पुराने" (stale) टेक्स्ट को हटाने की अनुमति देता है जो संदर्भ को गंदा करता है, जबकि उन विशिष्ट दृश्य विवरणों को सुरक्षित रखता है, जैसे कि किसी छवि में पाए गए निर्देशांक (coordinates) या टेक्स्ट, जो कार्य के लिए आवश्यक हैं।

इस छंटनी (pruning) को और अधिक प्रभावी बनाने के लिए, शोधकर्ताओं ने सिस्टम को बेहतर, अधिक व्यापक सारांश लिखने के लिए भी प्रशिक्षित किया। एजेंट को अपनी कार्य स्थिति को अधिक कुशलता से संक्षिप्त करने के लिए सिखाकर, उन्होंने छंटनी उपकरण को और भी अधिक अनावश्यक टेक्स्ट को बिना महत्वपूर्ण जानकारी खोए हटाने में सक्षम बनाया। इमेज एडिटिंग, टूल उपयोग और विजुअल सर्च से जुड़े कई चुनौतीपूर्ण बेंचमार्क पर परीक्षण करने के बाद, यह दृष्टिकोण अत्यधिक सफल रहा। सिस्टम ने रीजनिंग टोकन (वे शब्द जो एजेंट ने खुद के लिए लिखे थे) के बीच 37.89% से 64.58% तक की कटौती करने में सफलता प्राप्त की—और साथ ही अपने कार्यों पर सटीकता में भी सुधार किया। कई मामलों में, छंटे हुए एजेंटों ने पूर्ण इतिहास रखने वाले एजेंटों की तुलना में बेहतर प्रदर्शन किया, जिससे पता चलता कि टेक्स्ट के शोर (noise) को कम करने से उन्हें दृश्य साक्ष्यों पर अधिक ध्यान केंद्रित करने में मदद मिली।

ये निष्कर्ष इस सामान्य धारणा को चुनौती देते हैं कि एक एजेंट को सफल होने के लिए अपने तर्क के हर एक चरण को याद रखने की आवश्यकता होती है। इसके बजाय, अध्ययन सुझाव देता है कि लंबी, जटिल कार्यों के लिए, बातचीत के अप्रासंगिक हिस्सों को भूलने की क्षमता उतनी ही महत्वपूर्ण है जितनी कि तर्क करने की क्षमता। टेक्स्टुअल डेट को साफ करके, सिस्टम अपनी छवि और उपकरणों द्वारा प्रदान किए गए नए डेटा पर ध्यान केंद्रित करने की क्षमता को बहाल करता है, बजाय इसके कि वह अपने पिछले धारणाओं के चक्रव्यूह में फंस जाए। यह कार्य इंगित करता है कि दृश्य कार्यों में आर्टिफिशियल इंटेलिजेंस को एक वास्तव में प्रभावी दीर्घकालिक साथी बनने के लिए, इसे न केवल सोचना, बल्कि उन विचारों को छोड़ना भी सीखना होगा जो अब लक्ष्य की सेवा नहीं करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →