← नवीनतम पेपर
💬 NLP

ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

यह शोधपत्र ReVision को प्रस्तुत करता है, जो एक ऐसी विधि है जो क्रमिक स्क्रीनशॉट में अनावश्यक पैच को चुनिंदा रूप से हटाकर कंप्यूटर-उपयोग एजेंट प्रक्षेप पथों (trajectories) में विजुअल टोकन रेडंडेंसी को कम करती है, जिससे टोकन लागत में काफी कमी आती है और सफलता दर में सुधार होता है तथा एजेंटों को लंबे ऐतिहासिक संदर्भों का प्रभावी ढंग से लाभ उठाने में सक्षम बनाया जाता है।

मूल लेखक: Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit Chawla, Vibhav Vineet

प्रकाशित 2026-05-13
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit Chawla, Vibhav Vineet

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ रोबोट सहायक को एक जटिल कार्य करने के लिए, जैसे कि फ्लाइट बुक करना या अपने ब्राउज़र हिस्ट्री को साफ़ करना, कंप्यूटर स्क्रीन पर नेविगेट करना सिखाने की कोशिश कर रहे हैं।

हर बार जब रोबोट एक कदम उठाता है, तो वह स्क्रीन की एक फोटो खींचता है। फोटो को समझने के लिए, रोबोट इसे हजारों छोटे पहेली के टुकड़ों में तोड़ देता है जिन्हें "टोकन" कहा जाता है। रोबोट जितनी अधिक तस्वीरें देखेगा, उसे उतने ही अधिक पहेली के टुकड़ों को संभालना पड़ेगा।

समस्या: "स्टिकी नोट" का ओवरलोड
पेपर एक बड़ी अक्षमता की ओर इशारा करता है: जब आप माउस हिलाते हैं या किसी बटन पर क्लिक करते हैं, तो स्क्रीन का 90% हिस्सा आमतौर पर बिल्कुल वैसा ही रहता है। केवल एक छोटा सा कोना बदलता है।

हालाँकि, वर्तमान AI सहायक ऐसे हैं जैसे कोई व्यक्ति, जो हर एक कदम के बाद, दीवार पर एक नई, पूरी पेज वाली स्टिकी नोट चिपका देता है, भले ही उस नोट का 95% हिस्सा पिछले नोट के समान ही हो।

  • परिणाम: उनकी दीवार (कंप्यूटर की मेमोरी) बहुत जल्दी इन स्टिकी नोट्स से भर जाती है। वे नई, महत्वपूर्ण जानकारी लिखने के लिए जगह खत्म कर देते हैं।
  • परिणामस्वरूप: क्योंकि वे बार-बार एक ही पुराने बैकग्राउंड को देखने में व्यस्त हैं, वे लंबे कार्यों के दौरान अच्छे निर्णय लेने के लिए अतीत को याद रखने में सक्षम नहीं हो पाते। वे एक ऐसी "दीवार" से टकरा जाते हैं जहाँ अधिक इतिहास जोड़ने से उनका प्रदर्शन वास्तव में खराब हो जाता है क्योंकि वे अनावश्यक डेटा में डूब जाते हैं।

समाधान: ReVision (एक "स्मार्ट इरेज़र")
लेखक ReVision पेश करते हैं, जो एक नया तरीका है जो इन डिजिटल स्टिकी नोट्स के लिए एक "स्मार्ट इरेज़र" की तरह काम करता है।

एक पूरा नया पेज चिपकाने के बजाय, ReVision नई फोटो को देखता है और पूछता है: "पिछली फोटो के मुकाबले वास्तव में क्या बदला है?"

  • यदि बैकग्राउंड, मेनू बार और टेक्स्ट नहीं बदले हैं, तो ReVision उस नई फोटो के उन हिस्सों को मिटा (erase) देता है।
  • यह केवल उन छोटे पहेली के टुकड़ों को रखता है जो नए एक्शन (जैसे कि एक नया बटन दिखाई देना या टेक्स्ट बदलना) का प्रतिनिधित्व करते हैं।
  • महत्वपूर्ण रूप से, यह स्क्रीन का आकार (shape) बरकरार रखता है ताकि रोबोट इस बात को लेकर भ्रमित न हो कि चीजें कहाँ स्थित हैं।

उपमा: फिल्म बनाम स्लाइड शो
एक मानक AI सहायक को एक फिल्म देखते हुए एक स्लाइड शो की तरह कल्पना करें जो प्रति सेकंड 60 समान फोटो दिखाता है। यह थकाऊ और व्यर्थ है।
ReVision वास्तविक समय में फिल्म देखने जैसा है: यह केवल चलते हुए अभिनेताओं और बदलते दृश्यों पर ध्यान देता है, स्थिर बैकग्राउंड को अनदेखा करता है।

शोधकर्ताओं ने क्या पाया
शोधकर्ताओं ने कंप्यूटर एजेंटों के लिए तीन अलग-अलग "बाधा दौड़" (OSWorld, WebTailBench, और AgentNetBench) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  1. भारी बचत: ReVision का उपयोग करके, AI ने समान काम करने के लिए लगभग 46% कम "टोकन" (पहेली के टुकड़े) का उपयोग किया। यह एक यात्रा के लिए सूटकेस पैक करने जैसा है और फिर यह महसूस करना कि आप आधे कपड़े फेंक सकते हैं क्योंकि आप बस एक ही शर्ट को बार-बार पहन रहे हैं।
  2. बेहतर प्रदर्शन: आश्चर्यजनक रूप से, AI ने न केवल पैसे बचाए; वह अधिक स्मार्ट भी हो गया। इसकी सफलता दर लगभग 3% बढ़ गई।
    • क्यों? क्योंकि वह स्थिर बैकग्राउंड पर अपनी मानसिक शक्ति बर्बाद नहीं कर रहा था, इसलिए उसके पास कार्य के शुरुआती महत्वपूर्ण चरणों को याद रखने के लिए अधिक "मानसिक स्थान" था।
  3. "सैचुरेशन" (संतृप्ति) बिंदु को तोड़ना: आमतौर पर, यदि आप एक AI को बहुत सारे पिछले फोटो देते हैं, तो वह भ्रमित हो जाता है और सुधार करना बंद कर देता है। पेपर ने पाया कि यह इसलिए नहीं था कि पिछले फोटो बेकार थे; बल्कि इसलिए था क्योंकि AI अनावश्यक डेटा में डूब रहा था। एक बार जब ReVision ने शोर (noise) को साफ कर दिया, तो AI वास्तव में लंबे, जटिल कार्यों को बेहतर बनाने के लिए अधिक इतिहास का उपयोग कर सका।

मुख्य निष्कर्ष (The Bottom Line)
ReVision कंप्यूटर एजेंटों को कुशल पर्यवेक्षक बनना सिखाता है। पूरी स्क्रीन को हर सेकंड याद करने के बजाय, वे केवल इस बात पर ध्यान केंद्रित करना सीखते हैं कि नया क्या है। यह उन्हें लंबी कहानियाँ याद रखने, बेहतर निर्णय लेने और बिना सुपरकंप्यूटर के डेटा लोड को संभालने की आवश्यकता के कठिन समस्याओं को हल करने की अनुमति देता है।

नोट: पेपर विशेष रूप से कंप्यूटर-उपयोग एजेंटों (सॉफ्टवेयर जो माउस और कीबोर्ड को नियंत्रित करता है) को बेहतर बनाने पर केंद्रित है। यह चिकित्सा अनुप्रयोगों, नैदानिक उपयोगों या इन विशिष्ट एजेंटों को अधिक कुशल बनाने के अलावा भविष्य के निहितार्थों पर चर्चा नहीं करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →