← नवीनतम पेपर
💻 computer science

AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents

यह शोध पत्र AndroTMem को पेश करता है, जो एक नैदानिक ढांचा और बेंचमार्क है जो लॉन्ग-होरिज़न GUI एजेंटों में मेमोरी विफलताओं को प्राथमिक बाधा के रूप में पहचानता है, जिससे एंकरड स्टेट मेमोरी (ASM) का प्रस्ताव मिलता है, जो इंटरैक्शन अनुक्रमों को पूर्ण रीप्ले या सारांशों के बजाय कारण-संबंधी लिंक वाले मध्यवर्ती-अवस्था एंकर्स के रूप में प्रस्तुत करके कार्य पूर्णता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Yibo Shi, Jungang Li, Linghao Zhang, Zihao Dongfang, Biao Wu, Sicheng Tao, Yibo Yan, Chenxi Qin, Weiting Liu, Zhixin Lin, Hanqian Li, Yu Huang, Song Dai, Yonghua Hei, Yue Ding, Xiang Li, Shikang Wang
प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yibo Shi, Jungang Li, Linghao Zhang, Zihao Dongfang, Biao Wu, Sicheng Tao, Yibo Yan, Chenxi Qin, Weiting Liu, Zhixin Lin, Hanqian Li, Yu Huang, Song Dai, Yonghua Hei, Yue Ding, Xiang Li, Shikang Wang, Chengdong Xu, Jingqi Liu, Xueying Ma, Zhiwen Zheng, Xiaofei Zhang, Bincheng Wang, Nichen Yang, Jie Wu, Lihua Tian, Chen Li, Xuming Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ AndroTMem पेपर का सरल, रोज़मर्रा की भाषा में और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "गोल्डफिश" फोन असिस्टेंट

कल्पंतना कीजिए कि आपने अपने फोन पर एक जटिल काम करने के लिए एक बहुत ही बुद्धिमान, सुपर-इंटेलिजेंट रोबोट असिस्टेंट को काम पर रखा है।
कार्य: "JD ऐप पर जाओ, AirPods की कीमत ढूँढो। फिर Taobao पर जाओ, वहाँ की कीमत ढूँढो। दोनों की तुलना करो, जो सस्ता हो उसे खरीदो, और फिर WeChat पर अपने दोस्त Alice को मैसेज करो कि 'मुझे एक अच्छी डील मिली है!'"

यह सुनने में सरल लगता है, है ना? लेकिन एक कंप्यूटर के लिए, यह एक दुःस्वप्न (nightmare) है।

  • चरण 1-10: आप JD ऐप में हैं। आपको कीमत ($100) मिल गई।
  • चरण 11-20: आप Taobao पर स्विच करते हैं। आपको वहाँ की कीमत ($120) मिल गई।
  • चरण 21: आपको याद रखना होगा कि $100 वाला विकल्प सस्ता था।
  • चरण 22: आपको यह भी याद रखना होगा कि वह कौन सा आइटम था ताकि आप उसे खरीद सकें।
  • चरण 23: आप Alice को मैसेज करने के लिए WeChat पर स्विच करते हैं।

समस्या: वर्तमान AI असिस्टेंट गोल्डफिश की तरह हैं जिनकी याददाश्त केवल 3 सेकंड की होती है। जैसे-जैसे कार्य लंबा होता जाता है (अधिक चरणों वाला), वे महत्वपूर्ण विवरण भूल जाते हैं। वे WeChat ऐप तक पहुँच सकते हैं और कह सकते हैं, "ठीक है, मैं Alice को मैसेज करने के लिए तैयार हूँ," लेकिन वे भूल गए कि क्या कहना है या उन्होंने अभी-अभी कौन सा फोन खरीदा है। वे यात्रा के बीच में ही रास्ता भटक जाते हैं।

शोधकर्ता इसे "मेमोरी बॉटलनेक" (Memory Bottleneck) कहते हैं। AI स्क्रीन देखने या सही बटन दबाने में बुरा नहीं है; यह उस कहानी को याद रखने में बुरा है जो उसने अभी-अभी की है।


समाधान: "एंकर्ड मेमोरी" (Anchored Memory) सिस्टम

यह पेपर एक नया सिस्टम पेश करता है जिसे AndroTMem (Android Trajectory Memory) कहा जाता है। इस गोल्डफिश वाली समस्या को ठीक करने के लिए, उन्होंने AI को केवल एक बड़ा दिमाग नहीं दिया; बल्कि उन्होंने उसे एक बेहतर फाइलिंग सिस्टम दिया।

1. पुराना तरीका: "स्क्रॉल ऑफ डूम" (The Scroll of Doom)

पहले, यदि कोई AI याद रखना चाहता था कि क्या हुआ, तो वह हर बार निर्णय लेने के लिए शुरू से अंत तक अपना पूरा इतिहास पढ़ने की कोशिश करता था।

  • उपमा: कल्पना कीजिए कि आप हर बार यह जानने के लिए कि अध्याय 3 में क्या हुआ, 500 पन्नों के उपन्यास को पेज 1 से पढ़ना शुरू करते हैं। यह धीमा है, भ्रमित करने वाला है, और आप अप्रासंगिक विवरणों (जैसे अध्याय 1 में एक पेड़ का वर्णन, जिसका कहानी से कोई लेना-देना नहीं है) से विचलित हो जाते हैं।

2. नया तरीका: "एंकर्ड स्टेट मेमोरी" (The Anchored State Memory - ASM)

शोधकर्ता Anchored State Memory का प्रस्ताव देते हैं। पूरे इतिहास को पढ़ने के बजाय, AI "एंकर" (Anchors) की एक सूची बनाता है।

  • एंकर क्या है? एक एंकर को एक मील के पत्थर (milestone) या एक स्टिक नोट की तरह समझें जिसे आप मानचित्र पर लगाते हैं।

    • एंकर 1: "मैंने JD पर $100 में AirPods पाए।" (यह एक स्टेट एंकर है)।
    • एंकर 2: "मैंने Taobao पर $120 में AirPods पाए।"
    • एंकर 3: "मैंने तय किया कि JD वाला सस्ता है।"
    • एंकर 4: "मैंने JD वाले को कार्ट में जोड़ा।"
  • यह कैसे काम करता है: जब AI को यह तय करने की आवश्यकता होती है कि आगे क्या करना है, तो वह पूरा इतिहास नहीं पढ़ता। वह अपने एंकरों को देखता है।

    • AI पूछता है: "कीमत के बारे में मेरा निर्णय क्या था?"
    • AI एंकर 3 को देखता है: "ओह हाँ, JD सस्ता है।"
    • AI कार्य करता है: "ठीक है, मैं JD वाला खरीदूँगा।"

यह एक लंबे रास्ते पर चलने वाले हाइकर (hiker) की तरह है। हर एक कदम को याद रखने के बजाय (मिट्टी की बनावट, घास का रंग), वे लैंडमार्क्स (landmarks) को याद रखते हैं: "मैं एक बड़े लाल पत्थर के पास से गुजरा था," "मैंने पुल पार किया," "मैं शिखर पर पहुँच गया।" ये लैंडमार्क्स (एंकर) यात्रा के बाकी हिस्से में नेविगेट करने के लिए पर्याप्त हैं।


प्रयोग: "AndroTMem-Bench"

इसे सिद्ध करने के लिए, शोधकर्ताओं ने AndroTMem-Bench नामक एक विशाल टेस्ट ट्रैक बनाया।

  • उन्होंने 1,069 कठिन कार्य बनाए जिनमें ऐप्स के बीच स्विच करना और 30 से 65 चरणों तक विवरण याद रखना आवश्यक है।
  • उन्होंने उपलब्ध सर्वोत्तम AI मॉडल्स (जैसे GPT-4o, Gemini, और ओपन-सोर्स मॉडल्स) का परीक्षण किया।

परिणाम:

  • बिना एंकर्स के: AI रास्ता भटक गया। जैसे-जैसे कार्य लंबे होते गए, सफलता दर तेजी से गिरती गई।
  • एंकर्स के साथ: AI ट्रैक पर रहा। उसने 50 चरणों के बाद भी "सस्ती कीमत" और "दोस्त का नाम" याद रखा।
  • सुधार: नए सिस्टम ने सफलता दर में 5% से 30% का सुधार किया। AI की दुनिया में, यह एक बहुत बड़ी छलांग है।

यह क्यों महत्वपूर्ण है

भविष्य के AI असिस्टेंट के बारे में सोचें। हम चाहते हैं कि वे हमारे टैक्स भरें, हमारी छुट्टियाँ प्लान करें, या हमारे पूरे डिजिटल जीवन को प्रबंधित करें। ये लॉन्ग-होराइजन टास्क (long-horizon tasks) हैं (इनमें बहुत समय लगता है और कई चरण होते हैं)।

यदि हम मेमोरी की समस्या को ठीक नहीं करते हैं, तो हमारे AI असिस्टेंट हमेशा अनाड़ी, भुलक्कड़ मददगार रहेंगे जिन्हें लगातार याद दिलाने की आवश्यकता होगी। AndroTMem दिखाता है कि मेमोरी को एक अव्यवस्थित इतिहास के बजाय स्ट्रक्चर्ड, कनेक्टेड "एंकरों" में व्यवस्थित करके, हम ऐसे एजेंट बना सकते हैं जो वास्तव में वास्तविक दुनिया में काम करने के लिए विश्वसनीय हैं।

एक वाक्य में सारांश

AndroTMem AI असिस्टेंट को एक लंबी यात्रा के हर एक कदम को याद रखने के बजाय, उन प्रमुख लैंडमार्क्स (Anchors) पर ध्यान केंद्रित करना सिखाता है जो कार्य की शुरुआत को अंत से जोड़ते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →