← नवीनतम पेपर
🤖 AI

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

यह शोध पत्र StepReflect को प्रस्तुत करता है, जो एक 8B-पैरामीटर वाला मोबाइल GUI एजेंट है जो GPT-5.2 जैसे फ्रंटियर मॉडल्स की तुलना में बेहतर लॉन्ग-होराइजन टास्क सफलता और लागत दक्षता प्राप्त करने के लिए एक स्ट्रक्चर्ड प्रेडिक्शन फ्रेमवर्क और मल्टी-स्टेज ट्रेनिंग पाइपलाइन का उपयोग करता है।

मूल लेखक: Linqiang Guo (Peter), Wei Liu (Peter), Li Gu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen

प्रकाशित 2026-08-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Linqiang Guo (Peter), Wei Liu (Peter), Li Gu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम की दुनिया में नेविगेट करना सिखा रहे हैं। आप नहीं चाहते कि रोबोट केवल अंधाधुंध बटन दबाता रहे; आप चाहते हैं कि वह इतना समझदार हो कि देख सके, "रुको, मैंने गलत दरवाजा क्लिक कर दिया, मैं गैरेज के बजाय किचन में हूँ," और फिर अपनी गलती को सुधार सके। यह "स्वायत्त एजेंटों" (autonomous agents) का सपना है—ऐसे कंप्यूटर प्रोग्राम जो स्क्रीन को देखकर और इंसानों की तरह आइकन पर टैप करके, खाना ऑर्डर करने या राइड बुक करने जैसे जटिल कार्य अपने आप कर सकते हैं। लेकिन यहाँ एक पेंच है: ये रोबोट अक्सर रास्ता भटक जाते हैं। उन्हें लग सकता है कि वे सफल हो गए हैं जबकि वास्तव में वे विफल रहे थे, और क्योंकि वे अपनी गलतियों पर "चिंतन" (reflect) नहीं करते, वे गलत रास्ते पर चलते रहते हैं जब तक कि पूरा मिशन क्रैश न हो जाए।

इसे ठीक करने के लिए, वैज्ञानिक इन रोबोटों को एक "अंतरात्मा" देने की कोशिश कर रहे हैं। पुराना तरीका यह था कि एक अत्यंत बुद्धिमान, क्लाउड-आधारित मस्तिष्क (एक विशाल AI मॉडल) से हर एक कदम को देखने और इस बारे में एक लंबा निबंध लिखने के लिए कहना कि क्या वह सही गया या गलत। यह काम करता है, लेकिन यह धीमा, महंगा और कुछ हद तक ऐसा है जैसे हर बार एक अक्षर लिखने पर नोबेल पुरस्कार विजेता प्रोफेसर से अपना होमवर्क चेक करने के लिए कहना। यह बहुत अधिक (overkill) है। बड़ा सवाल यह है: क्या हम एक छोटा, तेज़, स्थानीय "कोच" बना सकते हैं जो सीधे फोन पर मौजूद हो, चरणों को जल्दी से चेक करे, और रोबट को बता सके कि कब रुकना है और फिर से सोचना है? यही वह समस्या है जिसे इस शोध पत्र के शोधकर्ता हल कर रहे हैं।

यहाँ आता है StepReflect, एक नया, चतुर छोटा रोबोट कोच जिसे मोबाइल ऐप्स के लिए परम "स्पॉट-चेकर" (spot-checker) के रूप में डिज़ाइन किया गया है। इसे एक गेम रेफरी की तरह समझें जिसे गोल होने का पता लगाने के लिए पूरा मैच देखने की ज़रूरत नहीं है। एक विशाल, महंगे AI से हर चाल के बारे में उपन्यास लिखने के लिए कहने के बजाय, StepReflect स्क्रीन की एक विशिष्ट "पहले" (Before) और "बाद" (After) की तस्वीर देखता है, एक सरल चेकलिस्ट की जांच करता है कि क्या होना चाहिए था, और तुरंत निर्णय लेता है: "हाँ, वह एक अच्छा कदम था," या "नहीं, तुमने गड़बड़ी की।"

शोधकर्ताओं ने पाया कि यह "स्पॉट-चेकर" अपने काम में आश्चर्यजनक रूप से अच्छा है। उन्होंने इसे एक विशेष तीन-चरणीय प्रक्रिया का उपयोग करके प्रशिक्षित किया: पहले, उन्होंने इसे स्क्रीन कैसे बदलती है इसके मूल सिद्धांत सिखाए; दूसरे, उन्होंने एक सुपर-स्मार्ट शिक्षक AI का उपयोग किया जिसने इसे अपने तर्क को स्पष्ट रूप से समझाने का तरीका दिखाया; और तीसरे, उन्होंने इसे बहुत अधिक नकारात्मक न होने के लिए फाइन-ट्यून किया (क्योंकि रोबोट को यह बताने में कि वह विफल रहा है जब वास्तव में वह सफल हुआ था, उससे कहीं अधिक बुरा है कि उसे एक सेकंड के लिए आगे बढ़ने दें)। जब उन्होंने इस 8-बिलियन-पैरामीटर वाले मॉडल (एक बहुत ही स्मार्ट लेकिन प्रबंधनीय आकार) का परीक्षण 1,082 वास्तविक दुनिया के स्क्रीन ट्रांज़िशन पर किया, तो इसने उनमें से 82.16% को सही ढंग से पहचाना। यह एक बड़ी बात है क्योंकि इसने विशाल, ज़ीरो-शॉट GPT-5.2 मॉडल को 11.83 प्रतिशत अंक से पीछे छोड़ दिया, भले ही विशाल मॉडल को भी बिल्कुल वही जानकारी मिल रही थी।

यह शोध पत्र इस विचार के विरुद्ध तर्क देता है कि आपको इस तरह की सोच के लिए हमेशा क्लाउड में मौजूद सबसे बड़े, सबसे महंगे AI की आवश्यकता होती है। वे दिखाते हैं कि प्रतिबिंब (reflection) को एक संरचित, चरण-दर-चरण जाँच (जैसे एक चेकलिस्ट) के रूप में मानना, खुले तौर पर रचनात्मक तर्क (open-ended, creative reasoning) माँगने की तुलना में बहुत बेहतर है। जब उन्होंने StepReflect को चार अलग-अलग रोबोट फ्रेमवर्क में डाला, तो इसने उनमें से तीन को पहले की तुलना में अधिक बार सफल होने में मदद की। चौथे वाले में, यह महंगे क्लाउड संस्करण के लगभग बराबर था, लेकिन इसने API शुल्क पर बहुत पैसे बचाए। उदाहरण के लिए, एक परीक्षण में, इसने सफलता दर को लगभग समान रखते हुए लागत को 46.00सेघटाकर46.00** से घटाकर **37.50 कर दिया।

संक्षेप में, StepReflect सुझाव देता है कि हमें हर छोटी गलती के लिए एक विशाल AI को बुलाने की आवश्यकता नहीं है। इसके बजाय, हम एक छोटे, स्थानीय रूप से चलने वाले मॉडल का उपयोग कर सकते हैं जिसे विशेष रूप से स्क्रीन परिवर्तन के "पहले" और "बाद" को देखने और यह कहने के लिए प्रशिक्षित किया गया है कि, "हाँ, यह काम कर गया," या "नहीं, फिर से प्रयास करें।" यह हमारे डिजिटल सहायकों को एक ही गलती बार-बार करने से रोकने का एक व्यावहारिक, सस्ता और तेज़ तरीका है, जिससे वे बिना क्लाउड में किसी सुपरकंप्यूटर की हर सेकंड निगरानी के, हमारे ऐप्स को नेविगेट करने में बहुत बेहतर हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →