← नवीनतम पेपर
🤖 AI

Step-level Optimization for Efficient Computer-use Agents

यह शोध पत्र एक मॉड्यूलर, इवेंट-ड्रिवन स्टेप-लेवल कैस्केड फ्रेमवर्क का प्रस्ताव करता है जो छोटे, सस्ते पॉलिसियों को डिफ़ॉल्ट बनाने और केवल तभी बड़े, महंगे मॉडलों पर एस्केलेट करने द्वारा कंप्यूटर-यूज़ एजेंट्स की दक्षता को अनुकूलित करता है जब हल्के मॉनिटर्स प्रगति के रुकने या सिमेंटिक ड्रिफ्ट का पता लगाते हैं।

मूल लेखक: Jinbiao Wei, Kangqi Ni, Yilun Zhao, Guo Gan, Arman Cohan

प्रकाशित 2026-05-01
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jinbiao Wei, Kangqi Ni, Yilun Zhao, Guo Gan, Arman Cohan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल, अपरिचित शहर में नेविगेट करने और कामों की एक लंबी सूची पूरी करने के लिए सहायकों की एक टीम को काम पर रख रहे हैं।

समस्या: "महंगा विशेषज्ञ" का जाल (The "Expensive Expert" Trap)
वर्तमान में, अधिकांश कंप्यूटर एजेंट इस तरह काम करते हैं: आप एक बेहद महंगे, विश्व स्तरीय विशेषज्ञ (एक विशाल AI मॉडल) को अपने लिए हर एक निर्णय लेने के लिए काम पर रखते हैं। वे नक्शा देखते हैं, मोड़ चुनते हैं, और पूरा रास्ता तय करते हैं।

  • अच्छी बात: वे बहुत बुद्धिमान होते हैं और शायद ही कभी रास्ता भटकते हैं।
  • बुरी बात: वे अविश्वसनीय रूप से धीमे और महंगे होते हैं। यहाँ तक कि जब आपको बस एक परिचित कोने पर बाएं मुड़ने की आवश्यकता होती है, तब भी आप विशेषज्ञ की उच्च प्रति घंटा दर का भुगतान कर रहे होते हैं। यदि एजेंट एक लूप में फंस जाता है (गोल-गोल घूमना) या आपके ध्यान दिए बिना गलत दिशा में जाने लगता है, तो विशेषज्ञ तब तक चलता रहता है, पैसा और समय बर्बाद करता है जब तक कि कार्य विफल न हो जाए।

समाधान: "स्मार्ट कैस्केड" (STEPWISE)
इस पेपर के लेखक मदद के लिए एक नया तरीका प्रस्तावित करते हैं। हर कदम के लिए विशेषज्ञ को भुगतान करने के बजाय, आप एक सस्ते, तेज़ स्थानीय गाइड (एक छोटा AI मॉडल) को चलने के लिए काम पर रखते हैं। यह गाइड बुनियादी बातें जानता है और 90% नियमित चरणों को पूरी तरह से संभाल सकता है।

हालाँकि, आप महंगे विशेषज्ञ को स्पीड-डायल पर रखते हैं। आप उन्हें केवल दो विशिष्ट स्थितियों में बुलाते हैं, जिन्हें दो "स्मार्ट सेंसर" (मॉनिटर) स्थानीय गाइड पर नज़र रखते हुए पहचानते हैं:

  1. "फँसे होने का सेंसर" (प्रगति मॉनिटर - The "Stuck Sensor"):

    • रूपक: कल्पना कीजिए कि आपका स्थानीय गाइड गोल-गोल घूम रहा है या बार-बार एक ही दरवाजे के हैंडल को छू रहा है। सेंसर नोटिस करता है, "हे, हम आगे नहीं बढ़ रहे हैं!"
    • कार्रवाई: यह तुरंत विशेषज्ञ को बुलाता है और कहता है, "हम फंस गए हैं! नियंत्रण संभालें, एक नया रास्ता खोजें, और हमें फिर से आगे बढ़ाएं।" एक बार जब विशेषज्ञ लूप को तोड़ देता है, तो नियंत्रण वापस सस्ते गाइड के पास चला जाता है।
  2. "माइलस्टोन सेंसर" (ड्रिफ्ट मॉनिटर - The "Milestone Sensor"):

    • रूपक: कभी-कभी, गाइड गोल-गोल नहीं घूम रहा होता है, लेकिन वह आत्मविश्वास के साथ गलत दिशा में जा रहा होता है (जैसे, लाइब्रेरी जाने के बजाय किराने की दुकान की ओर जाना)। इसे "साइलेंट ड्रिफ्ट" कहा जाता है। गाइड व्यस्त दिखता है, लेकिन वह विफल हो रहा है।
    • कार्रवाई: सेंसर एक स्वाभाविक "चेकपॉइंट" (जैसे कोई बड़ा काम पूरा करना) का इंतज़ार करता है। यह विशेषज्ञ से पूछता है, "क्या हमने अभी सही काम पूरा किया, या हम रास्ते से भटक गए?" यदि विशेषज्ञ कहता है, "नहीं, आप गलत दुकान पर हैं," तो विशेषज्ञ सुधार करने के लिए नियंत्रण लेता है। यदि विशेषज्ञ कहता, "हाँ, अच्छा काम किया," तो सस्ता गाइड आगे बढ़ता रहता है।

यह क्यों काम करता है
पेपर ने इन दो वास्तविक "शहरों" (डेस्कटॉप सॉफ़्टवेयर और वेब ब्राउज़िंग से जुड़े जटिल कंप्यूटर कार्यों) पर इस सिस्टम का परीक्षण किया। उन्होंने यह पाया:

  • यह सस्ता है: सस्ते गाइड को अधिकांश काम करने देने से, हमने इन एजेंटों को चलाने की लागत को 75% तक कम कर दिया।
  • यह तेज़ है: एजेंटों ने कार्यों को 45% तेज़ी से पूरा किया क्योंकि उन्हें हर छोटे कदम के लिए धीमे विशेषज्ञ का इंतज़ार नहीं करना पड़ा।
  • यह उतना ही अच्छा है: सफलता दर (काम को सही ढंग से पूरा करना) लगभग उतनी ही थी जितनी कि यदि उन्होंने पूरे सफर के लिए महंगे विशेषज्ञ का उपयोग किया होता।

निष्कर्ष (The Bottom Line)
यह पेपर तर्क देता है कि कंप्यूटर कार्य का हर कदम समान रूप से कठिन नहीं होता है। अधिकांश चरण नियमित होते हैं; केवल कुछ ही खतरनाक या पेचीदा होते हैं। एक "स्मार्ट कैस्केड" का उपयोग करके जो ज़रूरत पड़ने पर सस्ते कार्यकर्ता और महंगे विशेषज्ञ के बीच स्विच करता है, हम ऐसे कंप्यूटर एजेंट बना सकते हैं जो तेज़, किफायती और फिर भी बहुत बुद्धिमान हों। यह एक "हमेशा चालू" महंगी प्रक्रिया को एक "ऑन-डिमांड" स्मार्ट सिस्टम में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →