← नवीनतम पेपर
🤖 AI

ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

यह शोध पत्र ChainWorld का परिचय देता है, जो कंप्यूटर उपयोग करने वाले एजेंटों (computer use agents) का मूल्यांकन करने के लिए परमाणु OSWorld कार्यों को दीर्घकालिक डेस्कटॉप वर्कलोड में संयोजित करता है, जिससे यह पता चलता है कि वर्तमान मॉडल बहु-चरणीय पूर्णता (multi-step completion) में संघर्ष करते हैं और इस आधार पर विशिष्ट विफलता प्रोफाइल प्रदर्शित करते हैं कि कार्य सिंगल-टर्न या मल्टी-टर्न प्रारूपों में प्रस्तुत किए गए हैं।

मूल लेखक: Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए रोबोट सहायक का परीक्षण कर रहे हैं। अब तक, सभी ने इसे केवल एक बार में एक सरल कार्य करने के लिए कहकर टेस्ट किया है, जैसे "टोस्टर खोलें" या "लाइट चालू करें।" रोबोट इन एकल कार्यों में बहुत अच्छा है।

लेकिन वास्तविक जीवन में, एक इंसान केवल एक काम नहीं करता; वह कामों की एक श्रृंखला (chain) करता है। आप केवल "टोस्टर नहीं खोलते"; आप टोस्टर खोलते हैं, ब्रेड डालते हैं, उसके पॉप होने का इंतज़ार करते हैं, एक प्लेट उठाते हैं, और फिर टोस्ट पर मक्खन लगाते हैं। यदि रोबोट टोस्ट पॉप होने के बाद प्लेट को भूल जाता है, तो पूरा काम विफल हो जाता है, भले ही उसने टोस्टर को पूरी तरह से खोला हो।

यह शोध पत्र, जिसे ChainWorld कहा जाता है, कंप्यूटर एजेंटों (AI रोबots) को एकल कार्यों के बजाय इन लंबे कार्यों की श्रृंखलाओं पर टेस्ट करने के बारे में है।

समस्या: "एक-कार्य" का जाल (The "One-Task" Trap)

वर्तमान परीक्षण ड्राइविंग टेस्ट की तरह हैं जहाँ आपको केवल एक बार पैरलल पार्क करना होता है। आप उसमें पास हो सकते हैं, लेकिन अगर आप पूरे शहर में बिना रास्ता भटके गाड़ी नहीं चला सकते, तो आप वास्तविक दुनिया के लिए तैयार नहीं हैं। लेखकों ने पाया कि सिर्फ इसलिए कि एक AI एकल कार्यों में अच्छा है, इसका मतलब यह नहीं है कि वह कार्यों के क्रम (sequence) को संभाल सकता है।

समाधान: "कार्य श्रृंखलाएं" बनाना (Building "Task Chains")

शोधकर्ताओं ने मौजूदा सरल कंप्यूटर कार्यों (जिन्हें OSWorld कहा जाता है) के एक विशाल पुस्तकालय को लिया और उन्हें एक धागे में पिरोए गए मोतियों की तरह जोड़ने की कोशिश की।

  • चुनौती: आप किसी भी दो कार्यों को बस यूँ ही आपस में जोड़ नहीं सकते। यदि कार्य A उस फ़ाइल को हटा देता है जिसकी कार्य B को आवश्यकता है, तो श्रृंखला टूट जाएगी। यह केक बनाने की कोशिश करने जैसा है जहाँ पहला कदम है "आटा फेंक देना।"
  • विधि: उन्होंने एक स्मार्ट "संगतता मानचित्र" (compatibility map) बनाया। उन्होंने हर संभावित जोड़ी वाले कार्यों की जाँच की कि क्या वे तार्किक रूप से एक-दूसरे के बाद आ सकते हैं बिना कंप्यूटर को क्रैश किए या आवश्यक फ़ाइलों को हटाए। फिर उन्होंने इस मानचित्र में खोज की ताकि 2, 3, या 4 कार्यों की ऐसी श्रृंखलाएं बनाई जा सकें जो एक एकल कार्य सत्र (work session) के रूप में समझ में आएँ।

उन्होंने इन श्रृंखलाओं का उपयोग करने के लिए 347 ऐसी "श्रृंखलाएं" बनाईं।

प्रयोग: पूछने के दो तरीके

उन्होंने इन श्रृंखलाओं पर चार अलग-अलग AI मॉडल का परीक्षण दो अलग-अलग "नियमों" के साथ किया:

  1. "एक साथ सब कुछ" टेस्ट (Single Turn): AI को एक ही बड़े प्रॉम्प्ट में कार्यों की पूरी सूची दी जाती है। "कार्य A करें, फिर कार्य B करें, फिर कार्य C करें।" उसे अपनी उंगली हिलाने से पहले पूरी यात्रा की योजना अपने दिमाग में बनानी होती है।
  2. "चरण-दर-चरण" टेस्ट (Multi Turn): AI को कार्य A दिया जाता है। एक बार जब वह इसे पूरा कर लेता है, तो उसे कार्य B मिलता है। फिर कार्य C। यह एक इंसान बॉस की तरह है जो आपको एक-एक करके निर्देश देता है, जिससे आप अगले निर्देश पर जाने से पहले एक को पूरा कर सकें।

परिणाम: अंतर वास्तविक है

परिणाम आश्चर्यजनक और थोड़े गंभीर थे:

  • सफलता दर कम है: यहाँ तक कि सर्वश्रेष्ठ AI मॉडल भी पूरी श्रृंखला के कार्यों को केवल 31% समय ही पूरा कर पाए। इसका मतलब है कि वे दो-तिहाई से अधिक बार विफल रहे।
  • चरण-दर-चरण मदद करता है (थोड़ा सा): चार में से तीन मॉडलों के लिए कार्यों को एक-एक करके देना (Multi Turn) बेहतर प्रदर्शन करने में मददगार रहा। एक बार में पूरे प्लान को याद रखने के बजाय एक कदम पर ध्यान केंद्रित करना आसान है। लेकिन इस मदद के साथ भी, वे अक्सर विफल रहे।
  • विफलता के विभिन्न प्रकार:
    • "एक साथ सब कुछ" टेस्ट में: AI आमतौर पर विचार तो सही समझ लेता था लेकिन विवरणों (details) में गलती कर देता था। यह उस छात्र की तरह था जिसने गणित की समस्या को समझा तो सही लेकिन अंत में गलत संख्या लिख दी। उन्होंने "नियर-मिस" (near-miss) त्रुटियां कीं।
    • "चरण-दर-चरण" टेस्ट में: AI को सेशन मैनेज करने में कठिनाई हुई। वे विचलित हो जाते थे, भूल जाते थे कि उन्हें आगे क्या करना था, या बीच में ही हार मान लेते थे। यह एक ऐसे कर्मचारी की तरह था जो एक प्रोजेक्ट शुरू करता है, ऊब जाता है, और काम पूरा करने से पहले ही काम छोड़कर चला जाता है।

मुख्य निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि हम केवल यह नहीं देख सकते कि एक AI एकल कार्य कितनी अच्छी तरह करता है और मान सकते हैं कि वह वास्तविक काम के लिए तैयार है। "एक कार्य करने" और "एक वर्कफ़्लो को प्रबंधित करने" के बीच एक बड़ा अंतर है।

लेखकों ने एक नया टेस्ट (ChainWorld) बनाया है जो AI के ध्यान और स्मृति (attention span and memory) के लिए एक तनाव परीक्षण (stress test) के रूप में कार्य करता है। यह दिखाता है कि हालांकि AI देखने और क्लिक करने में बेहतर हो रहा है, लेकिन जब किसी काम के लिए कई चरणों और पाँच मिनट पहले क्या हुआ था, इसे याद रखने की आवश्यकता होती है, तो वह संघर्ष करता है।

संक्षेप में: AI एकल करतब दिखाने में बहुत अच्छा है, लेकिन वह अभी भी यह सीख रहा है कि एक पूरे रूटीन को बिना गेंद गिराए कैसे निभाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →