← नवीनतम पेपर
🤖 AI

OpenComputer: Verifiable Software Worlds for Computer-Use Agents

यह शोधपत्र OpenComputer प्रस्तुत करता है, जो एक सत्यापनकर्ता-आधारित (verifier-grounded) ढांचा है जो कंप्यूटर-उपयोग करने वाले एजेंटों के लिए सत्यापन योग्य सॉफ्टवेयर जगत का निर्माण करता है, जिसमें एप्लिकेशन-विशिष्ट अवस्था सत्यापनकर्ताओं (application-specific state verifiers), एक स्व-विकसित होने वाले सत्यापन परत (self-evolving verification layer), एक कार्य-जनरेशन पाइपलाइन और एक मूल्यांकन हारनेस को एकीकृत किया गया है ताकि वर्तमान सीमावर्ती (frontier) और ओपन-सोर्स एजेंटों की आंशिक प्रगति के बावजूद उनकी मजबूती में महत्वपूर्ण अंतराल को उजागर किया जा सके।

मूल लेखक: Jinbiao Wei, Qianran Ma, Yilun Zhao, Xiao Zhou, Kangqi Ni, Guo Gan, Arman Cohan

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinbiao Wei, Qianran Ma, Yilun Zhao, Xiao Zhou, Kangqi Ni, Guo Gan, Arman Cohan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपने दैनिक काम सिखा रहे हैं, जैसे कि आपकी डिजिटल फाइलों को व्यवस्थित करना, किसी फोटो को एडिट करना, या ईमेल भेजना। आप चाहते हैं कि रोबोट एकदम सटीक हो, लेकिन आपको यह कैसे पता चलेगा कि उसने वास्तव में काम सही ढंग से किया है?

यही वह समस्या है जिसे OpenComputer पेपर हल करता है। लेखकों ने कंप्यूटर का उपयोग करने वाले AI एजेंटों के लिए एक नया "प्रशिक्षण जिम" (training gym) बनाया है, लेकिन इसमें एक बहुत ही विशिष्ट मोड़ है: वे केवल रोबोट के काम को नहीं देखते; वे रोबोट के होमवर्क की एक सख्त और बिना पलक झपकाए जांच करते हैं।

यहाँ OpenComputer कैसे काम करता है, सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "दिखावा करने तक सफल होने" (Fake It Till You Make It) का जाल

अतीत में, कंप्यूटर पर AI का परीक्षण करना किसी छात्र के निबंध को केवल उसके कवर पेज को देखकर ग्रेड देने जैसा था। यदि कवर अच्छा दिखता था, तो शिक्षक (एक AI जज) उसे 'A' ग्रेड दे सकता था। लेकिन छात्र ने वास्तव में निबंध खाली छोड़ दिया होगा या उसमें बकवास भर दी होगी।

डिजिटल दुनिया में, एक AI एक पूरा दिखने वाला दस्तावेज़ का स्क्रीनशॉट ले सकता है, लेकिन यदि उसके अंदर की फ़ाइल वास्तव में खाली है या सेटिंग्स गलत हैं, तो "AI जज" गलती को मिस कर सकता है क्योंकि वह केवल तस्वीर देखता है, डेटा नहीं।

2. समाधान: "डिजिटल इंस्पेक्टर" (The Digital Inspector)

OpenComputer खेल बदल देता है एक सत्यापन योग्य सॉफ्टवेयर दुनिया (verifiable software world) बनाकर। केवल स्क्रीन देखने के बजाय, यह हर उस एप्लिकेशन के भीतर विशेषज्ञ "इंस्पेक्टर्स" (जिन्हें वेरिफायर/Verifiers कहा जाता है) की एक टीम स्थापित करता है जिसका AI उपयोग करता है।

  • इंस्पेक्टर का काम: एक लाइब्रेरियन की कल्पना करें जो केवल किताब के कवर को नहीं देखता। वे किताब खोलते हैं, पेज नंबर चेक करते हैं, लेखक का नाम सत्यापित करते हैं, और सुनिश्चित करते हैं कि टेक्स्ट लाइब्रेरी के डेटाबेस से मेल खाता है।
  • यह कैसे काम करता है: हर ऐप (जैसे वेब ब्राउज़र, फोटो एडिटर, या स्प्रेडशीट) के लिए, OpenComputer एक कस्टम स्क्रिप्ट बनाता है जो सीधे ऐप के "दिमाग" से "बात" कर सकती है। यह सवाल पूछती है जैसे: "क्या फ़ाइल वास्तव में सेव हुई है?" "क्या यूजर ने वास्तव में उस बटन पर क्लिक किया?" "क्या टेक्स्ट सही सेल में है?"

3. चार-चरणीय निर्माण प्रक्रिया

पेपर इन परफेक्ट टेस्ट परिदृश्यों को बनाने के लिए एक चार-चरणीय फैक्ट्री लाइन का वर्णन करता है:

  • चरण 1: इंस्पेक्टर बनाएं। वे हर ऐप के लिए एक "चाबी" (key) बनाते हैं जो सिस्टम को सॉफ्टवेयर की छिपी हुई स्थिति (फाइल्स, सेटिंग्स, हिस्ट्री) में झांकने की अनुमति देती है, न कि केवल स्क्रीन से अनुमान लगाने की।
  • चरण 2: स्व-सुधार लूप (The Self-Improving Loop)। वे इन इंस्पेक्टरों का परीक्षण एक "मजबूत" AI के साथ करते हैं। यदि इंस्पेक्टर कहता है "अच्छा काम किया" लेकिन AI ने वास्तव में गलती कर दी, तो सिस्टम त्रुटि को पकड़ लेता है। इसके बाद यह इंस्पेक्टर के कोड को ठीक करता है, जिससे वह अगली बार के लिए अधिक स्मार्ट बन जाता है। यह एक कोच की तरह है जो खिलाड़ी का अभ्यास देखते हुए प्रशिक्षण उपकरण को अधिक सटीक बनाने के लिए समायोजित करता है।
  • चरण 3: कार्य (Tasks) बनाना। एक बार जब इंस्पेक्टर विश्वसनीय हो जाते हैं, तो सिस्टम 1,000 वास्तविक कार्य उत्पन्न करता है (जैसे "इन 50 फाइलों को व्यवस्थित करें" या "इस फोटो को एडिट करें")। क्योंकि इंस्पेक्टर तैयार हैं, इसलिए हर कार्य के पास एक स्पष्ट, मशीन-चेकेबल "पास" या "फेल" मानदंड होता है।
  • चरण 4: अंतिम परीक्षा। वे एजेंटों को एक ताज़ा, साफ डिजिटल कमरे में चलाते हैं। एजेंट कार्यों को हल करने की कोशिश करते हैं, और इंस्पेक्टर वास्तविक डेटा के आधार पर तुरंत उन्हें ग्रेड देते हैं, न कि केवल तस्वीरों के आधार पर।

4. उन्होंने क्या पाया

जब उन्होंने इस नए जिम में सर्वश्रेष्ठ AI मॉडल (जैसे GPT-5.4 और Claude) का परीक्षण किया, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:

  • "लगभग" वाली समस्या (The "Almost" Problem): यहाँ तक कि सबसे स्मार्ट AI भी पूरे कार्य को पूरी तरह से करने में संघर्ष करते हैं। वे अक्सर 80% तक पहुँच जाते हैं लेकिन सूक्ष्म, अंतिम विवरणों (जैसे फ़ाइल को गलत फोल्डर में सेव करना) पर विफल हो जाते हैं।
  • "नकली" सफलता (The "Fake" Success): पुराने तरीके से निर्णय लेना (एक AI का स्क्रीनशॉट देखना) बहुत उदार था। इसने उन एजेंटों को उच्च स्कोर दिया जो सफल दिखते थे लेकिन वास्तव में डेटा चेक में विफल रहे थे। नया "हार्ड-कोडेड वेरिफायर" बहुत सख्त था और मानव द्वारा कही जाने वाली बातों के साथ बेहतर तालमेल रखता था।
  • ओपन-सोर्स गैप (The Open-Source Gap): कुछ ओपन-सोर्स मॉडल जो अन्य परीक्षणों में शानदार दिखते थे, वे यहाँ बहुत खराब प्रदर्शन करने लगे। यह सुझाव देता है कि वे सरल परीक्षणों के लिए सही उत्तर का "अनुमान" लगाने में अच्छे थे लेकिन वास्तविक, जटिल कंप्यूटर सॉफ्टवेयर को संभालने में नहीं।

5. मुख्य निष्कर्ष (The Big Takeway)

OpenComputer केवल कार्यों की एक सूची नहीं है; यह सत्य का एक नया मानक है।

इसे एक "ईमानदारी प्रणाली" (honor system) वाले टेस्ट से "निरीक्षित परीक्षा" (proctored exam) में जाने जैसा समझें, जहाँ एक रोबोट प्रॉक्टर उत्तर कुंजी के विरुद्ध प्रत्येक उत्तर की जाँच करता है। पेपर निष्कर्ष निकालता है कि हालांकि AI स्क्रीन देखने में बेहतर हो रहा है, लेकिन सूक्ष्म लेकिन महत्वपूर्ण गलतियाँ किए बिना विश्वसनीय रूप से जटिल, वास्तविक दुनिया का कंप्यूटर कार्य करने के लिए इसे अभी लंबा रास्ता तय करना है।

संक्षेप में: OpenComputer ने एक ऐसा डिजिटल प्लेग्राउंड बनाया है जहाँ नियम अनुमान के बजाय कोड द्वारा जांचे जाते हैं, जिससे पता चलता है कि आज के AI एजेंट अभी भी वास्तव में विश्वसनीय डिजिटल कार्यकर्ता बनने के बारे में सीख रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →