← नवीनतम पेपर
🤖 AI

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

यह शोध पत्र OmegaUse-OfficeVal प्रस्तुत करता है, जो आर्थिक आधार (मानव श्रम समय और कार्य मूल्य) के साथ 100 दीर्घ-अवधि वाले ऑफिस-सुइट कार्यों वाला एक नया बेंचमार्क है, जो LLM एजेंटों का मूल्यांकन करता है और यह प्रकट करता है कि हालांकि वर्तमान मॉडल मनुष्यों की तुलना में काफी सस्ते और तेज़ हैं, फिर भी वे कार्य पूरा करने में मानव-स्तर की गुणवत्ता प्राप्त करने में पीछे रह जाते हैं।

मूल लेखक: Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

प्रकाशित 2026-07-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आपका कंप्यूटर केवल आपके बटन दबाने का इंतज़ार नहीं करता, बल्कि वास्तव में आपके लिए काम करता है। यह "AI एजेंटों" का सपना है—स्मार्ट प्रोग्राम जो आपके निर्देशों को पढ़ सकते हैं, आपकी फ़ाइलें खोल सकते हैं और एक काम को पूरा कर सकते हैं, बिल्कुल एक डिजिटल इंटर्न की तरह। कुछ समय के लिए, ये एजेंट छोटे, सरल कामों के लिए बेहतरीन रहे हैं, जैसे कि एक ईमेल लिखना या एक छोटा लेख सारांशित करना। लेकिन उनकी शक्ति की असली परीक्षा यह है कि क्या वे कार्यालय के एक पूरे दिन के काम को संभाल सकते हैं: एक बिखरी हुई रिपोर्ट को लेना, उसे रीफॉर्मेट करना, चार्ट जोड़ना और उसे बिना भ्रमित हुए या फ़ाइल को खराब किए पूरी तरह से सुरक्षित करना। शोधकर्ता एक बड़ा सवाल पूछ रहे हैं: क्या ये डिजिटल कार्यकर्ता वास्तव में काम कर सकते हैं, और क्या एक वास्तविक इंसान को काम पर रखने की तुलना में यह पैसा वसूल है?

यहाँ OmegaUse-OfficeVal आता है, जो शोधकर्ताओं द्वारा बनाया गया एक नया "रिपोर्ट कार्ड" है, जिसे ठीक इसी चीज़ का परीक्षण करने के लिए डिज़ाइन किया गया है। उन्होंने केवल काल्पनिक, आसान कार्य नहीं बनाए; उन्होंने 100 वास्तविक दुनिया की कार्यालय चुनौतियों का उपयोग करके एक बेंचमार्क बनाया, जैसे कि एक टूटी हुई स्प्रेडशीट को ठीक करना या एक कच्चे ड्राफ्ट को एक पॉलिश की हुई प्रेजेंटेशन में बदलना। जो इस परीक्षण को विशेष बनाता है वह यह है कि उन्होंने हर एक कार्य के साथ एक "मूल्य टैग" (price tag) भी जोड़ा। उन्होंने सटीक रूप से मापा कि एक इंसान ने इसे करने में कितना समय लिया और यह अनुमान लगाया कि किसी को भुगतान करने में कितनी लागत आएगी। फिर, उन्होंने दुनिया के सबसे स्मार्ट AI मॉडलों को में से इन पहेलियों को हल करने के लिए छोड़ा। परिणाम? AI एजेंट अविश्वसनीय रूप से तेज़ और सस्ते हैं—अक्सर चंद पैसों में मिनटों में काम पूरा कर देते हैं—लेकिन वे अंतिम उत्पाद के लिए भरोसेमंद होने के लिए अभी भी बहुत अधिक गलतियाँ करते हैं। हालांकि वे बेहतर हो रहे हैं, लेकिन वे अभी तक एक विश्वसनीय मानव कनिष्ठ कर्मचारी के स्तर तक नहीं पहुँच पाए हैं।

सेटअप: एक डिजिटल बाधा दौड़

यह समझने के लिए कि शोधकर्ताओं ने क्या किया, कार्यालय को एक विशाल, अस्त-व्यस्त वर्कशॉप के रूप में सोचें। अतीत में, AI का परीक्षण करना कुछ ब्लॉक जोड़ने के लिए उससे पूछने जैसा था। यदि उसने एक भी गिरा दिया, तो वह विफल हो जाता था। लेकिन वास्तविक कार्यालय कार्य एक जटिल केक को शुरू से बनाने जैसा है: आपको सामग्री (फ़ाइलें) इकट्ठा करनी होती है, रेसिपी (निर्देश) का पालन करना होता है, और यदि आपने फ्रॉस्टिंग जला दी, तो पूरा केक बर्बाद हो जाता है।

शोधकर्ताओं ने OmegaUse-OfficeVal नामक एक डेटासेट बनाया जिसमें ऐसे 100 "केक बनाने वाले" कार्य शामिल थे। ये साधारण "कविता लिखें" जैसे अनुरोध नहीं थे। ये वर्ड दस्तावेज़, पावरपॉइंट स्लाइड्स और एक्सेल स्प्रेडशीट से जुड़े लंबे, बहु-चरणीय कार्य थे। कुछ कार्यों को पूरा करने में मनुष्यों को औसतन 2.32 घंटे लगे। कंप्यूटर के लिए अपना ध्यान केंद्रित रखने के लिए यह एक लंबा समय है!

जो इस बेंचमार्क को अद्वितीय बनाता है वह इसकी "आर्थिक ग्राउंडिंग" है। शोधकर्ताओं ने केवल यह नहीं पूछा, "क्या AI ने कार्य पूरा किया?" उन्होंने पूछा, "इसने कितना मूल्य बनाया?" इसे करने के लिए, उन्होंने प्रत्येक कार्य के लिए दो चीजें ट्रैक कीं:

  1. मानव श्रम समय (Human Labor Time): एक वास्तविक व्यक्ति को इसे करने में कितना समय लगा।
  2. कार्य मूल्य प्रॉक्सी (Task Price Proxy): एक मोटा अनुमान कि यदि आप किसी फ्रीलांसर को यह काम करने के लिए काम पर रखते हैं तो उसकी लागत कितनी होगी (लगभग 3.65से3.65** से **29.22 प्रति कार्य के बीच)।

इससे उन्हें AI की तुलना केवल गति के आधार पर नहीं, बल्कि इस आधार पर करने में मदद मिली कि क्या वह वास्तव में पैसा बचा रहा था या केवल सस्ती गलतियाँ कर रहा था।

परीक्षण: AI बनाम मानव इंटर्न

शोधकर्ताओं ने कई शीर्ष-स्तरीय AI मॉडलों को एक "मानव बेसलाइन" के विरुद्ध खड़ा किया। यह बेसलाइन कोई CEO या जीनियस नहीं थी; यह एक कुशल कनिष्ठ कार्यकर्ता या इंटर्न था। मनुष्यों को AI की तरह ही वही निर्देश और फ़ाइलें दी गईं और काम करने के लिए कहा गया।

परिणामों को ग्रेड करने के लिए, शोधकर्ताओं ने केवल एक इंसान को अंतिम फ़ाइल देखकर यह कहने के लिए नहीं कहा, "अच्छा लग रहा है!" वह बहुत धीमा और व्यक्तिपरक होता। इसके बजाय, उन्होंने कोड-आधारित सत्यापनकर्ता (code-based verifiers) लिखे। एक रोबोट निरीक्षक की कल्पना करें जो स्वचालित रूप रूप से अंतिम फ़ाइल की जाँच करता है। वह दस्तावेज़ खोलता है, जाँचता है कि क्या कवर पेज वहां है, गिनता है कि क्या चार्ट का आकार सही है, और सुनिश्चित करता है कि कोई टेक्स्ट गलती से डिलीट तो नहीं हुआ है। यदि फ़ाइल खराब है या उसका कोई मुख्य हिस्सा गायब है, तो रोबोट उसे शून्य दे देता है। इसने परीक्षण को निष्पक्ष, तेज़ और दोहराने योग्य बना दिया।

परिणाम: तेज़ और सस्ता, लेकिन पूर्ण नहीं

जब धूल जमी, तो परिणामों ने एक स्पष्ट कहानी बताई।

मानव बेसलाइन (Human Baseline):
मानव श्रमिकों ने संभवतः पूर्ण स्कोर में से औसतन 27.79 अंक प्राप्त किए। वे विश्वसनीय थे। उन्होंने शायद ही कभी फ़ाइलों को खराब किया, और उन्होंने अधिकांश विवरण सही रखे। हालाँकि, उन्हें समय और पैसा लगा। औसतन, एक मानव कार्य की लागत लगभग $6.86 थी और इसमें 2.32 घंटे लगे।

AI एजेंट (AI Agents):
AI मॉडल एक अलग कहानी थे। वे बिजली की तरह तेज़ और अविश्वसनीय रूप से सस्ते थे।

  • गति: सबसे तेज़ AI (DeepSeek-V4-Pro) ने एक कार्य को मात्र 0.184 घंटे (लगभग 11 मिनट) में पूरा किया।
  • लागत: सबसे सस्ता AI (Qwen3.7-Plus) प्रति कार्य केवल $0.2152 खर्च करता था। यह एक कप कॉफी से भी कम है!

लेकिन यहाँ एक पेंच है: वे काम करने में बहुत अच्छे नहीं थे।
सबसे अच्छा AI मॉडल (GLM-5.2) ने केवल 17.91 स्कोर किया। यह मानव स्कोर 27.79 से काफी कम है। हालांकि AI तेज़ और सस्ता था, लेकिन उसने अधिक गलतियाँ कीं। वह अक्सर विषय सूची (table of contents) जोड़ना भूल जाता, फॉर्मेटिंग बिगाड़ देता, या ऐसी फ़ाइल बना देता जिसे खोला नहीं जा सकता था।

शोधकर्ताओं ने पाया कि AI सबसे कठिन, लंबे कार्यों के साथ सबसे अधिक संघर्ष करता है। जब किसी कार्य के लिए मनुष्य को लंबे समय तक (2 घंटे से अधिक) काम करने की आवश्यकता होती, तो AI का प्रदर्शन और भी गिर जाता। ऐसा लगता है कि जबकि AI त्वरित, सरल कार्यों के लिए महान है, जब "लॉन्ग-होरिज़न" (long-horizon) योजना जटिल हो जाती है, तो वह भटक जाता है।

निष्कर्ष: अभी मुख्य भूमिका के लिए तैयार नहीं (अभी तक)

अध्ययन बताता है कि हम कार्यालय कार्य के "घाटी" (valley) में हैं। तकनीक निर्विवाद रूप से उपयोगी है क्योंकि यह इतनी सस्ती और तेज़ है। यदि आपको एक कच्चा ड्राफ्ट या त्वरित सारांश चाहिए, तो AI एक शानदार उपकरण है। लेकिन यदि आपको एक पॉलिश किया हुआ, पेशेवर दस्तावेज़ चाहिए जिसे क्लाइंट को भेजा जा सके, तो AI अभी वहां तक नहीं पहुँचा है।

लेखकों ने स्पष्ट रूप से इस विचार को खारिज कर दिया कि AI ने कार्यालय के काम को पहले ही हल कर लिया है। उन्होंने दिखाया कि हालांकि AI "काफी सस्ता और तेज़" है, लेकिन यह "अभी तक मानव-स्तर की डिलिवरेबल गुणवत्ता के करीब नहीं पहुँचा है।" एक मानव कार्यकर्ता और एक AI एजेंट के बीच का अंतर अभी भी काफी बड़ा है जब बात अंतिम उत्पाद की गुणवत्ता की आती है।

हालाँकि, पेपर भविष्य के प्रति आशावादी है। वास्तविक आर्थिक डेटा के साथ इस कठोर परीक्षण को बनाकर, शोधकर्ताओं ने एक रोडमैप तैयार किया है। वे जानते हैं कि AI कहाँ विफल हो रहा है (लंबे कार्य, जटिल फॉर्मेटिंग) और अब वे उन विशिष्ट समस्याओं को ठीक करने पर काम कर सकते हैं। फिलहाल, सबसे अच्छी रणनीति एक साझेदारी लगती है: AI को भारी काम और त्वरित ड्राफ्ट करने दें, लेकिन अंतिम उत्पाद की जाँच करने और गलतियों को सुधारने के लिए एक इंसान को प्रक्रिया में रखें। "वाइब वर्किंग" (vibe working) का सपना—जहाँ AI बस पूरा काम संभाल लेता है—अभी भी एक प्रगतिशील कार्य है, लेकिन यात्रा आधिकारिक रूप से शुरू हो गई है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →