← नवीनतम पेपर
💬 NLP

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language World Models

यह शोध पत्र OccuBench प्रस्तुत करता है, जो 65 विशिष्ट डोमेन में 100 वास्तविक-विश्व पेशेवर कार्यों के माध्यम से AI एजेंटों का मूल्यांकन करने के लिए लैंग्वेज वर्ल्ड मॉडल्स (Language World Models) का उपयोग करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि कोई भी एकल मॉडल सभी उद्योगों पर हावी नहीं है, स्पष्ट त्रुटियों की तुलना में निहित डेटा दोष अधिक चुनौतियाँ पेश करते हैं, और प्रदर्शन मॉडल के आकार और तर्क संबंधी प्रयास के साथ बढ़ता है।

मूल लेखक: Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल व्यवसाय चलाने के लिए एक नया कर्मचारी रख रहे हैं। आप उनसे केवल व्हाइटबोर्ड पर गणित की समस्या हल करने के लिए नहीं कहेंगे; बल्कि आप उन्हें एक सिम्युलेटेड ऑफिस में रखेंगे, उन्हें एक बिखरी हुई डेस्क, एक खराब प्रिंटर और एक भ्रमित क्लाइंट देंगे, और देखेंगे कि क्या वे वास्तव में काम पूरा कर सकते हैं।

यही वह चीज़ है जो यह पेपर, OCCUBENCH, आर्टिफिशियल इंटेलिजेंस के लिए कर रहा है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:

1. समस्या: "वीडियो गेम" का जाल

अभी, हम AI एजेंटों (स्मार्ट कंप्यूटर प्रोग्राम जो टूल्स का उपयोग कर सकते हैं) का परीक्षण मुख्य रूप से "वीडियो गेम" वातावरण में करते हैं।

  • वर्तमान परीक्षण: क्या AI वेबसाइट ब्राउज़ कर सकता है? क्या वह कोड लिख सकता है? क्या वह ऑनलाइन पिज्जा ऑर्डर कर सकता है?
  • वास्तविकता: ये इसलिए आसान हैं क्योंकि "दुनिया" साफ और अनुमानित है।
  • गायब कड़ी: हमें यह नहीं पता कि क्या एक AI वास्तव में मरीजों की जांच करने वाले नर्स, आयात की जांच करने वाले सीमा शुल्क अधिकारी (customs officer), या परमाणु रिएक्टर की निगरानी करने वाले सुरक्षा इंजीनियर के रूप में काम कर सकता है। क्यों? क्योंकि आप परीक्षण करने के लिए कंप्यूटर लैब में वास्तविक परमाणु रिएक्टर नहीं बना सकते, और आप एक AI को वास्तविक अस्पताल में गड़बड़ी करने की अनुमति नहीं दे सकते।

उपमा: यह एक पायलट को केवल एक फ्लाइट सिम्युलेटर पर परीक्षण करने जैसा है जहाँ मौसम एकदम साफ है और कोई यात्री नहीं है। हमें नहीं पता कि वे एक रोते हुए बच्चे के साथ असली तूफान को कैसे संभालेंगे।

2. समाधान: "लैंग्वेज वर्ल्ड मॉडल" (LWM)

लेखकों ने बिना किसी वास्तविक हार्डवेयर के इन AI का परीक्षण करने का एक नया तरीका आविष्कार किया है। वे इसे लैंग्वेज वर्ल्ड मॉडल कहते हैं।

  • यह कैसे काम करता है: एक नकली वेबसाइट या नकली डेटाबेस बनाने के बजाय, वे एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करते हैं जो वातावरण होने का दिखावा करता है।
  • रूपक (Metaphor): एक रोल-प्लेइंग गेम (RPG) के डंजन मास्टर (Dungeon Master) की कल्पना करें।
    • एक सामान्य खेल में, कंप्यूटर के नियम हार्ड-कोडेड होते हैं।
    • इस नए सिस्टम में, "डंजन मास्टर" एक AI है जो अस्पताल, कारखाने या बैंक के नियमों को जानता है। जब टेस्ट-AI पूछता है, "मरीज का तापमान क्या है?" तो डंजन मास्टर AI अपने आंतरिक तर्क की जांच करता है और कहता है, "तापमान 102°F है।"
    • यह उन्हें बिना किसी भौतिक मशीनरी के तुरंत 100 अलग-अलग नौकरियों (खेती से लेकर वित्त तक) को सिम्युलेट करने की अनुमति देता है।

3. परीक्षण: "स्ट्रेस टेस्ट"

पेपर ने केवल यह नहीं पूछा, "क्या AI काम कर सकता है?" उन्होंने यह पूछा, "क्या AI काम कर सकता है जब चीजें गलत हो जाती हैं?"

उन्होंने इन "बुरे दिनों" के तीन प्रकार पेश किए:

  1. "चिल्लाने वाली" त्रुटि (Explicit Fault): कंप्यूटर कहता है "ERROR 500" या "TIMEOUT"। यह स्पष्ट है कि कुछ टूटा हुआ है। AI को बस "रीट्राई" (पुनः प्रयास) करने की आवश्यकता है।
  2. "शांत" त्रुटि (Implicit Fault): यह डरावना वाला है। कंप्यूटर एक उत्तर देता है, लेकिन इसमें आधा डेटा गायब होता है। यह सामान्य दिखता है, लेकिन यह अधूरा है।
    • उपमा: आप वेटर से मेनू मांगते हैं, और वह आपको कागज का एक टुकड़ा देता है जिसमें केवल पहले दो आइटम सूचीबद्ध हैं। वह यह नहीं कहता कि "मैंने बाकी खो दिया है।" वह बस इसे आपको थमा देता है। एक स्मार्ट वेटर पूछेगा, "क्या यह पूरा मेनू है?" एक मूर्ख वेटर केवल उन दो आइटम्स के आधार पर ऑर्डर कर देगा।
  3. "मिश्रित" थैला (Mixed Bag): दोनों का संयोजन।

निष्कर्ष: AI "चिल्लाने वाली" त्रुटियों को संभालने में बहुत अच्छा था। लेकिन वे "शांत" त्रुटियों पर बुरी तरह विफल रहे क्योंकि उन्हें एहसास ही नहीं हुआ कि डेटा टूटा हुआ था। उन्होंने बस गलत जानकारी को स्वीकार कर लिया और गलतियाँ कीं।

4. परिणाम: कोई "सुपरहीरो" मौजूद नहीं है

उन्होंने दुनिया के 15 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • विशेषज्ञता महत्वपूर्ण है: कोई एक एकल "सर्वश्रेष्ठ" AI नहीं है।

    • उपमा: यह एक स्पोर्ट्स टीम की तरह है। एक खिलाड़ी बास्केटबॉल (शिक्षा/विज्ञान) में अद्भुत है लेकिन सॉकर (स्वास्थ्य सेवा) में बहुत बुरा है। दूसरा एक महान सॉकर खिलाड़ी है लेकिन बास्केटबॉल नहीं खेल सकता।
    • GPT-5.2 विज्ञान में अच्छा था लेकिन कॉमर्स में संघर्ष कर रहा था।
    • Claude Opus ट्रांसपोर्टेशन में अच्छा था लेकिन कॉमर्स में बुरा था।
    • Qwen हेल्थकेयर और एग्रीकल्चर में एक स्टार था।
    • सबक: आप केवल "सबसे स्मार्ट" AI नहीं चुन सकते; आपको वही चुनना होगा जो आपके विशिष्ट काम में अच्छा हो।
  • बड़ा बेहतर होता है (आमतौर पर): बड़े मॉडल और वे मॉडल जो जवाब देने से पहले लंबे समय तक "सोचते" हैं, वे बेहतर प्रदर्शन करते हैं।

    • उपमा: एक छात्र को अधिक समय तक अध्ययन करने और एक बड़ा दिमाग देने से आमतौर पर बेहतर टेस्ट स्कोर मिलते हैं।
  • "अभिनेता" बनाम "निर्देशक" की समस्या:

    • पेपर ने पाया कि जो AI काम करने में सबसे अच्छा है, वह जरूरी नहीं कि दूसरों के लिए काम को सिम्युलेट करने में भी सबसे अच्छा हो।
    • उपमा: दुनिया का सबसे अच्छा अभिनेता एक नाटक को निर्देशित करने में बहुत बुरा हो सकता है। यदि आप अभिनेताओं को जज करने के लिए एक खराब निर्देशक (सिम्युलेटर) का उपयोग करते हैं, तो आप गलत परिणाम प्राप्त कर सकते हैं। लेखकों को यह सुनिश्चित करने के लिए अपने "डंजन मास्टर" को पर्याप्त स्मार्ट बनाना पड़ा कि वह निष्पक्ष हो।

5. यह क्यों मायने रखता है

यह पेपर एक वेक-अप कॉल है। हम AI का परीक्षण "क्लीन रूम" (परफेक्ट वातावरण) में करते रहे हैं। यह नया बेंचमार्क, OCCUBENCH, AI को कीचड़, बारिश और वास्तविक दुनिया की अराजकता में झोंक देता है।

यह हमें बताता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी यह पेशेवर काम की अस्त-व्यस्त, अधूरी और भ्रमित करने वाली वास्तविकता को संभालने में संघर्ष करता है। यदि हम चाहते हैं कि AI वास्तव में अस्पतालों, बैंकों और कारखानों में हमारी मदद करे, तो हमें इसे वीडियो गेम पर टेस्ट करना बंद करना होगा और इन "लैंग्वेज वर्ल्ड मॉडल्स" पर टेस्ट करना शुरू करना होगा जो वास्तविक दुनिया की अराजकता को सिम्युलेट करते हैं।

संक्षेप में: हमारे पास अंततः एक तरीका है जिससे हम देख सकते हैं कि क्या एक AI वास्तव में एक वास्तविक नौकरी संभाल सकता है, न कि केवल एक होमवर्क असाइनमेंट। और परिणाम बताते हैं कि हमारे सबसे महत्वपूर्ण कार्यों के लिए उन पर भरोसा करने से पहले हमें अभी भी एक लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →