WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
यह शोधपत्र WorkSurface-Bench प्रस्तुत करता है, जो 1,151 ऑडिट करने योग्य कार्यों वाला एक नया बेंचमार्क है जिसे विषम ज्ञान सतहों (दस्तावेजों, तालिकाओं और ग्राफों) में प्रश्नों को रूट करने की एंटरप्राइज एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे यह पता चलता है कि हालांकि एजेंट उच्च रूटिंग सटीकता प्राप्त कर सकते हैं, लेकिन केवल सही सतह का चयन उच्च कार्य पूर्णता दरों के लिए पर्याप्त नहीं है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त कार्यालय चलाने में मदद के लिए एक बहुत ही बुद्धिमान रोबोट सहायक को काम पर रख रहे हैं। आप उससे एक जटिल प्रश्न पूछते हैं, जैसे, "पिछले महीने हमने शिपिंग पर कितना खर्च किया था, और कौन सी फाइलें देरी का कारण बन रही हैं?" इस उत्तर को देने के लिए, रोबोट केवल अनुमान नहीं लगा सकता; उसे जानकारी ढूँढनी होगी। लेकिन यहाँ एक पेच है, कार्यालय में तीन बहुत अलग प्रकार की सूचना वाली अलमारियाँ हैं। एक लाइब्रेरी (Library) है जो लिखित रिपोर्ट और PDF (दस्तावेजों) से भरी है, एक स्प्रेडशीट रूम (Spreadsheet Room) है जिसमें संख्याओं और गणनाओं की पंक्तियाँ और कॉलम भरे हुए हैं (तालिकाएं), और एक मैप रूम (Map Room) है जो यह दिखाता है कि प्रत्येक फ़ाइल दूसरी फ़ाइल से कैसे जुड़ी है (ग्राफ)।
लंबे समय तक, रोबोटों का परीक्षण करने वाले वैज्ञानिकों ने ज्यादातर यह पूछा, "क्या आपको सही उत्तर मिला?" यदि रोबोट ने गलत कमरे में देखा, गलत किताब चुनी, या गणित गलत किया, तो परीक्षण केवल यह कहता था: "फेल (असफल)"। लेकिन यह हमें यह नहीं बताता था कि क्यों वह असफल हुआ। क्या रोबोट को यह नहीं पता था कि उसे मैप रूम में जाने की आवश्यकता है? या क्या वह मैप रूम में गया, सही मैप ढूँढा, लेकिन उसे पढ़ते समय भ्रमित हो गया? यह शोध पत्र उस कमी को भरने के लिए आया है। यह रोबोटों का परीक्षण करने का एक नया तरीका पेश करता है जो सही कमरा चुनने के कार्य को कमरे के अंदर पहेली सुलझाने के कार्य से अलग करता है। यह पूछता है: क्या रोबट वास्तव में खोजने से पहले ही यह पता लगा सकता है कि उसे किस प्रकार के ज्ञान की आवश्यकता है?
नया खेल: वर्कसरफेस-बेंच (WorkSurface-Bench)
शोधकर्ताओं ने वर्कसरफेस-बेंच नामक एक नया परीक्षण मैदान बनाया। इसे एक विशाल, वास्तविक कार्यालय सिमुलेशन के रूप में सोचें जिसमें 1,151 अलग-अलग कार्य हैं। उन्होंने पांच अलग-अलग "पर्सोना" (जैसे कि एक लॉजिस्टिक्स मैनेजर या एक वित्तीय विश्लेषक) स्थापित किए और उन्हें तीन अलग-अलग सतहों तक पहुँच दी: एक दस्तावेज़ लाइब्रेरी, एक टेबल डेटाबेस, और एक फ़ाइल-संबंध ग्राफ।
यहाँ मुख्य नवाचार यह है कि वे रोबोटों को कैसे ग्रेड देते हैं। केवल अंतिम उत्तर पर पास या फेल देने के बजाय, वे दो अलग-अलग चीजों को स्कोर करते हैं:
- रूट (Route): क्या रोबोट ने सही "सतह" (लाइब्रेरी, स्प्रेडशीट, या मैप) चुनी?
- उत्तर (Answer): क्या उसने उन्हें चुनने के बाद वास्तव में समस्या को सही ढंग से हल किया?
उन्होंने हर उत्तर के लिए एक "गोल्ड स्टैंडर्ड" (स्वर्ण मानक) बनाया। यदि किसी कार्य के लिए गणितीय गणना की आवश्यकता थी, तो उन्होंने सही उत्तर प्राप्त करने के लिए वास्तविक कोड चलाया। यदि इसमें दस्तावेज़ पढ़ने की आवश्यकता थी, तो उन्होंने स्रोत में सटीक शब्दों की जाँच की। यदि इसमें फ़ाइल कनेक्शन की आवश्यकता थी, तो उन्होंने वास्तविक पथ का पता लगाया। इसका मतलब है कि "सही" उत्तर किसी अन्य AI का अनुमान नहीं है; यह एक सत्यापित तथ्य है।
बड़ी हैरानी: कहाँ देखना है, यह जानना पर्याप्त नहीं है
टीम ने छह अलग-अलग परिदृश्यों में चार सबसे स्मार्ट उपलब्ध AI मॉडल का परीक्षण किया (जिसमें GPT-4o-mini, DeepSeek-V4-Pro, Gemini-3.1-Pro, और GPT-5.5 शामिल हैं)। वे यह देखना चाहते थे कि क्या रोबोट को ठीक-ठीक बताने से कि उसे किस कमरे में जाना है, उसका काम आसान बनाने से उसकी गलतियाँ सुधरती हैं या नहीं।
यहाँ उन्हें जो मिला, वह थोड़ा चौंकाने वाला है: यह जानना कि कहाँ देखना है, यह गारंटी नहीं देता कि आप उत्तर ढूँढ लेंगे।
जब शोधकर्ताओं ने रोबोटों को केवल सही सतहों का उपयोग करने के लिए मजबूर किया (एक "गोल्ड-कंस्ट्रेंड" सेटिंग), तो रोबोट सही सतह चुनने में लगभग उत्तम हो गए। उनका "रूट" स्कोर बढ़कर 98.7% से 99.8% के बीच हो गया। वे जानते थे कि कहाँ जाना है।
हालाँकि, उनका "उत्तर" स्कोर—वास्तविक समाधान की शुद्धता—केवल 56.1% से 75.3% के बीच पहुँचा।
इसका अर्थ यह है कि भले ही रोबोट सही कमरे में खड़ा था और उसके हाथ में सही मैप था, फिर भी वह एक चौथाई से अधिक बार गलत उत्तर दे रहा था। हो सकता है कि उसने सही फ़ाइल ढूँढ ली हो लेकिन संख्याओं को गलत पढ़ लिया हो, या उसने स्प्रेडशीट और दस्तावेज़ से जानकारी को गलत तरीके से जोड़ा हो। यह शोध पत्र दिखाता है कि "सही उपकरण चुनना" और "उपकरण का सही उपयोग करना" दो पूरी तरह से अलग कौशल हैं, और एक में अच्छा होने का मतलब यह नहीं है कि आप दूसरे में भी अच्छे होंगे।
संकेत बनाम प्रतिबंध
शोधकर्ताओं ने "संकेत देने" बनाम "विकर्षण हटाने" का एक मजेदार खेल भी खेला।
- संकेत (The Hint): उन्होंने रोबतों को बताया, "आपको स्प्रेडशीट और मैप देखने की आवश्यकता है।" इसने रोबोटों को सही सतहों को बेहतर ढंग से चुनने में मदद की, और कुछ मॉडलों के लिए, इसने उनके अंतिम उत्तरों में भी थोड़ा सुधार किया।
- प्रतिबंध (The Restriction): इसके बाद उन्होंने उन सभी उपकरणों को हटा दिया जिनकी रोबोटों को आवश्यकता नहीं थी। इससे रोबोट बहुत तेज़ और अधिक कुशल हो गए, और उन्होंने सही सतहों को और भी बेहतर तरीके से चुना। लेकिन, आश्चर्यजनक रूप से, इससे अंतिम उत्तर हमेशा बेहतर नहीं हुआ। वास्तव में, कुछ मॉडलों के लिए, अतिरिक्त उपकरणों को हटाने से वे वास्तव में थोड़े खराब हो गए, संभवतः इसलिए क्योंकि उन्होंने किसी अन्य उपकरण के साथ अपने काम को दोबारा जांचने (double-check) की क्षमता खो दी थी।
भविष्य के लिए इसका क्या अर्थ है
शोध पत्र निष्कर्ष निकालता है कि हम अब केवल AI एजेंट के अंतिम स्कोर को नहीं देख सकते। यदि कोई AI किसी प्रश्न का गलत उत्तर देता है, तो हमें यह जानने की आवश्यकता है कि वह इसलिए विफल हुआ क्योंकि उसे यह नहीं पता था कि क्या खोजना है, या इसलिए कि उसने सही स्थान पर जाकर भी वहां मिली जानकारी को प्रोसेस (संसाधित) करने में गलती की।
शोधकर्ताओं ने रोबोटों के 27,624 अलग-अलग प्रयासों में इसे मापा, और वे इन नंबरों के बारे में बहुत आश्वस्त हैं क्योंकि उन्होंने मानव परीक्षकों और सख्त नियमों के साथ परिणामों का ऑडिट किया है। उन्होंने पाया कि जबकि सर्वश्रेष्ठ रोबोट रूटिंग (98%+) में बहुत अच्छे हो रहे हैं, वे अभी भी टुकड़ों को सही ढंग से जोड़ने (लगभग 56-75%) के अंतिम चरण में संघर्ष कर रहे हैं।
संक्षेप में, स्मार्ट ऑफिस रोबोटों का भविष्य केवल उन्हें कार्यालय के बेहतर नक्शे देने के बारे में नहीं है; बल्कि यह उन्हें वहां पहुँचने के बाद संकेतों को पढ़ना और गणित करना सिखाने के बारे में है। यह शोध पत्र एक नया, विस्तृत स्कोरबोर्ड प्रदान करता है ताकि डेवलपर्स यह ट्रैक कर सकें कि उनके रोबोट वास्तव में कहाँ लड़खड़ा रहे हैं, ताकि वे पूरे सिस्टम के बेहतर होने की उम्मीद करने के बजाय, सीधे उस विशिष्ट हिस्से को ठीक कर सकें जो काम नहीं कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।