World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems
यह शोध पत्र "वर्ल्ड ऑफ वर्कफ्लोज़" (WoW) को पेश करता है, जो एक वास्तविक ServiceNow वातावरण पर आधारित एक नया बेंचमार्क है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि क्या अत्याधुनिक LLMs छिपे हुए वर्कफ्लो और उनके कार्यों के क्रमिक दुष्प्रभावों की भविष्यवाणी करके जटिल एंटरप्राइज सिस्टम्स में नेविगेट कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप SimCity या The Sims का एक हाई-स्टेक्स गेम खेल रहे हैं, लेकिन एक ट्विस्ट के साथ: हर बार जब आप घर बनाने या काम सौंपने के लिए कोई बटन दबाते हैं, तो बैकग्राउंड में दर्जनों अदृश्य "भूतिया नियम" (ghost rules) सक्रिय हो जाते हैं।
आप एक निर्माण स्थल पर एक कर्मचारी को नियुक्त कर सकते हैं, लेकिन एक छिपे हुए नियम के कारण, उस कर्मचारी का वेतन अचानक गिर जाता है, जो एक और नियम को ट्रिगर करता है जिससे वह नौकरी छोड़ देता है, जिसके कारण निर्माण स्थल में आग लग जाती है। आपको यह एक रैंडम आपदा की तरह दिखता है। लेकिन सिस्टम के लिए, यह एक पूरी तरह से तार्किक चेन रिएक्शन था।
यह शोध पत्र, "World of Workflows," तर्क देता है कि आज के सबसे उन्नत AI (जैसे GPT-4 या Claude) इस गेम को खेलने में बहुत खराब हैं। वे सरल निर्देशों का पालन करने में माहिर हैं, लेकिन वे उन अदृश्य लहरों के प्रति "अंधे" हैं जो उनके कार्यों से बड़ी कंपनियों जैसे जटिल सिस्टम में पैदा होती हैं।
यहाँ रोजमर्रा के उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:
1. समस्या: "आंखों पर पट्टी बंधा हुआ शेफ"
कल्पना कीजिए कि आपने एक व्यस्त रेस्टोरेंट चलाने के लिए एक विश्व स्तरीय शेफ (AI) को काम पर रखा है। आप उन्हें कहते हैं, "एक स्टेक बनाओ।" वे इसे पूरी तरह से करते हैं। हालाँकि, आपने उन्हें यह नहीं बताया कि रेस्टोरेंट का एक छिपा हुआ नियम है: "यदि आप ग्रिल का उपयोग करते हैं, तो वेंटिलेशन सिस्टम स्वचालित रूप से डाइनिंग रूम की लाइटें बंद कर देता है।"
शेफ स्टेक बनाता है, लेकिन अचानक ग्राहक अंधेरे में बैठे होते हैं, क्रोधित और भ्रमित। शेफ को लगता है कि वे सफल रहे क्योंकि स्टेक बन गया है, लेकिन वास्तव में वे "मिशन" में विफल रहे क्योंकि वे यह नहीं समझ पाए कि किचन के सिस्टम कैसे एक-दूसरे से जुड़े हैं।
वर्तमान AI एजेंट इसी शेफ की तरह हैं। वे टूल्स (जैसे "Order Steak") का उपयोग कर सकते हैं, लेकिन वे "World Model" को नहीं समझते—जो वास्तविक व्यवसाय को नियंत्रित करने वाला कारण-और-प्रभाव (cause-and-effect) का अदृश्य जाल है।
2. समाधान: "WoW" (अल्टीमेट सिम्युलेटर)
शोधकर्ताओं ने एक प्लेग्राउंड बनाया जिसे WoW (World of Workflows) कहा गया। एक साधारण चैट बॉक्स के बजाय, उन्होंने एक वास्तविक कंपनी का एक विशाल, डिजिटल संस्करण बनाया (ServiceNow नामक सिस्टम का उपयोग करके)।
यह एक डिजिटल दुनिया है जो इनसे भरी है:
- 4,000+ बिजनेस रूल्स: छोटे "अगर-यह-तो-वह" वाले निर्देश।
- 55 एक्टिव वर्कफ्लो: जटिल, बहु-चरणीय प्रक्रियाएं जो पर्दे के पीछे चलती हैं।
इसके बाद उन्होंने एक टेस्ट बनाया जिसे WoW-bench कहा गया, यह देखने के लिए कि क्या AI इन "भूतिया नियमों" को संभाल सकता है। उन्होंने AI का चार चीजों पर परीक्षण किया:
- क्या आप काम पूरा कर सकते हैं? (शेफ द्वारा स्टेक बनाना)।
- क्या आप ध्यान देते हैं कि आपने कोई नियम तोड़ दिया है? (शेफ द्वारा यह नोटिस करना कि लाइटें बंद हो गई हैं)।
- क्या आप भविष्य की भविष्यवाणी कर सकते हैं? (शेफ का यह कहना, "यदि मैं इस ग्रिल को चालू करता हूँ, तो लाइटें बंद हो जाएंगी" )।
- क्या आप पता लगा सकते हैं कि क्या हुआ? (शेफ का अंधेरे कमरे को देखकर यह समझना, "आह, यह वेंटिलेशन नियम के कारण हुआ होगा!")।
3. निष्कर्ष: "AI एक लालची योजनाकार (Greedy Planner) है"
परिणाम एक चेतावनी की तरह थे। शोधकर्ताओं ने पाया कि AI इंटेलिजेंस में तीन प्रमुख "अंतराल" (gaps) हैं:
- रिप्रेजेंटेशन गैप (नाम बनाम व्यक्ति): यदि आप AI को "John Smith को खोजें" कहते हैं, तो वह केवल "John Smith" टेक्स्ट को खोजता है। लेकिन एक वास्तविक कंपनी में, दस John Smith हो सकते हैं, जिनमें से प्रत्येक की एक अलग ID संख्या होती है। AI नामों को एक किताब के शब्दों की तरह मानता है, न कि डेटाबेस में मौजूद वास्तविक, अद्वितीय व्यक्तियों की तरह।
- डायनामिक्स गैप (लुप्त होती लहर): AI साइड इफेक्ट्स के प्रति "अंधा" है। वह एक एक्शन करता है और "Success!" मैसेज देखता है, लेकिन उसे यह एहसास नहीं होता कि उस एक्शन ने बैकग्राउंड में दस अन्य चीजों को बदल देने वाली एक चेन रिएक्शन को ट्रिगर कर दिया है।
- कॉज़ल गैप (दूरदर्शिता की कमी): AI एक "लालची योजनाकार" (greedy planner) है। वह केवल अगले कदम की परवाह करता है। वह यह नहीं सोचता कि, "यदि मैं अभी स्टेप A करता हूँ, तो यह दस मिनट बाद स्टेप Z को असंभव बना देगा।"
4. बड़ी तस्वीर: यह क्यों मायने रखता है?
यदि हम चाहते हैं कि AI वास्तव में हमारे बैंकों, अस्पतालों या सप्लाई चेन को चलाए, तो हम उन्हें केवल बेहतर "इंस्ट्रक्शन मैनुअल" देकर काम नहीं चला सकते।
पेपर इस निष्कर्ष पर पहुँचता है कि हमें ऐसे AI से दूर जाने की जरूरत है जो केवल जो देखते हैं उस पर प्रतिक्रिया (react) देते हैं, और ऐसे AI की ओर बढ़ने की जरूरत है जो अपने दिमाग में दुनिया का सिमुलेशन (simulate) कर सकें। हमें "Dynamics-Aware" AI की आवश्यकता है—ऐसे एजेंट जो केवल आदेशों का पालन नहीं करते, बल्कि वास्तव में उस बिजनेस वर्ल्ड के "फिजिक्स" को समझते हैं जिसमें वे काम कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।