ENTLORE: A Graph-Grounded Benchmark for Latent Organizational Reasoning in Enterprise Question Answering
यह शोध पत्र ENTLORE को प्रस्तुत करता है, जो एक ग्राफ-आधारित बेंचमार्क है जो एंटरप्राइज प्रश्न उत्तर प्रणालियों (enterprise question answering systems) की उनके गुप्त संगठनात्मक तर्क (latent organizational reasoning) करने की क्षमता का मूल्यांकन करता है, जिसमें साधारण तथ्य पुनर्प्राप्ति (fact retrieval) से परे अंतर्निहित संबंधों की रिकवरी का परीक्षण करने के लिए नियमित दस्तावेजों से ऑडिट किए गए एंटरप्राइज जगतों का पुनर्निर्माण किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक विशाल, अराजक पुस्तकालय के भीतर एक रहस्य को सुलझाने की कोशिश कर रहे हैं। यह केवल एक साधारण पुस्तकालय नहीं है; यह एक विशाल कंपनी का "मस्तिष्क" है, जो लाखों दस्तावेजों जैसे कि ईमेल, प्रोजेक्ट रिपोर्ट, मीटिंग नोट्स और स्प्रेडशीट से भरा हुआ है। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, "क्वेश्चन अनस्वर्सिंग" (प्रश्न उत्तर देना) नामक एक लोकप्रिय खेल है। आमतौर पर, AI को एक प्रश्न और दस्तावेजों का एक ढेर दिया जाता है, और उसका काम उस सटीक वाक्य को खोजना होता है जिसमें उत्तर छिपा हो। इसे "आई स्पाई" (I Spy) के खेल की तरह समझें जहाँ उत्तर सामने ही छिपा होता है, बस उसे ढूँढने की प्रतीक्षा कर रहा होता है।
लेकिन वास्तविक जीवन किसी कंपनी में काम एक खेल की तरह सरल नहीं होता। अक्सर, प्रश्न का उत्तर किसी एक वाक्य में नहीं लिखा होता। इसके बजाय, सत्य विभिन्न दस्तावेजों के बीच के संबंधों में छिपा होता है। हो सकता है कि एक ईमेल कहे "एलिस ने मॉड्यूल X पर काम किया," और दूसरी रिपोर्ट कहे "मॉड्यूल X, प्रोजेक्ट Y का हिस्सा है," लेकिन किसी भी एक दस्तावेज में कभी यह नहीं लिखा होता कि "एलिस ने प्रोजेक्ट Y पर काम किया।" उत्तर खोजने के लिए, AI को खुद ही बिंदुओं को जोड़ना होगा, कंपनी के संगठन के अदृश्य नियमों का उपयोग करते हुए। यह शोध पत्र, जिसे ScitiX.ai के शोधकर्ताओं द्वारा लिखा गया है, कंप्यूटर को केवल शब्दों को खोजने में कुशल होने के बजाय, इस तरह का जासूसी कार्य करने के लिए सिखाने के बारे में है।
समस्या: "छिपा हुआ सत्य" का जाल
अधिकांश AI बेंचमार्क (AI के परीक्षण) एक खजाने की खोज की तरह हैं जहाँ मानचित्र पहले से ही बना होता है। टेस्ट बनाने वाले एक प्रश्न लिखते हैं, और फिर वे यह सुनिश्चित करते हैं कि उत्तर उन दस्तावेजों में स्पष्ट रूप से लिखा हो जो वे AI को देते हैं। यह "लाल गेंद क्या रंग की है?" पूछने और AI को लाल गेंद की तस्वीर देने जैसा है। AI को बस "लाल" शब्द ढूँढना होता है।
इस शोध पत्र के लेखक तर्क देते हैं कि यह बहुत आसान है और यह वास्तविक कंपनियों के काम करने के तरीके को नहीं दर्शाता है। वास्तविक दुनिया में, "लाल गेंद" का उल्लेख एक फाइल में हो सकता है, और यह तथ्य कि वह एक "गेंद" है, दूसरे में हो सकता है, लेकिन उनके बीच का संबंध कभी स्पष्ट रूप से नहीं बताया जाता। AI को यह समझना होगा कि "मॉड्यूल X" कैसे "प्रोजेक्ट Y" का हिस्सा है, भले ही कोई भी दस्तावेज उन्हें स्पष्ट रूप से न जोड़ता हो। शोधकर्ता इस लुप्त कौशल को लेटेंट ऑर्गनाइजेशनल रीजनिंग (Latent Organizational Reasoning) कहते हैं। यह एक संगठन के अदृश्य नियमों को दैनिक कार्यों के अव्यवस्थित परिणामों से समझने की क्षमता है।
समाधान: ENTLORE, "ट्रुथ ग्राफ"
यह परीक्षण करने के लिए कि क्या AI वास्तव में यह कर सकता है, टीम ने ENTLORE नामक एक नया बेंचमार्क बनाया। कल्पना कीजिए कि उन्होंने एक वास्तविक, निजी कंपनी के पूरे डिजिटल इतिहास को लिया—हजारों दस्तावेज, संगठनात्मक चार्ट और परिचालन लॉग—और पर्दे के पीछे एक विशाल, गुप्त "ट्रुथ ग्राफ" (Truth Graph) बनाया। यह ग्राफ एक मास्टर ब्लूप्रिंट की तरह है जो जानता है कि हर व्यक्ति, प्रोजेक्ट और मॉड्यूल कैसे जुड़ता है, जो सख्त, ऑडिट किए गए नियमों पर आधारित है।
फिर, उन्होंने AI के खेलने के लिए एक "रिलीज़्ड वर्ल्ड" (Released World) बनाया। इस रिलीज़्ड वर्ल्ड में वही दस्तावेज हैं, लेकिन गोपनीयता बनाए रखने के लिए सभी नाम बदल दिए गए हैं (जैसे "एलिस" को "कर्मचारी #42" में और "प्रोजेक्ट अल्फा" को "प्रोजेक्ट बीटा" में बदलना)। महत्वपूर्ण बात यह है कि AI उस गुप्त "ट्रुथ ग्राफ" को नहीं देख सकता। वह केवल अस्त-व्यस्त, गुमनाम दस्तावेजों को देखता है।
टीम ने 907 प्रश्न पूछे। उन्होंने इन प्रश्नों को कठिनाई के तीन स्तरों में विभाजित किया:
- स्तर 1 (द लुकअप): उत्तर एक ही दस्तावेज में मौजूद है। (जैसे, "प्रोजेक्ट बीटा का प्रबंधक कौन है?")
- स्तर 2 (द कंपोजिशन): उत्तर के लिए दो दस्तावेजों को पढ़ने और तथ्यों को मिलाने की आवश्यकता है। (जैसे, "उस टीम का प्रबंधन कौन करता है जिसने मॉड्यूल X बनाया?")
- स्तर 3 (द लेटेंट रीजनिंग): उत्तर के लिए उन बिंदुओं को जोड़ने की आवश्यकता है जो स्पष्ट रूप से जुड़े नहीं हैं। (जैसे, "प्रोजेक्ट बीटा की समग्र सफलता के लिए कौन जिम्मेदार है?"—भले ही कोई दस्तावेज यह नहीं कहता कि "कर्मचारी #42 प्रोजेक्ट बीटा के लिए जिम्मेदार है," ट्रुथ ग्राफ यह जानता है क्योंकि उन्होंने इसके भीतर के मॉड्यूल का प्रबंधन किया था।)
निष्कर्ष: AI पढ़ने में अच्छा है, जोड़ने में बुरा
शोधकर्ताओं ने विभिन्न तरीकों का उपयोग करके 8 अलग-अलग AI मॉडल का परीक्षण किया, जिसमें साधारण कीवर्ड सर्च से लेकर जटिल "एजेंट" सिस्टम तक शामिल हैं जो मनुष्यों की तरह दस्तावेजों को ब्राउज़ कर सकते हैं। यहाँ उन्हें क्या मिला:
1. "छिपा हुआ सत्य" ढूंढना कठिन है
जब उत्तर दस्तावेजों में स्पष्ट रूप से लिखा था (स्तर 1 और 2), तो AI मॉडल ने काफी अच्छा प्रदर्शन किया। लेकिन जब वे स्तर 3 (लेटेंट रीजनिंग) पर पहुँचे, तो उनका प्रदर्शन नाटकीय रूप से गिर गया। सर्वश्रेष्ठ मॉडल भी इन कठिन प्रश्नों का केवल 36.2% ही सही हल कर पाए।
2. गति से अधिक संरचना मायने रखती है
शोधकर्ताओं ने AI को जानकारी खोजने में मदद करने के विभिन्न तरीकों का परीक्षण किया।
- सिंपल सर्च (BM25): केवल मिलते-जुलते शब्दों को खोजना। यह आश्चर्यजनक रूप से अच्छा था।
- डेंस सर्च (फ्लैट RAG): समान विचारों को खोजने के लिए उन्नत गणित का उपयोग करना। इसने साधारण खोज की तुलना में बदतर प्रदर्शन किया।
- ग्राफ-आधारित सिस्टम (GraphRAG): ये सिस्टम उत्तर देने से पहले दस्तावेजों के बीच संबंधों का एक नक्शा बनाने की कोशिश करते हैं। यह औसत रूप से दूसरों से बेहतर रहा और सबसे मजबूत दृष्टिकोण साबित हुआ। यह सुझाव देता है कि AI को शब्दों के बजाय कंपनी की संरचना को समझने की आवश्यकता है।
3. "गोल्ड डॉक्यूमेंट्स" के साथ भी, AI विफल रहता है
सबसे चौंकाने वाली खोज तब हुई जब शोधकर्ताओं ने AI को "गोल्ड डॉक्यूमेंट्स" दिए—यानी वे सटीक फाइलें जिनकी आवश्यकता प्रश्न का उत्तर देने के लिए थी, जिससे खोज वाला हिस्सा पूरी तरह समाप्त हो गया।
- आसान प्रश्नों (स्तर 1) के लिए, AI ने लगभग सब कुछ सही किया।
- मध्यम प्रश्नों (स्तर 2) के लिए, इसने अभी भी अच्छा प्रदर्शन किया।
- लेकिन कठिन, लेटेंट प्रश्नों (स्तर 3) के लिए, 30.4% उत्तर अभी भी गलत थे, भले ही AI के सामने बिल्कुल सही दस्तावेज मौजूद थे!
इसका मतलब है कि समस्या केवल यह नहीं है कि AI सही फाइल को ढूँढ नहीं पा रहा है; बल्कि समस्या यह है कि उसके पास सभी सबूत होने के बावजूद वह अदृश्य संगठनात्मक नियमों के माध्यम से तर्क नहीं कर पा रहा है। यह एक जासूस को अपराध स्थल की तस्वीरें देने जैसा है, फिर भी वह यह समझने में विफल रहता है कि बटलर और माली वास्तव में एक ही व्यक्ति हैं क्योंकि तस्वीरों में स्पष्ट रूप से ऐसा नहीं लिखा है।
यह क्यों महत्वपूर्ण है
शोध पत्र निष्कर्ष निकालता है कि हम केवल कंपनियों के लिए बेहतर सर्च इंजन नहीं बना सकते। हमें ऐसे AI की आवश्यकता है जो एक संगठन की "आत्मा" को समझ सके—अनकहे नियम, प्रोजेक्ट पदानुक्रम और छिपे हुए संबंध। ENTLORE सिद्ध करता है कि वर्तमान AI अभी भी इसके साथ संघर्ष कर रहा है। यह लिखे हुए को पढ़ने में बहुत अच्छा है, लेकिन यह अभी भी इस बारे में सीख रहा है कि जो निहित है, उसके बारे में कैसे सोचा जाए।
शोधकर्ताओं ने अपना डेटा और कोड सार्वजनिक कर दिया है ताकि अन्य वैज्ञानिक इस पहेली को हल करने की कोशिश कर सकें। जब तक AI इस "लेटेंट ऑर्गनाइजेशनल रीजनिंग" में महारत हासिल नहीं कर लेता, तब तक यह हमेशा एक नए कर्मचारी की तरह रहेगा जो हैंडबुक तो पढ़ सकता है लेकिन अभी तक यह नहीं समझ पाता कि कंपनी वास्तव में कैसे काम करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।