← नवीनतम पेपर
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

यह शोध पत्र DataSpace प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और KDD कप 2026 मूल्यांकन ढांचा है जिसे विषम, बहु-मोडल वर्कस्पेस से सत्यापन योग्य सारणीबद्ध परिणाम उत्पन्न करने की डेटा एजेंटों की क्षमता का आकलन करने के लिए डिज़ाइन किया गया है, जो मल्टीमोडल साक्ष्य एकीकरण में महत्वपूर्ण प्रदर्शन अंतराल और विश्वसनीयता पर एजेंट हार्नेस विकल्पों के पर्याप्त प्रभाव को प्रकट करता है।

मूल लेखक: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

प्रकाशित 2026-08-05
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन आपके सुराग हर जगह बिखरे हुए हैं। कुछ सुराग आपके कंप्यूटर पर एक व्यवस्थित स्प्रेडशीट में हैं, कुछ 50 पन्नों की एक पीडीएफ रिपोर्ट में दबे हुए हैं, कुछ एक डेटाबेस के अंदर छिपे हुए हैं, और सबसे महत्वपूर्ण सुराग एक सुरक्षा कैमरे का वीडियो हो सकता है। यह "डेटा एजेंटों" की दैनिक वास्तविकता है—ऐसे स्मार्ट कंप्यूटर प्रोग्राम जिन्हें संगठनों की अव्यवस्थपूर्ण डिजिटल फाइलों में खोज करके सवालों के जवाब देने के लिए डिज़ाइन किया गया है। लंबे समय तक, वैज्ञानिकों ने इन एजेंटों का परीक्षण साफ-सुथरी, एक ही प्रकार की पहेलियों पर किया, जैसे फोन बुक में कोई नाम ढूंढना या डेटाबेस से एक सरल प्रश्न पूछना। लेकिन वास्तविक दुनिया में, डेटा भाषाओं, प्रारूपों और मीडिया का एक अराजक मिश्रण है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या ये डिजिटल जासूस सबूतों के एक अस्त-व्यस्त ढेर से एक पूरी कहानी को जोड़ने में वास्तव में सक्षम हैं, या वे तब खो जाते हैं जब सुराग एक जैसे नहीं दिखते?

यह शोध पत्र एक नया, अत्यंत चुनौतीपूर्ण परीक्षण पेश करता है जिसे DataSpace कहा जाता है, ताकि यह देखा जा सके कि ये डेटा एजेंट इन अव्यवस्थपूर्ण, वास्तविक दुनिया के रहस्यों को सुलझाने में कितने कुशल हैं। शोधकर्ताओं ने एक विशाल खेल का मैदान बनाया जिसमें 410 अलग-अलग कार्य और 7,439 डिजिटल आर्टिफैक्ट्स (फाइलें) शामिल हैं, जिनका कुल डेटा 15.01 GB है। उन्होंने केवल यादृच्छिक फाइलें एक साथ नहीं फेंकी; उन्होंने एक "विषम वर्कस्पेस" (heterogeneous workspace) बनाया जहाँ एक एकल प्रश्न के लिए आपको एक वीडियो देखने, एक पीडीएफ को स्कैन करने, एक डेटाबेस को क्वेरी करने और एक JSON फाइल के साथ क्रॉस-रेफरेंस करने की आवश्यकता हो सकती है, और वह भी अंग्रेजी और चीनी दोनों भाषाओं में लिखे गए सुरागों के साथ। लक्ष्य केवल एक तथ्य ढूंढना नहीं है; एजेंट को उत्तरों की एक पूर्ण, सत्यापन योग्य तालिका तैयार करनी होगी, जैसे कि एक अंतिम रिपोर्ट कार्ड।

इस परीक्षण के परिणाम एक चेतावनी की तरह हैं। यहाँ तक कि परीक्षण किए गए सबसे स्मार्ट, सबसे उन्नत AI मॉडल (जिनमें ग्रोक 4.5 और GPT-5.6 जैसे दिग्गज शामिल हैं) भी केवल लगभग 66.34% कार्यों को सही ढंग से हल कर पाए। इसका मतलब है कि वे हर तीन में से लगभग एक पहेली गलत कर गए। शोधकर्ताओं ने पाया कि एजेंट सबसे अधिक तब संघर्ष करते हैं जब उन्हें विभिन्न प्रकार के मीडिया (जैसे एक वीडियो सुराग को स्प्रेडशीट के साथ जोड़ना) से जानकारी को संयोजित करना होता है या जब उन्हें जटिल "जॉइन्स" (दो अलग-अलग स्रोतों से डेटा को जोड़ना) करने की आवश्यकता होती है। दिलचस्प बात यह है कि "हार्नेस"—वह सॉफ्टवेयर फ्रेमवर्क जो AI को उसके टूल्स का उपयोग करने का निर्देश देता है—का चुनाव AI मस्तिष्क के अपने चयन जितना ही महत्वपूर्ण था, जिससे स्कोर में 15.36 अंक का अंतर आया।

अंततः, यह शोध पत्र दिखाता है कि डेटा एजेंट बेहतर तो हो रहे हैं, लेकिन वे पूर्णता से बहुत दूर हैं। वे अक्सर सही संख्याएं तो प्राप्त कर लेते हैं लेकिन अंतिम तालिका को सही ढंग से फॉर्मेट करने में विफल रहते हैं, या वे एक वीडियो में छिपे एक महत्वपूर्ण सुराग को मिस कर देते हैं। लेखक निष्कर्ष निकालते हैं कि जटिल, बहु-प्रारूप डेटा विश्लेषण को स्वतंत्र रूप से संभालने के लिए इन एजेंटों पर पूरी तरह से भरोसा करने से पहले हमें अभी एक लंबा रास्ता तय करना है, और उन्होंने इस बेंचमार्क को एक मानचित्र के रूप में प्रदान किया है ताकि भविष्य के इंजीनियर इन विशिष्ट कमजोरियों को ठीक करने में मदद पा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →