← नवीनतम पेपर
🤖 machine learning

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

यह शोध पत्र RelBench v2 प्रस्तुत करता है, जो रिलेशनल डीप लर्निंग के लिए एक महत्वपूर्ण रूप से विस्तारित बेंचमार्क और रिपॉजिटरी है, जिसमें चार नए बड़े पैमाने के डेटासेट, नवीन ऑटोकम्प्लीट कार्य, और व्यवस्थित मूल्यांकन को सुगम बनाने तथा सिंगल-टेबल बेसलाइन की तुलना में रिलेशनल मॉडल्स की श्रेष्ठता प्रदर्शित करने के लिए बाहरी फ्रेमवर्क के साथ एकीकरण शामिल है।

मूल लेखक: Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास सूचनाओं का एक विशाल पुस्तकालय है। पुराने दिनों में, यदि आप कोई पैटर्न खोजना चाहते थे, तो आपको हर एक किताब उठाकर, उसके पन्ने फाड़ने पड़ते और उन सभी को एक विशाल, बिखरे हुए कागज़ के टुकड़े पर चिपकाना पड़ता। इस प्रक्रिया में आप यह संदर्भ खो देते कि कौन सा पन्ना किस किताब से आया था, और आपको संबंधित विचारों को जोड़ने के लिए मैन्युअल रूप से रेखाएं खींचनी पड़ती थीं। जटिल डेटा को संभालने के लिए पारंपरिक मशीन लर्निंग इसी तरह काम करती थी।

रिलेशनल डीप लर्निंग (RDL) एक नए प्रकार के लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है जो पन्ने नहीं फाड़ता। इसके बजाय, वे पूरे पुस्तकालय को एक जीवित मानचित्र (living map) के रूप में देखते हैं। वे समझते हैं कि एक "किताब" एक "लेखक" से जुड़ी है, जो एक "विश्वविद्यालय" से जुड़ा है, जो एक "शहर" से जुड़ा है। वे केवल अलग-थलग तथ्यों को नहीं, बल्कि उनके बीच के संबंधों को देखते हैं।

यह पेपर RELBENCH v2 को इन स्मार्ट लाइब्रेरियनों के लिए एक "ट्रेनिंग जिम" के रूप में एक बड़े अपग्रेड के रूप में पेश करता है। उन्होंने यह बनाया है:

1. नए प्रशिक्षण मैदान (डेटासेट्स)

मूल जिम (RELBENCH v1) में कुछ अभ्यास क्षेत्र थे। RELBENCH v2 ने चार विशाल नए स्टेडियम जोड़ दिए हैं, जिससे कुल संख्या 11 हो गई है। ये केवल छोटे अभ्यास क्षेत्र नहीं हैं; ये विशाल, वास्तविक दुनिया की डेटा दुनिया हैं:

  • विद्वान का पुस्तकालय (rel-arxiv): लाखों शोध पत्रों, लेखकों और किसने किसे उद्धृत (cite) किया, इसका एक मानचित्र।
  • कॉर्पोरेट ऑफिस (rel-salt): एक बड़ी कंपनी के बिक्री आदेशों (sales orders), शिपिंग मार्गों और भुगतान शर्तों का एक सिमुलेशन।
  • बीयर प्रेमी का फोरम (rel-ratebeer): बीयर, ब्रुअरीज और स्थानों को रेटिंग देने वाले उपयोगकर्ताओं का एक दशक का डेटा।
  • अस्पताल के रिकॉर्ड (rel-mimik): एक प्रमुख चिकित्सा केंद्र के गुमनाम रोगी रिकॉर्ड (गोपनीयता की रक्षा के लिए तारीखों को भविष्य में स्थानांतरित किया गया है)।

साथ मिलकर, इनमें 22 मिलियन से अधिक पंक्तियाँ (rows) शामिल हैं। यह AI को एक ऐसे पुस्तकालय देने जैसा है जिसमें सीखने के लिए 22 मिलियन किताबें हैं, जो सभी एक-दूसरे से जुड़ी हुई हैं।

2. नए खेल (टास्क)

यह पेपर "ऑटोकम्प्लीट" (Autocomplete) नामक एक नए प्रकार के खेल को पेश करता है।

  • पुराना खेल (फोरकास्टिंग/पूर्वानुमान): एक क्रिस्टल बॉल की कल्पना करें। आप AI को आज तक का डेटा देते हैं, और वह उस चीज़ की भविष्यवाणी करता है जो अभी तक हुई नहीं है (जैसे, "क्या यह ग्राहक अगले महीने छोड़ कर चला जाएगा?")।
  • नया खेल (ऑटोकम्प्लीट): एक आंशिक रूप से भरे हुए फॉर्म की कल्पना करें। AI कुछ फ़ील्ड देखता है (जैसे, "ग्राहक का नाम" और "ऑर्डर की तारीख") लेकिन "भुगतान विधि" वाला बॉक्स खाली है। AI को खाली बॉक्स का अनुमान लगाना है, और इसके लिए वह केवल उन्हीं संकेतों का उपयोग करता है जो उसे अन्य टेबल्स से मिलते हैं।

यह कठिन क्यों है? यह किसी व्यक्ति का पता और समय जानकर केवल उससे उसकी पसंदीदा चीज़ का अनुमान लगाने जैसा है, बिना उससे पूछे। AI को खाली स्थान को भरने के लिए अन्य टेबल्स (संबंधित डेटा) के "पड़ोस" को देखना पड़ता है। पेपर दिखाता है कि जब AI टेबल्स के बीच के संबंधों को समझता है, तो वह केवल एक सिंगल रो (row) को देखने की तुलना में बहुत बेहतर प्रदर्शन करता है।

3. "यूनिवर्सल एडाप्टर" (अन्य बेंचमार्क को एकीकृत करना)

लेखकों ने केवल नए कमरे ही नहीं बनाए; उन्होंने एक यूनिवर्सल एडाप्टर भी बनाया है जो इस जिम को अन्य लोकप्रिय प्रशिक्षण केंद्रों से जोड़ता है:

  • टाइम-स्ट्रीम जिम (TGB): उन्होंने उन डेटासेट्स को उनके लाइब्रेरी फॉर्मेट में अनुवादित किया जो आमतौर पर घटनाओं के बहते हुए प्रवाह (flowing river of events) की तरह दिखते हैं, ताकि AI उन पर भी अभ्यास कर सके।
  • 70-डेटाबेस चुनौती (ReDeLEx): उन्होंने 70 से अधिक वास्तविक दुनिया के डेटाबेस के संग्रह से खुद को जोड़ा, जिससे AI को लगभग किसी भी चीज़ पर अभ्यास करने का मौका मिला।
  • 4D टूलबॉक्स (4DBInfer): उन्होंने टूल्स का एक सेट जोड़ा जो AI का परीक्षण चार अलग-अलग कोणों (डेटा, टास्क, ग्राफ स्ट्रक्चर और मॉडल) से करते हैं, ताकि यह सुनिश्चित किया जा सके कि वह वास्तव में मजबूत (robust) है।

4. परिणाम: जुड़ाव की शक्ति

पेपर ने "स्मार्ट लाइब्रेरियन" (RDL मॉडल) बनाम "पुराने स्कूल के वर्कर" (पारंपरिक मॉडल जो डेटा को फ्लैट करते हैं) की तुलना करने के लिए परीक्षणों की एक श्रृंखला चलाई।

फैसला: स्मार्ट लाइब्रेरियन लगभग हर बार जीता।

  • चाहे वह खाली मानों का अनुमान लगाना हो (Autocomplete), भविष्य की भविष्यवाणी करना हो (Forecasting), या अगली वस्तु की सिफारिश करना हो (Recommendation), वह मॉडल जो टेबल्स के बीच के संबंधों को समझता था, उसने काफी बेहतर प्रदर्शन किया।
  • भले ही डेटा अव्यवस्थित था या श्रेणियां असंतुलित थीं, रिलेशनल मॉडल ने उन कनेक्शनों का उपयोग करके उन संकेतों को खोज निकाला जिन्हें पुराने मॉडलों ने मिस कर दिया था।

सारांश

RELBENCH v2 को जटिल डेटाबेस को समझने की कोशिश कर रहे आर्टिफिशियल इंटेलिजेंस के लिए अंतिम "ड्राइवरों शिक्षा" (Driver's Ed) के रूप में समझें। यह प्रदान करता है:

  1. अधिक कारें: 11 विशाल, विविध डेटासेट्स (अकादमिक, व्यावसायिक, उपभोक्ता, चिकित्सा)।
  2. नई ड्रिल: एक नया "ऑटोकम्प्लीट" चैलेंज यह परीक्षण करने के लिए कि AI संदर्भ (context) का उपयोग करके खाली जगहों को कितनी अच्छी तरह भरता है।
  3. एक यूनिवर्सल गैरेज: अन्य परीक्षण स्थलों से जुड़ने के लिए उपकरण ताकि AI सब कुछ सीख सके।

मुख्य निष्कर्ष सरल है: जब डेटा जुड़ा हुआ होता है, तो आपको इसे एक जुड़े हुए जाल (connected web) के रूप में देखना होगा, न कि एक सपाट सूची के रूप में। जो मॉडल ऐसा करते हैं, वे दौड़ जीत रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →