← नवीनतम पेपर
🤖 machine learning

PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining

यह शोध पत्र प्रदर्शित करता है कि PluRel सिंथेटिक डेटाबेस जनरेटर, वास्तविक दुनिया के स्कीमा (schemas) के शुरुआती एक्सपोज़र को प्राथमिकता देने वाली एक करिकुलम रणनीति का उपयोग करके, 55 गुना कम कार्यों के साथ मूल RDB-PFN प्रदर्शन का 87.6% प्राप्त करते हुए, रिलेशनल फाउंडेशन मॉडल्स के लिए एक बाहरी प्रीट्रेनिंग स्रोत के रूप में प्रभावी ढंग से कार्य कर सकता है।

मूल लेखक: Mohammad Sadeq Abolhasani, Viswanath Ganapathy

प्रकाशित 2026-08-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammad Sadeq Abolhasani, Viswanath Ganapathy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को यह सिखाने की कोशिश कर रहे हैं कि किसी कंपनी के डेटा की उलझी हुई और आपस में जुड़ी हुई दुनिया को कैसे समझा जाए। वास्तविक दुनिया में, यह डेटा "रिलेशनल डेटाबेस" (relational databases) में रहता है, जो संगठित फाइलिंग कैबिनेट की तरह होते हैं जहाँ अलग-अलग दराजें (टेबल्स) धागों (संबंधों) द्वारा आपस में जुड़ी होती हैं। उदाहरण के लिए, एक "ग्राहक" (Customer) का दराज एक "ऑर्डर" (Order) के दराज से जुड़ा है, जो एक "उत्पाद" (Product) के दराज से जुड़ा है। समस्या यह है कि कंपनियाँ अपने गुप्त फाइलिंग कैबिनेट को लेकर बहुत सुरक्षात्मक होती हैं; वे गोपनीयता नियमों के कारण असली डेटा को शायद ही कभी किसी को देखने देती हैं। इसलिए, वैज्ञानिक "फाउंडेशन मॉडल्स" (foundation models)—यानी ऐसे AI दिमाग जिन्हें इन कनेक्शनों को समझने के लिए बनाया गया है—नकली, बनावटी डेटा का उपयोग करके प्रशिक्षित करते हैं।

ऐसा करने के लिए, शोधकर्ताओं को दो चीजों की आवश्यकता होती है: लाखों नकली डेटाबेस उत्पन्न करने का एक तरीका, और AI को उन डेटाबेस का उपयोग करके समस्याओं को हल करना सिखाने का एक तरीका। इस उदाहरण में AI को एक छात्र मान लें और नकली डेटा को अभ्यास परीक्षाओं की एक विशाल लाइब्रेरी। यदि छात्र बहुत अधिक उबाऊ, रैंडम अभ्यास परीक्षाएं पढ़ता है, तो वह भ्रमित हो सकता है। लेकिन यदि वह सही मिश्रण वाली परीक्षाएं पढ़ता है, तो वह बिना किसी असली गुप्त फाइल को देखे, वास्तविक दुनिया के रहस्यों को सुलझाना सीख सकता है। बड़ा सवाल यह है: क्या हम इन अभ्यास परीक्षाओं को बनाने का एक बेहतर, अधिक कुशल तरीका बना सकते हैं ताकि छात्र तेजी से सीख सके और उसे कम परीक्षाओं की आवश्यकता हो?

यह शोध पत्र इन AI छात्रों को प्रशिक्षित करने के एक चतुर नए तरीके की खोज करता है। शोधकर्ताओं ने एक मौजूदा AI मॉडल जिसे RDB-PFN कहा जाता है, जो पहले से ही डेटाबेस की पहेलियों को सुलझाने में अच्छा है, का उपयोग किया और उसे एक अलग, अधिक लचीले जनरेटर जिसे Plu-Rel कहा जाता है, के डेटा से खिलाने की कोशिश की। मूल प्रशिक्षण विधि RDB-PFN के लिए एक मैराथन की तरह थी: इसमें छात्र को लगभग 1.8 मिलियन अभ्यास कार्यों को पढ़ने की आवश्यकता थी, जिसमें सरल सिंगल-टेबल पहेलियों से शुरू होकर जटिल मल्टी-टेबल पहेलियों तक का सफर शामिल था। लेखक यह देखना चाहते थे कि क्या वे Plu-Rel के डेटा को बदल सकते हैं और फिर भी एक शीर्ष स्तर का छात्र प्राप्त कर सकते हैं, लेकिन एक बहुत छोटे और स्मार्ट प्रशिक्षण कार्यक्रम के साथ।

यहाँ उन्हें क्या मिला। उन्होंने Plu-Rel द्वारा उत्पन्न डेटाबेस को एक ऐसे प्रारूप में बदलने के लिए एक पाइपलाइन बनाई जिसे AI समझ सके। फिर, उन्होंने तीन अलग-अलग "करिकुलम" (curriculum) रणनीतियों, या प्रशिक्षण कार्यक्रमों का परीक्षण किया, यह देखने के लिए कि सीखने का कौन सा क्रम सबसे अच्छा काम करता है।

सबसे पहले, उन्होंने एक पूरी तरह से सिंथेटिक (Fully Synthetic) दृष्टिकोण आजमाया, जहाँ छात्र शुरू से अंत तक केवल रैंडम, बनावटी डेटाबेस से सीखता है। दूसरा, उन्होंने एक स्कीमा-गाइडेड लास्ट (Schema-Guided Last) दृष्टिकोण आजमाया, जहाँ छात्र पहले रैंडम डेटाबेस से सीखता है और केवल अंत में एक "वास्तविक दुनिया" के स्टाइल के स्ट्रक्चर को देखता है। अंत में, उन्होंने एक स्कीमा-गाइडेड फर्स्ट (Schema-Guided First) दृष्टिकोण आजमाया। इस पद्धति में, छात्र ने एक निश्चित, यथार्थवादी संरचना (जो एक वास्तविक कंपनी के डेटाबेस की नकल करती है) से सीखना शुरू किया और फिर धीरे-धीरे अधिक विविध, रैंडम सिंथेटिक संरचनाओं की ओर बढ़ा।

परिणाम आश्चर्यजनक और स्पष्ट थे। स्कीमा-गाइडेड फर्स्ट रणनीति विजेता रही। भले ही शोधकर्ताओं ने केवल 33,000 कार्यों का उपयोग किया—जो मूल विशाल प्रशिक्षण सेट की तुलना में लगभग 55 गुना कम है—उनके AI मॉडल ने अविश्वसनीय रूप से अच्छा प्रदर्शन किया। एक मानक परीक्षण स्तर पर, इस छोटे, स्मार्ट प्रशिक्षण सेट ने मूल, विशाल मॉडल के लगभग 87.6% प्रदर्शन को पुनः प्राप्त कर लिया। जब परीक्षण संदर्भ छोटा था (यानी AI को बहुत सारे उदाहरणों को देखने के बजाय अपने सामान्य ज्ञान पर अधिक निर्भर रहना था), तो रिकवरी दर बढ़कर 93.8% हो गई।

शोध पत्र सुझाव देता है कि एक यथार्थवादी "एंकर" (anchor) से शुरुआत करना महत्वपूर्ण है। यह एक बच्चे को गाड़ी चलाना सिखाने जैसा है: आप उन्हें बिना किसी नियम वाले एक अराजक, अप्रत्याशित रेस ट्रैक पर नहीं भेजते। आप उन्हें स्पष्ट रेखाओं और संकेतों वाले एक शांत, संरचित पार्किंग लॉट में शुरू करते हैं (वास्तविक दुनिया का स्कीमा)। एक बार जब वे सड़क के बुनियादी नियमों को समझ लेते हैं, तो आप उन्हें अधिक जटिल, विविध सड़कों पर ले जा सकते हैं (सिंथेटिक डेटा) ताकि उनके कौशल का निर्माण हो सके। अध्ययन में पाया गया कि इसके विपरीत करना—यानी अराजकता से शुरू करना और अंत में व्यवस्था सिखाने की कोशिश करना—काम नहीं आया; छात्र या तो वह भूल जाता था जो उसने सीखा था या अचानक आए बदलाव से भ्रमित हो जाता था।

दिलचस्प बात यह है कि शोधकर्ताओं ने यह भी नोट किया कि जबकि यह नई विधि अत्यधिक कुशल है, मूल विशाल प्रशिक्षण सेट का एक बड़ा लाभ तब होता है जब AI को बहुत अधिक संदर्भ (1,024 उदाहरण) दिया जाता है। यह सुझाव देता है कि एक स्मार्ट, संरचित शुरुआत शक्तिशाली है, लेकिन डेटा की विशाल मात्रा AI को बहुत सूक्ष्म, लंबी दूरी के पैटर्न को पहचानने में मदद करती है जो एक छोटे डेटासेट से छूट सकते हैं। हालाँकि, मुख्य निष्कर्ष यह है कि आपको छात्र को अच्छी तरह से सिखाने के लिए लाखों किताबों की लाइब्रेरी की आवश्यकता नहीं है; आपको बस सही क्रम में सही किताबों की आवश्यकता है। डेटा जनरेशन को मॉडल ट्रेनिंग से अलग करके और एक "रियल-वर्ल्ड फर्स्ट" करिकुलम का उपयोग करके, लेखकों ने दिखाया है कि हम बहुत अधिक कुशलता से शक्तिशाली रिलेशनल AI मॉडल बना सकते हैं, जिससे निजी एंटरप्राइज डेटा पर इन सिस्टम्स को प्रशिक्षित करना आसान हो सकता है, बिना खुद के रहस्यों को उजागर किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →