← नवीनतम पेपर
📊 statistics

GEAR: Generative Expansion and Real Anchoring for Two-Stage Distillation of Tabular Foundation Models

यह शोध पत्र GEAR का प्रस्ताव करता है, जो एक मॉड्यूलर टू-स्टेज डिस्टिलेशन फ्रेमवर्क है जो सिंथेटिक क्वेरी एक्सपेंशन को रियल-डेटा री-एंकरिंग के साथ जोड़कर संसाधन-गहन टैबुलर फाउंडेशन मॉडल्स को कमोडिटी CPUs के लिए हल्के और उच्च-प्रदर्शन वाले प्रेडिक्टर्स में परिवर्तित करता है, जिससे सुपरवाइज्ड बेसलाइन्स की तुलना में सटीकता और दक्षता में महत्वपूर्ण लाभ प्राप्त होता है।

मूल लेखक: Qi Qin, Jiajie Zhu, Dali Chen, Yuzhao Zhang, Jia-Xing Han, Yu Su, Peng Zhang, Ying Yan, Yifan Sun

प्रकाशित 2026-08-20
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qi Qin, Jiajie Zhu, Dali Chen, Yuzhao Zhang, Jia-Xing Han, Yu Su, Peng Zhang, Ying Yan, Yifan Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डेटा साइंस की दुनिया में, जानकारी अक्सर स्प्रेडशीट के रूप में आती है: संख्याओं और श्रेणियों की पंक्तियाँ जो ऋण आवेदनों से लेकर रोगी के स्वास्थ्य रिकॉर्ड तक सब कुछ वर्णित करती हैं। दशकों से, इन तालिकाओं में पैटर्न खोजने का सबसे विश्वसनीय तरीका विशिष्ट डेटा पर विशेष कंप्यूटर प्रोग्राम को प्रशिक्षित करना रहा है। ये प्रोग्राम उदाहरणों से सीखते हैं, अपनी आंतरिक सेटिंग्स को तब तक समायोजित करते हैं जब तक कि वे पहले देखे गए पैटर्न के आधार पर एक नई पंक्ति के परिणाम की भविष्यवाणी न कर सकें। हालाँकि, मॉडलों की एक नई पीढ़ी उभरी है जो अलग तरह से काम करती है। एक निश्चित नियमों के सेट को सीखने के बजाय, ये "फाउंडेशन मॉडल्स" एक सार्वभौमिक विशेषज्ञ की तरह कार्य करते हैं जो एक लेबल वाली तालिका को देख सकते हैं और तुरंत भविष्यवाणी कर सकते हैं कि आगे क्या होगा, केवल प्रदान किए गए संदर्भ को पढ़कर। जबकि यह दृष्टिकोण अविश्वसनीय रूप से शक्तिशाली और सटीक है, इसके साथ एक भारी कीमत भी आती है। भविष्यवाणी करने के लिए, मॉडल को अपनी मेमोरी में पूरी मूल तालिका को रखना पड़ता है और हर बार उसे प्रोसेस करना पड़ता है, जो धीमा, महंगा और अक्सर रोजमर्रा के उपकरणों के लिए असंभव होता है।

शोधकर्ताओं ने लंबे समय से इन शक्तिशाली विशेषज्ञों की बुद्धिमत्ता को बनाए रखते हुए उनके भारी बोझ को कम करने का रास्ता खोजा है। लक्ष्य एक छोटे, तेज़ और सरल कंप्यूटर प्रोग्राम को विशेषज्ञ के व्यवहार की नकल करना सिखाना है ताकि वह मूल तालिका या विशाल मॉडल की आवश्यकता के बिना, अपने आप भविष्यवाणियां कर सके। वैज्ञानिकों की एक टीम ने अब इस समस्या को हल करने के लिए GEAR नामक एक विधि पेश की है। उनका दृष्टिकोण छोटे प्रोग्राम को एक ही बार में सब कुछ सीखने के लिए मजबूर नहीं करता है। इसके बजाय, वे इस प्रक्रिया को दो अलग-अलग चरणों में विभाजित करते हैं। पहले, वे हजारों नए, सिंथेटिक (कृत्रिम) डेटा बिंदु उत्पन्न करते हैं जो वास्तविक डेटा की तरह दिखते हैं और उनका उपयोग छोटे प्रोग्राम को यह सिखाने के लिए करते हैं कि विशेषज्ञ कैसे सोचता है। फिर, वे प्रोग्राम को वास्तविक डेटा के पास वापस लाते हैं ताकि उसकी समझ को और बेहतर बनाया जा सके, जिससे यह सुनिश्चित हो सके कि वह वास्तविकता से जुड़ा रहे। यह दो-चरणीय प्रक्रिया छोटे प्रोग्राम को विशेषज्ञ के रहस्यों को सीखने की अनुमति देती है, बिना वास्तविक उपयोग के दौरान विशेषज्ञ को दोबारा देखे।

मुख्य चुनौती जिसका सामना शोधकर्ताओं ने किया, वह यह थी कि प्रशिक्षण के लिए उपलब्ध वास्तविक डेटा अक्सर सीमित होता है। यदि एक छोटा प्रोग्राम केवल उन कुछ पंक्तियों से सीखता है जो उसके पास हैं, तो वह उन व्यापक पैटर्न को मिस कर सकता है जिन्हें विशेषज्ञ ने आत्मसात किया है। इसे ठीक करने के लिए, टीम के पहले चरण में वास्तविक दुनिया की संरचना की नकल करने वाले एक विशाल मात्रा में नए, नकली डेटा का निर्माण शामिल है। वे इन सिंथेटिक पंक्तियों को शक्तिशाली विशेषज्ञ मॉडल को खिलाते हैं ताकि यह देखा जा सके कि वह क्या भविष्यवाणी करता है, और फिर वे छोटे प्रोग्राम को उन भविष्यवाणियों की नकल करने के लिए सिखाते हैं। यह छोटे प्रोग्राम के अनुभव का विस्तार करता है, जिससे उसे वास्तविक डेटा के साथ अकेले की तुलना में बहुत अधिक विविध परिदृश्यों पर अभ्यास करने की अनुमति मिलती है। हालाँकि, केवल नकली डेटा पर निर्भर रहना जोखिम भरा है; छोटा प्रोग्राम नकली डेटा पर विशेषज्ञ की नकल करने में बहुत अच्छा हो सकता है, लेकिन वास्तविक रिकॉर्ड की जटिल वास्तविकता का सामना करते समय विफल हो सकता है।

इसे हल करने के लिए, शोधकर्ताओं ने दूसरा चरण जोड़ा, जिसे वे "रियल एंकरिंग" (वास्तविक आधार) कहते हैं। एक बार जब छोटा प्रोग्राम सिंथेटिक डेटा से सीख लेता है, तो वे उसे वास्तविक, मूल तालिका पर वापस लाते हैं। यहाँ, वे प्रोग्राम को केवल उत्तरों को याद करने नहीं देते। इसके बजाय, वे एक चतुर तकनीक का उपयोग करते हैं जहाँ प्रोग्राम उस डेटा पर विशेषज्ञ की भविष्यवाणियों से सीखता है जिसे विशेषज्ञ ने पहले कभी नहीं देखा है। यह प्रोग्राम को उन उत्तरों पर निर्भर होने से रोकता है जिन्हें उसे याद करने के बजाय सीखना चाहिए। वास्तविक उत्तरों को विशेषज्ञ के मार्गदर्शन के साथ मिलाकर, छोटा प्रोग्राम उन गलतियों को सुधारता है जो उसने सिंथेटिक डेटा से सीखते समय की थीं। परिणाम एक ऐसा मॉडल है जिसमें सिंथेटिक प्रशिक्षण का व्यापक अनुभव है लेकिन वास्तविक दुनिया की सटीक सटीकता भी है।

टीम ने "हाँ या ना" जैसे बाइनरी विकल्पों से लेकर कई संभावित परिणामों वाले जटिल वर्गीकरणों तक, विभिन्न प्रकार के कार्यों पर इस पद्धति का परीक्षण किया। उन्होंने पाया कि इस दो-चरणीय पद्धति से प्रशिक्षित छोटे प्रोग्राम मानक प्रशिक्षण की तुलना में काफी बेहतर थे। बाइनरी कार्यों पर, इस नई पद्धति ने मानक प्रशिक्षण की तुलना में सटीकता में लगभग दो प्रतिशत का सुधार किया, और अधिक जटिल कार्यों पर, इसमें एक प्रतिशत से अधिक का लाभ हुआ। यह सुधार तब भी बना रहा जब शोधकर्ताओं ने विभिन्न प्रकार के छोटे प्रोग्रामों का उपयोग किया, जिनमें निर्णय वृक्ष (डिसीजन ट्री) भी शामिल थे, जो उद्योग में सामान्य हैं। छोटे मॉडल न केवल अधिक सटीक थे बल्कि बहुत अधिक कुशल भी थे। गति के मामले में, नई पद्धति ने मूल बड़े मॉडलों की तुलना में 57 से 2,866 गुना तेजी से भविष्यवाणियां कीं। इसने भविष्यवाणी करने के लिए आवश्यक कंप्यूटर मेमोरी की मात्रा को भी लगभग तीन गुना कम कर दिया, जिससे इन शक्तिशाली उपकरणों को महंगे, विशेष हार्डवेयर के बजाय मानक कंप्यूटर प्रोसेसर पर चलाना संभव हो गया।

शोधकर्ताओं ने यह भी पता लगाया कि वास्तव में कितने सिंथेटिक डेटा की आवश्यकता थी। उन्होंने पाया कि अधिक नकली डेटा जोड़ने से शुरू में मदद मिली, लेकिन केवल एक निश्चित बिंदु तक। एक बार जब छोटे प्रोग्राम ने पर्याप्त सिंथेटिक उदाहरण देख लिए, तो अधिक जोड़ने से प्रदर्शन में सुधार नहीं हुआ और यदि नकली डेटा वास्तविक दुनिया से पूरी तरह मेल नहीं खाता था, तो इसने प्रदर्शन को नुकसान भी पहुँचाया। इसने इस बात की पुष्टि की कि दूसरा चरण, यानी वास्तविक डेटा पर वापसी, आवश्यक था। इसके बिना, छोटा प्रोग्राम सिंथेटिक डेटा की दुनिया में ही फंसा रहता, और वास्तविकता की बारीकियों को संभालने में असमर्थ होता। अध्ययन ने दिखाया कि केवल लंबे समय तक प्रशिक्षण देने या किसी अलग प्रकार के प्री-ट्रेंड मॉडल से शुरू करने से समान परिणाम नहीं मिले। सिंथेटिक डेटा के साथ प्रशिक्षण के दायरे को बढ़ाने और फिर वास्तविक डेटा के साथ उसे आधार देने का विशिष्ट संयोजन ही सफलता की कुंजी थी।

यह कार्य यह प्रदर्शित करता है कि विशाल, संदर्भ-निर्भर मॉडलों की बुद्धिमत्ता को उनकी शक्ति खोए बिना हल्के, स्वतंत्र उपकरणों में बदलना संभव है। इस पद्धति के लिए भविष्यवाणी के समय छोटे प्रोग्राम को मूल विशेषज्ञ या प्रशिक्षण डेटा तक पहुँच की आवश्यकता नहीं होती है। यह इन उन्नत मॉडलों को उन सेटिंग्स में तैनात करने का द्वार खोलता है जहाँ गति और गोपनीयता महत्वपूर्ण है, जैसे कि मोबाइल उपकरणों पर या सुरक्षित वातावरण में जहाँ डेटा साझा नहीं किया जा सकता है। शोधकर्ताओं ने दिखाया कि उत्पन्न डेटा के उपयोग और वास्तविक दुनिया के सत्यापन के बीच सावधानीपूर्वक संतुलन बनाकर, वे ऐसे मॉडल बना सकते हैं जो स्मार्ट और व्यावहारिक दोनों हों। निष्कर्ष बताते हैं कि शक्तिशाली डेटा विश्लेषण का भविष्य केवल बड़े मॉडल बनाने में नहीं है, बल्कि छोटे मॉडलों को कल्पना और वास्तविकता के मिश्रण का उपयोग करके दिग्गजों की तरह सोचना सिखाने में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →