← नवीनतम पेपर
🤖 machine learning

TabTreeFormer: Tabular Data Generation Using Hybrid Tree-Transformer

यह शोधपत्र TabTreeFormer को प्रस्तुत करता है, जो एक हाइब्रिड ट्रांसफॉर्मर आर्किटेक्चर है जो उच्च-सटीकता वाले सारणीबद्ध (tabular) डेटा को कुशलतापूर्वक उत्पन्न करने के लिए ट्री-आधारित इंडक्टिव बायस और एक जटिलता-जागरूक टोकनाइज़र को एकीकृत करता है, जो उपयोगिता, सटीकता और गोपनीयता मेट्रिक्स में मौजूदा मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Jiayu Li, Bingyin Zhao, Zilong Zhao, Uzair Javaid, Kevin Yee, Biplab Sikdar

प्रकाशित 2026-07-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayu Li, Bingyin Zhao, Zilong Zhao, Uzair Javaid, Kevin Yee, Biplab Sikdar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं, लेकिन उसे फिल्में या किताबें दिखाने के बजाय, आप केवल स्प्रेडशीट्स (spreadsheets) देते हैं। ये स्प्रेडशीट्स हर जगह मौजूद हैं: इनमें आपके मेडिकल रिकॉर्ड, आपके बैंक स्टेटमेंट और आपके स्कूल के ग्रेड शामिल हैं। लेकिन इसमें एक पेंच है। ये स्प्रेडशीट्स रहस्यों से भरी होती हैं। यदि आप रोबोट को सीधे इनसे सीखने देते हैं, तो वह अनजाने में आपके निजी विवरणों को याद कर सकता है और उन्हें सार्वजनिक कर सकता है। इस समस्या को हल करने के लिए, वैज्ञानिक "सिंथेटिक डेटा" (synthetic data) बनाते हैं—नकली स्प्रेडशीट्स जो बिल्कुल असली वाली जैसी दिखती हैं और व्यवहार करती हैं, लेकिन उनमें कोई वास्तविक व्यक्ति नहीं होता। यह एक व्यक्ति की एकदम सटीक मोम की मूर्ति बनाने जैसा है; यह असली दिखती है, लेकिन इसे छूना सुरक्षित है।

समस्या यह है कि जो रोबट हम आमतौर पर इन नकली स्प्रेडशीट्स को बनाने के लिए उपयोग करते हैं, वे संख्याओं के मामले में थोड़े अनाड़ी होते हैं। वे वाक्यों (जैसे कि एक चैटबॉट में) या चित्रों (जैसे कि एक कैमरे में) को समझने में बहुत अच्छे होते हैं, लेकिन वे स्प्रेडशीट डेटा की अजीब और ऊबड़-खाबड़ प्रकृति के साथ संघर्ष करते हैं। वास्तविक दुनिया की संख्याएँ अक्सर अचानक चरणों में बदल जाती हैं (जैसे कि कीमत अचानक 100सेगिरकर100 से गिरकर 50 हो जाना) बजाय इसके कि वे एक नदी की तरह सुचारू रूप से बहें। इसके अलावा, ये रोबोट अक्सर विशाल तालिकाओं (tables) के डेटा को संभालने के लिए बहुत धीमे और अधिक मेमोरी खर्च करने वाले होते हैं। बड़ा सवाल वैज्ञानिकों के लिए यह है: हम एक ऐसा रोबोट कैसे बनाएं जो वास्तविक डेटा की बिखरी हुई और उछलती-कूदती प्रकृति की नकल करने में इतना स्मार्ट हो कि वह रहस्यों को याद न करे या काम के बोझ से क्रैश न हो जाए?

यहाँ आता है TabTreeFormer, एक नए प्रकार का रोबोट जिसे विशेष रूप से स्प्रेडशीट्स की नकल करने की कला में महारत हासिल करने के लिए डिज़ाइन किया गया है। इसके पीछे के शोधकर्ताओं ने महसूस किया कि स्प्रेडशीट को समझने का सबसे अच्छा तरीका एक मानक "टेक्स्ट-रीडर" रोबोट का उपयोग करना नहीं है, बल्कि एक अलग प्रकार की मशीन: "डिसीजन ट्री" (decision tree) से एक तकनीक उधार लेना है। आप एक डिसीजन ट्री को "20 सवाल" (20 Questions) के खेल की तरह समझ सकते हैं। यह पता लगाने के लिए कि कोई जानवर क्या है, आप पूछते हैं: "क्या इसके शरीर पर फर है?" यदि हाँ, तो "क्या यह भौंकता है?" यदि नहीं, तो "क्या यह म्याऊँ करता है?" यह चरण-दर-चरण, हाँ-या-ना वाला रास्ता वास्तविक डेटा में पाए जाने वाले अचानक बदलावों और विशिष्ट नियमों को संभालने के लिए एकदम सही है।

टीम ने इस "20 सवालों" वाले तर्क को एक शक्तिशाली भाषा-सीखने वाले रोबोट (जिसे ट्रांसफॉर्मर कहा जाता है) के साथ मिलाकर TabTreeFormer बनाया। उन्होंने रोबोट को एक विशेष "अनुवादक" (tokenizer) दिया जो बिखरी हुई संख्याओं को एक सरल कोड में बदल देता है। 3.14159 जैसी संख्या के हर एक दशमलव बिंदु को याद रखने की कोशिश करने के बजाय, अनुवादक उन्हें समूहों (जैसे कि "छोटा," "मध्यम," "बड़ा") में बांट देता है और फिर सटीक मान प्राप्त करने के लिए एक विशिष्ट टैग जोड़ देता है। यह डेटा को बहुत छोटा और रोबोट के लिए पचाने में आसान बनाता है, जबकि महत्वपूर्ण विवरणों को भी बनाए रखता है।

परिणाम प्रभावशाली हैं। नौ अलग-अलग प्रकार के वास्तविक दुनिया के डेटासेट पर परीक्षण किए जाने पर, TabTreeFormer ने लगातार ऐसे नकली डेटा का निर्माण किया जो अन्य आठ शीर्ष विधियों द्वारा बनाए गए डेटा की तुलना में अन्य AI मॉडल को प्रशिक्षित करने के लिए अधिक उपयोगी था। उन परिदृश्यों में जहाँ लक्ष्य शुद्ध रूप से सर्वोत्तम संभव डेटा गुणवत्ता प्राप्त करना था (और गोपनीयता मुख्य चिंता नहीं थी), TabTreeFormer के सबसे अच्छे संस्करण ने अपने निकटतम प्रतिद्वंद्वी की तुलना में प्रदर्शन में 44% का सुधार किया। इसने यह भी प्रबंधित किया कि वह बहुत भारी-भरकम रोबोटों की तुलना में बहुत छोटे मॉडल आकार का उपयोग करते हुए और अधिक तेज़ी से डेटा उत्पन्न कर सके।

हालाँकि, पेपर सावधानी से यह नोट करता है कि यह सब कुछ हल करने वाला कोई जादुई डंडा नहीं है। शोधकर्ताओं ने पाया कि यदि आप सर्वोत्तम गुणवत्ता प्राप्त करने के लिए गोपनीयता सुरक्षा उपायों को बंद कर देते हैं, तो रोबोट कभी-कभी अपने काम में इतना अच्छा हो जाता है कि वह वास्तविक डेटा को बहुत करीब से याद कर लेता है। उन्होंने दिखाया कि एक ट्रेड-ऑफ (समझौता) है: आप गोपनीयता की जितनी अधिक रक्षा करने की कोशिश करेंगे, डेटा उतना ही कम सटीक दिखेगा, और इसके विपरीत। लेकिन कुल मिलाकर, TabTreeFormer सुझाव देता है कि डिसीजन ट्री की "20 सवालों" वाली शैली को आधुनिक भाषा मॉडलों के साथ मिलाकर, हम नकली डेटा बनाने का एक बहुत बेहतर, तेज़ और अधिक सटीक तरीका बना सकते हैं जो AI के भविष्य को शक्ति प्रदान करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →