← नवीनतम पेपर
🤖 machine learning

End-to-End Compression for Tabular Foundation Models

यह शोध पत्र TACO को प्रस्तुत करता है, जो एक एंड-टू-एंड टैबुलर कम्प्रेशन मॉडल है जो बड़े पैमाने के डेटासेट पर प्रेडिक्टिव प्रदर्शन को बनाए रखते हुए या उसमें सुधार करते हुए, स्टेट-ऑफ-द-आर्ट ट्रांसफार्मर-आधारित टैबुलर फाउंडेशन मॉडल्स की तुलना में इन्फरेंस समय और मेमोरी के उपयोग को काफी कम कर देता है।

मूल लेखक: Guri Zabërgja, Rafiq Kamel, Arlind Kadra, Christian M. M. Frey, Josif Grabocka

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guri Zabërgja, Rafiq Kamel, Arlind Kadra, Christian M. M. Frey, Josif Grabocka

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "End-to-End Compression for Tabular Foundation Models" (TACO) के पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

समस्या: "सब कुछ की लाइब्रेरी" (The Library of Everything)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लाइब्रेरियन (एक Tabular Foundation Model) है जो किसी ग्राहक, मशीन या मरीज के बारे में लगभग कुछ भी भविष्यवाणी कर सकता है। ऐसा करने के लिए, लाइब्रेरियन केवल अनुमान नहीं लगाता; वे किसी नए व्यक्ति के बारे में भविष्यवाणी करने से पहले, उस दरवाजे से गुजरने वाले हर एक व्यक्ति के पूरे इतिहास (training dataset) को पढ़ते हैं।

अतीत में, यह लाइब्रेरियन धीमा था क्योंकि उसे लाइब्रेरी की हर एक किताब को एक-एक करके पढ़ना पड़ता था। हाल ही में, एक नए प्रकार का लाइब्रेरियन आया जो पढ़ने में बहुत तेज है, लेकिन उसमें एक बड़ी खामी है: वह लाइब्रेरी के आकार से घबरा जाता है (overwhelmed हो जाता है)।

यदि लाइब्रेरी में 100 किताबें हैं, तो लाइब्रेरियन ठीक रहता है। लेकिन यदि लाइब्रेरी में 100,000 किताबें हैं, तो लाइब्रेरियन का दिमाग (कंप्यूटर की मेमोरी) फट जाता है। वे भविष्यवाणी करने के लिए सभी किताबों को एक साथ अपने दिमाग में नहीं रख सकते। यह वह "क्वाड्रेटिक कॉम्प्लेक्सिटी" (quadratic complexity) वाली समस्या है जिसका उल्लेख पेपर में किया गया है: जैसे-जैसे डेटा बढ़ता है, इसे प्रोसेस करने के लिए आवश्यक समय और मेमोरी विस्फोटक रूप से बढ़ जाती है, जिससे इन स्मार्ट मॉडल्स को विशाल, वास्तविक दुनिया के डेटासेट पर उपयोग करना असंभव हो जाता है।

समाधान: TACO (द "स्मार्ट समराइज़र")

लेखकों ने इस पेपर में एक नया टूल बनाया जिसे TACO कहा जाता है। TACO को उस विशाल लाइब्रेरी और लाइब्रेरियन के बीच में बैठे एक अत्यधिक कुशल सारांशकार (super-efficient summarizer) के रूप में समझें।

यह तीन सरल चरणों में कैसे काम करता है:

  1. संपीड़न (The Compression - द समराइज़र): लाइब्रेरियन के डेटा देखने से पहले ही, TACO 100,000 किताबों की उस विशाल लाइब्रेरी को एक छोटी सी, 100 पन्नों की "ग्रेटेस्ट हिट्स" (Greatest Hits) पुस्तिका में बदल देता है। यह महत्वपूर्ण कहानियों को फेंकता नहीं है; यह डेटा के पैटर्न और सार (essence) को सीखता है और उन्हें एक संक्षिप्त प्रारूप में लिख देता है।
  2. भविष्यवाणी (The Prediction - द लाइब्रेरियन): लाइब्रेरियन फिर उस विशाल लाइब्रेरी के बजाय इस छोटी 100 पन्नों की पुस्तिका को पढ़ता है। क्योंकि पुस्तिका बहुत छोटी है, लाइब्रेरियन लगभग तुरंत भविष्यवाणी कर सकता है।
  3. परिणाम: लाइब्रेरियन अभी भी लगभग सब कुछ जानता है जिसकी उसे आवश्यकता है, लेकिन वह इसे बहुत कम प्रयास के साथ करता है।

TACO क्या हासिल करता है (जादुई नंबर)

पेपर ने मौजूदा बेहतरीन मॉडल्स (जैसे TabPFN) के मुकाबले इस सिस्टम का परीक्षण किया और अविश्वसनीय परिणाम पाए:

  • गति (Speed): TACO भविष्यवाणियाँ करने में 94 गुना तक तेज़ है। यदि पुराने मॉडल को सोचने में 10 सेकंड लगते, तो TACO एक सेकंड के छोटे से हिस्से में काम कर देता है।
  • मेमोरी (Memory): TACO 97% तक कम मेमोरी का उपयोग करता है। कल्पना कीजिए कि आप एक भारी सूटकेस (पुराना मॉडल) ले जाने के बजाय एक छोटा लिफाफा (TACO) ले जा रहे हैं। पुराना मॉडल अक्सर क्रैश हो जाता है क्योंकि सूटकेस कंप्यूटर के संभालने के लिए बहुत भारी होता है; TACO आसानी से जेब में आ जाता है।
  • सटीकता (Accuracy): डेटा को उसके मूल आकार के मात्र 1% तक सिकोड़ने के बावजूद, TACO ने सटीकता में बहुत अधिक कमी नहीं की। इसने उन मॉडल्स के समान प्रदर्शन किया जिन्होंने पूरी लाइब्रेरी पढ़ने की कोशिश की थी।

उन्होंने यह कैसे किया (सीक्रेट सॉस)

पेपर बताता है कि TACO केवल एक साधारण फ़िल्टर नहीं है; यह एक संयुक्त रूप से प्रशिक्षित टीम (jointly trained team) है।

  • कल्पना कीजिए कि एक कंप्रेसर (समराइज़र) और एक प्रेडिक्टर (लाइब्रेरियन) एक जिम में एक साथ प्रशिक्षण ले रहे हैं।
  • वे एक साथ अभ्यास करते हैं: कंप्रेसर डेटा को विशेष रूप से इस तरह से सारांशित करना सीखता है ताकि प्रेडिक्टर उसे सबसे अच्छी तरह समझ सके। प्रेडिक्टर इन सारांशों को प्रभावी ढंग से पढ़ना सीखता है।
  • यदि वे अलग-अलग प्रशिक्षित होते, तो कंप्रेसर ऐसी चीज़ों का सारांश बना सकता था जिसे प्रेडिक्टर समझ न सके। लेकिन क्योंकि वे एक साथ (end-to-end) प्रशिक्षण लेते हैं, वे एक ही भाषा बोलते हैं।

"चंकिंग" तकनीक (असंभव को संभालना)

पेपर ने उन डेटासेट्स की समस्या को भी हल किया जो इतने बड़े हैं कि किसी भी कंप्यूटर की मेमोरी से बड़े हैं (जैसे 1.5 मिलियन पंक्तियाँ/rows)।

  • उपमा: कल्पना कीजिए कि आप एक 1,000 पन्नों के उपन्यास का सारांश लिखने की कोशिश कर रहे हैं, लेकिन आपके पास केवल 10 पन्नों की नोटबुक है।
  • रणनीति: TACO उपन्यास को छोटे अध्यायों (chunks) में तोड़ देता है। यह अध्याय 1 का सारांश बनाता है, फिर अध्याय 2 का, फिर अध्याय 3 का। अंत में, यह इन छोटे सारांशों को एक अंतिम "मास्टर सारांश" में जोड़ देता है।
  • इसने उन्हें 1.5 मिलियन पंक्तियों वाले डेटासेट पर भविष्यवाणियाँ चलाने की अनुमति दी, एक ऐसा कार्य जिसके कारण अन्य मॉडल्स मेमोरी की सीमाओं के कारण तुरंत क्रैश हो जाते।

निचोड़ (The Bottom Line)

पेपर का दावा है कि TACO हमें बिना सुपरकंप्यूटर की आवश्यकता के विशाल, वास्तविक दुनिया के डेटासेट्स पर "फाउंडेशन मॉडल्स" का उपयोग करने की अनुमति देता है। यह एक धीमी, मेमोरी-भूखी प्रक्रिया को एक तेज़, हल्के वजन वाली प्रक्रिया में बदल देता है, और वह भी सटीक भविष्यवाणियों को बनाए रखते हुए। यह प्रभावी रूप से उस "स्केलिंग समस्या" को हल करता है जो इन AI मॉडल्स को सबसे बड़े डेटा समस्याओं के उपयोग से रोक रही थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →