← नवीनतम पेपर
🤖 machine learning

A Mechanistic Study of Tabular Foundation Models

यह शोध पत्र टैबुलर फाउंडेशन मॉडल्स के विशिष्ट समानता-आधारित रीडआउट एल्गोरिदम को अभिलक्षणित करके, उन विशिष्ट पोजीशनल पैरामीटर्स की पहचान करके जो क्रमपरिवर्तन अपरिवर्तनीयता (परम्यूटेशन इनवेरिएंस) के लिए उत्तरदायी हैं, और उनके सटीक परिणामों एवं विफलता मोड दोनों की व्याख्या करने वाले कॉज़ल इंटरवेंशन और लक्षित गड़बड़ी (टारगेटेड परटर्बेशन) के माध्यम से इन निष्कर्षों को मान्य करते हुए, उनका एक यांत्रिक विवरण प्रस्तुत करता है।

मूल लेखक: Marin Biloš, James T. Wilson, Anderson Schneider, Yuriy Nevmyvaka

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marin Biloš, James T. Wilson, Anderson Schneider, Yuriy Nevmyvaka

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास तीन अलग-अलग शेफ (TabPFNv2, TabICLv2, और Mitra) हैं जो सभी एक ही स्वादिष्ट व्यंजन बनाने के लिए प्रसिद्ध हैं: डेटा के स्प्रेडशीट से परिणामों की भविष्यवाणी करना। वे सभी जजों (बेंचमार्क) को समान रूप से स्वादिष्ट लगते हैं, लेकिन यह पेपर एक ज्वलंत प्रश्न पूछता है: क्या वे वास्तव में एक ही रेसिपी का उपयोग कर रहे हैं, या वे सिर्फ भाग्यशाली हैं?

लेखकों ने इन शेफों का "मैकेनिकल ऑटॉप्सी" (यांत्रिक चीरफाड़) करने का निर्णय लिया ताकि यह देखा जा सके कि वे कैसे सोचते हैं, वे कहाँ भ्रमित होते हैं, और यदि आप उन्हें धोखा देते हैं तो क्या होता है। यहाँ जो उन्होंने पाया गया है, उसे सरल भाषा में समझाया गया है।

1. तीन अलग-अलग रेसिपी

भले ही ये शेफ अलग-अलग रसोई के औजारों (आर्किटेक्चर) का उपयोग करते हैं, वे अंततः एक ही स्वादिष्ट परिणाम प्राप्त करते हैं। हालाँकि, पेपर ने खोजा कि वे अपने अंतिम निर्णय तक पहुँचने के लिए तीन पूरी तरह से अलग मानसिक शॉर्टकट का उपयोग करते हैं:

  • शेफ TabPFNv2 और शेफ Mitra ("वोटिंग क्राउड"): ये दोनों नए डेटा रो (row) को देखते हैं और पूछते हैं, "मेरी मेमोरी बैंक में कौन सा व्यक्ति इससे सबसे अधिक मिलता-जुलता है?" फिर वे पड़ोसियों से एक वेटेड वोट (weighted vote) लेते हैं। यदि सबसे मिलते-जुलते लोगों ने "हाँ" वोट दिया है, तो शेफ "हाँ" कहता है। यह अपने सबसे मिलते-जुलते दोस्तों से सलाह लेने और बहुमत की राय के साथ जाने जैसा है।
  • शेफ TabICLv2 ("प्रोटोटाइप मैचर"): यह शेफ व्यक्तिगत पड़ोसियों को नहीं देखता है। इसके बजाय, यह अपने पास मौजूद हर "हाँ" वाले उदाहरण और हर "ना" वाले उदाहरण का एक परफेक्ट औसत (perfect average) बनाता है। जब एक नई रो आती है, तो यह बस पूछता है, "क्या तुम औसत 'हाँ' के करीब हो या औसत 'ना' के करीब?" यह एक नए फल की तुलना एक आदर्श सेब और एक आदर्श संतरे से करने जैसा है ताकि यह देखा जा सके कि वह किससे अधिक मिलता है।

प्रमाण: लेखकों ने रेसिपी बदलने की कोशिश की। उन्होंने शेफ TabPFNv2 को "प्रोटोटाइप" रेसिपी दी, और वह क्रैश हो गया। उन्होंने शेफ TabICLv2 को "वोटिंग" रेसिपी दी, और वह बुरी तरह विफल रहा। यह साबित करता है कि प्रत्येक शेफ का मस्तिष्क विशेष रूप से उनके अपने अनूठे सोचने के तरीके के लिए बनाया गया है। आप एक वोटिंग मशीन के मस्तिष्क को मैचिंग मशीन के साथ बदल नहीं सकते।

2. "मैजिक" लेयर्स (जादुई परतें)

पेपर ने यह भी देखा कि ये शेफ उत्तर कब निकालते हैं।

  • TabPFNv2 और Mitra उन छात्रों की तरह हैं जो एक समस्या को लंबे समय तक घूरते रहते हैं, जो स्पष्ट रूप से भ्रमित दिखते हैं, और फिर अपनी सोच की प्रक्रिया के बिल्कुल अंत में अचानक एक "लाइटबल्ब मोमेंट" (अचानक समझ आना) पाते हैं।
  • TabICLv2 अलग है। यह शुरुआत में ही लगभग तुरंत उत्तर निकाल लेता है, और बाकी का मस्तिष्क केवल विवरणों को पॉलिश करता है। वास्तव में, लेखकों ने पाया कि TabICLv2 के विशाल मस्तिष्क का अधिकांश हिस्सा वास्तव में बहुत कम भारी काम कर रहा है; यह बहुत छोटा हो सकता था और फिर भी उतना ही अच्छा काम कर सकता था।

3. "ऑर्डर मैटर नहीं करता" टेस्ट (क्रम मायने नहीं रखता)

एक अच्छे टेबल-पढ़ने वाले शेफ को इस बात से फर्क नहीं पड़ना चाहिए कि आप कॉलम (फीचर्स) या रो (लोग) को इधर-उधर करते हैं। यदि आप "आयु" और "आय" को बदलते हैं, तो भविष्यवाणी वही रहनी चाहिए।

  • समस्या: TabPFNv2 और TabICLv2 में एक हल्का सा पूर्वाग्रह (bias) है। वे गुप्त रूप से कॉलम के क्रम की परवाह करते हैं क्योंकि उन्हें विशिष्ट स्थानों पर ध्यान देने के लिए सिखाया गया है।
  • समाधान: लेखकों ने कोड में एक छोटा सा "स्विच" (पोजीशनल एनकोडिंग हटाना) पाया जिसने इन शेफों को क्रम के प्रति पूरी तरह उदासीन बना दिया। आश्चर्यजनक रूप से, इस स्विच को बंद करने से उनकी सटीकता पर कोई बुरा प्रभाव नहीं पड़ा। यह यह महसूस करने जैसा था कि शेफ ने एक ऐसी टोपी पहनी थी जिससे उन्हें लगा कि क्रम महत्वपूर्ण है, लेकिन एक बार जब उन्होंने टोपी उतार दी, तो वे उतने ही अच्छे से खाना बनाने लगे।
  • शेफ Mitra पहले से ही परफेक्ट था; इसे क्रम को अनदेखा करने के लिए ही बनाया गया था, इसलिए इसे किसी सुधार की आवश्यकता नहीं थी।

4. "कोलैप्स" ट्रैप (पतन का जाल)

एक डर था कि यदि आप इन शेफों को एक ऐसा टेबल देते हैं जहाँ दो कॉलम समान हों (जैसे "इंच में ऊंचाई" और "सेंटीमीटर में ऊंचाई"), तो वे भ्रमित हो सकते हैं और दो पूरी तरह से अलग लोगों को एक ही व्यक्ति मान सकते हैं। इसे "रिप्रेजेंटेशन कोलैप्स" कहा जाता है।

  • निष्कर्ष: लेखकों ने इस परीक्षण के साथ तनाव परीक्षण (stress test) किया। उन्होंने पाया कि वर्तमान मॉडलों में इन-बिल्ट सुरक्षा जाल (जैसे विशेष ग्रुपिंग ट्रिक्स) हैं जो इस कोलैप्स को रोकते हैं। हालाँकि, यदि आप उन सुरक्षा जालों को हटा देते हैं, तो मॉडल कोलैप्स हो जाते हैं।
  • आश्चर्य: शेफ Mitra के पास कोई सुरक्षा जाल नहीं है, फिर भी यह कोलैप्स नहीं होता है। यह सुझाव देता है कि जिस तरह से यह जानकारी को प्रोसेस करता है (उत्तर कुंजी को डेटा के ठीक बगल में रखना), वह इस विशिष्ट भ्रम के खिलाफ स्वाभाविक रूप से मजबूत है।

5. "हैकर" हमले

अंत में, लेखों ने शेफ को विशिष्ट पहेलियों के साथ धोखा देने की कोशिश की जो उनके विशिष्ट रेसिपी को तोड़ने के लिए डिज़ाइन की गई थीं।

  • "हब" हमला: उन्होंने मेमोरी बैंक के सबसे लोकप्रिय "पड़ोसियों" के लेबल बदल दिए। चूंकि TabPFNv2 और Mitra पड़ोसियों के साथ वोटिंग करने पर भरोसा करते हैं, इसलिए इसने वोट को जहरीला बना दिया और उन्हें विफल कर दिया।
  • "रैंक" हमला: उन्होंने नंबरों को इस तरह बदला कि क्रम तो वही रहा, लेकिन उनके बीच की दूरी नष्ट हो गई (उदाहरण के लिए, 1 और 2 के बीच का अंतर बहुत बड़ा कर दिया, और 2 और 3 के बीच का अंतर बहुत छोटा)। चूंकि TabICLv2 अपने "औसत प्रोटोटाइप" से सटीक दूरी मापने पर निर्भर करता है, इसने इसे बुरी तरह धोखा दिया।
  • परिणाम: प्रत्येक शेफ उस तरह से विफल हुआ जो उनकी विशिष्ट रेसिपी से पूरी तरह मेल खाता था। इसने पुष्टि की कि लेखकों ने यह सही ढंग से समझा है कि प्रत्येक मॉडल कैसे काम करता है।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर निष्कर्ष निकालता है कि जबकि ये मॉडल परीक्षणों पर एक ही स्कोर प्राप्त करते हैं, वे मौलिक रूप से अलग मशीनें हैं।

  • TabPFNv2 और Mitra "रिट्रीवल" (खोज) मशीनें हैं (वे समान उदाहरण ढूंढते हैं और वोट करते हैं)।
  • TabICLv2 एक "क्लस्टरिंग" मशीन है (यह औसत की तुलना करता है)।

लेखक सुझाव देते हैं कि अगली पीढ़ी के इन मॉडल्स के लिए, हमें उन्हें शेफ Mitra की तरह बनाना चाहिए: उन्हें स्वाभाविक रूप से कॉलम के क्रम को अनदेखा करने वाला बनाना चाहिए, उत्तर कुंजी को डेटा के ठीक बगल में रखना चाहिए, और एक ऐसा वोटिंग सिस्टम उपयोग करना चाहिए जो नाजुक दूरी मापन (distance measurements) पर निर्भर न हो। यह उन्हें अधिक मजबूत, सटीक और हैकर्स द्वारा ठगे जाने से बचाने वाला बनाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →