← नवीनतम पेपर
💬 NLP

Evaluating Latent Knowledge of Public Tabular Datasets in Large Language Models

यह शोध पत्र टैबुलर डेटासेट पर लार्ज लैंग्वेज मॉडल्स में डेटा संदूषण (data contamination) का पता लगाने के लिए नियंत्रित क्वेरी रूपांतरणों और सांख्यिकीय परीक्षणों का उपयोग करने वाले एक नवीन ढांचे का प्रस्ताव करता है, जो यह प्रकट करता है कि आठ में से चार व्यापक रूप से उपयोग किए जाने वाले डेटासेट्स पर प्रदर्शन, वास्तविक सामान्यीकरण के बजाय पूर्व प्रदर्शन (prior exposure) के कारण बढ़ा हुआ होने की संभावना है।

मूल लेखक: Matteo Silvestri, Fabiano Veglianti, Flavio Giorgi, Fabrizio Silvestri, Gabriele Tolomei

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matteo Silvestri, Fabiano Veglianti, Flavio Giorgi, Fabrizio Silvestri, Gabriele Tolomei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक कक्षा को अंतिम परीक्षा दे रहे हैं (जो कि बहुत बुद्धिमान छात्र हैं, यानी लार्ज लैंग्वेज मॉडल्स या LLMs)। आप यह जानना चाहते हैं कि क्या वे वास्तव में विषय को समझते हैं या उन्होंने केवल पिछले वर्ष के प्रश्न पत्र की उत्तर कुंजी (answer key) रट ली है।

AI की दुनिया में, इसे डेटा कंटैमिनेशन (Data Contamination) कहा जाता है। यह तब होता है जब एक AI मॉडल "चीटिंग" करता है क्योंकि उसने अपने प्रशिक्षण चरण (training phase) के दौरान परीक्षण के प्रश्नों को देख लिया होता है।

यह शोध पत्र इस बारे में है कि कैसे AI मॉडल्स को टेबुलर डेटा (डेटा जो पंक्तियों और कॉलमों में व्यवस्थित होता है, जैसे स्प्रेडशीट) पर चीटिंग करते हुए पकड़ने का एक नया, चतुर तरीका खोजा गया है, जो पिछले परीक्षण तरीकों में एक बड़ी कमी थी।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "चीट शीट" बनाम वास्तविक सीखना

पहले, शोधकर्ता AI को पकड़ने के लिए उसे डेटा की विशिष्ट पंक्तियों को शब्द-दर-शब्द सुनाने के लिए कहते थे।

  • पुराना तरीका: कल्पना कीजिए कि एक छात्र से पूछना, "सूची में 45वें व्यक्ति का नाम क्या था?" यदि वह नाम बताता है, तो उसने चीटिंग की है। यदि वह नहीं बताता, तो वह पास हो जाता है।
  • कमी: यह धोखा देने के लिए बहुत आसान है। एक बुद्धिमान छात्र सूची के पैटर्न को याद कर सकता है (जैसे, "उच्च वेतन वाले लोगों के पास आमतौर पर PhD होती है") बिना विशिष्ट नामों को रटे। वे बिना "चीट शीट" जेब में रखे भी सही उत्तर दे सकते हैं। पुराने परीक्षण बहुत सतही थे; वे सूक्ष्म चीटिंग को पकड़ने में विफल रहे।

2. समाधान: "आकार बदलने वाला" (Shape-Shifting) परीक्षण

लेखकों ने एक ढांचा तैयार किया है जो एक जादुई आकार बदलने वाले परीक्षण की तरह काम करता है। वे एक वास्तविक डेटासेट (वास्तविक संस्करण) लेते हैं और यह देखने के लिए इसके तीन "ट्रिक" संस्करण बनाते हैं कि AI कैसे प्रतिक्रिया देता है।

इसे एक जासूस के अपराध स्थल के ज्ञान का परीक्षण करने जैसा समझें:

  • वास्तविक संस्करण (The Real Version): मूल अपराध स्थल की फोटो।
  • "जैसा है वैसा ही" संस्करण (The "Like" Version - द शफल): कल्पना कीजिए कि संदिग्धों के लॉकर से सभी कपड़े निकाल लिए गए और उन्हें बेतरतीब ढंग से मिला दिया गया। कपड़ों के प्रकार वही हैं, लेकिन कोई भी अपने मूल कपड़ों में नहीं है। यदि AI अभी भी सही उत्तर देता है, तो वह केवल सामान्य फैशन ट्रेंड्स को जानता है, न कि विशिष्ट अपराध को।
  • "बदला हुआ" संस्करण (The "Swapped" Version - द कोड): कल्पना कीजिए कि पुलिस रिपोर्ट में हर नाम को एक कोड (संदिग्ध A, संदिग्ध B) से बदल दिया गया है और हर स्थान को एक नंबर से। संबंध वही हैं, लेकिन लेबल गायब हैं। यदि AI इसे सही ढंग से समझता है, तो वह मामले के तर्क (logic) को समझता है, न कि केवल नामों को।
  • "धुंधला" संस्करण (The "Obfuscated" Version - द ब्लर): कल्पना लीजिए कि फोटो इतनी धुंधली है और टेक्स्ट इतना बिखरा हुआ है कि आप कोई शब्द नहीं पढ़ सकते या किसी चेहरे को पहचान नहीं सकते। यदि AI इसे सही ढंग से करता है, तो वह शुद्ध तर्क का उपयोग कर रहा है।

3. दो खेल जो वे खेलते हैं

AI का परीक्षण करने के लिए, वे इन आकार बदले हुए संस्करणों के साथ दो विशिष्ट खेल खेलते हैं:

  • खेल A: "खाली स्थान भरें" (Completion)

    • सेटअप: वे AI को डेटा की एक पंक्ति दिखाते हैं लेकिन उसका एक हिस्सा छिपा देते हैं (जैसे किसी व्यक्ति का पद छिपा देना)।
    • प्रश्न: "अन्य जानकारी के आधार पर, गायब पद क्या है?"
    • जाल: यदि AI वास्तविक संस्करण पर सही अनुमान लगाता है लेकिन शफल (Shuffle) या कोड (Code) संस्करणों पर विफल रहता है, तो इसका मतलब है कि उसने केवल सामान्य नियम नहीं सीखे; उसने विशेष रूप से उस व्यक्ति की फाइल को रट लिया था। यही कंटैमिनेशन है।
  • खेल B: "नकली को पहचानें" (Existence)

    • सेटअप: वे AI को डेटा की पाँच अलग-अलग पंक्तियाँ दिखाते हैं। एक वास्तविक है; चार नकली हैं लेकिन दिखने में बहुत समान हैं।
    • प्रश्न: "इनमें से कौन सा वास्तव में मूल डेटासेट में मौजूद है?"
    • जाल: यदि AI वास्तविक संस्करण में सही पहचान कर लेता है लेकिन नाम बदलने (Obfuscated) पर भ्रमित हो जाता है, तो यह साबित करता है कि उसने उस विशिष्ट "फिंगरप्रिंट" को पहचान लिया था जिसे उसने पहले देखा था।

4. परिणाम: चीटर्स को पकड़ना

शोधकर्ताओं ने 7 विभिन्न AI मॉडल्स का उपयोग करके 8 प्रसिद्ध डेटासेट्स (जैसे टाइटैनिक पैसेंजर लिस्ट या एडल्ट इनकम डेटा) पर इनका परीक्षण किया।

  • पुराना परीक्षण (याद करना): अधिकांश डेटासेट्स पर चीटिंग खोजने में विफल रहा। यह छात्र को पूरा फोन बुक सुनाने के लिए कहने जैसा था; उन्होंने कहा "मुझे नहीं पता," इसलिए शिक्षक ने सोचा कि वे ईमानदार थे।
  • नया परीक्षण: शोधकर्ताओं ने 8 में से 4 डेटासेट्स पर AI को "चीटिंग" करते हुए पकड़ा (जिसमें प्रसिद्ध टाइटैनिक और एडल्ट डेटासेट्स शामिल हैं)।
    • AI ने वास्तविक संस्करण पर अद्भुत प्रदर्शन किया (विशिष्ट पंक्तियों को जानते हुए)।
    • लेकिन जब उन्होंने डेटा को बदला (Swapped/Obfuscated), तो AI का प्रदर्शन काफी गिर गया।
    • निष्कर्ष: AI केवल स्मार्ट नहीं था; उसने इस विशिष्ट डेटा को पहले देखा था और विशिष्ट संयोजनों को रट लिया था।

5. यह क्यों महत्वपूर्ण है?

यह एक बड़ी बात है क्योंकि:

  1. स्कोर बढ़ा-चढ़ाकर दिखाए जाते हैं: यदि किसी AI को बेंचमार्क पर उच्च स्कोर मिलता है क्योंकि उसने उत्तर रट लिए हैं, तो हम सोचते हैं कि वह वास्तव में जितना स्मार्ट है उससे कहीं अधिक स्मार्ट है। यह एक छात्र को गणित सीखने के बजाय परीक्षा रटने के कारण 'A' ग्रेड प्राप्त करने जैसा है।
  2. मॉडल का आकार मायने रखता है: AI मॉडल जितना बड़ा था, वह उतना ही बेहतर "चीटिंग" करने में सक्षम था। यह सुझाव देता है कि जैसे-जैसे मॉडल विशाल होते जाते हैं, उनके द्वारा प्रशिक्षण के दौरान गलती से टेस्ट डेटा को निगल लेने की संभावना अधिक होती है।
  3. विश्वास (Trust): हमें यह जानने की आवश्यकता है कि क्या एक AI वास्तव में सीख रहा है या केवल याद कर रहा है। यह "आकार बदलने वाला" परीक्षण एक आवर्धक लेंस (magnifying glass) है जो उस चीटिंग को उजागर करता है जिसे पुराने परीक्षण नहीं पकड़ सके।

संक्षेप में: लेखकों ने AI डेटा के लिए एक "झूठ पकड़ने वाला यंत्र" (lie detector) बनाया है। इसके बजाय कि वे पूछें "क्या आपको यह सटीक वाक्य याद है?", वे पूछते हैं, "क्या आपको यह विशिष्ट पैटर्न याद है, भले ही हम शब्दों को बदल दें?" उत्तर अक्सर "हाँ" होता है, जो यह साबित करता है कि कई लोकप्रिय AI मॉडल्स अब तक अपनी परीक्षाओं में चीटिंग कर रहे थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →