Spiking the training data to correct for test set contamination
यह शोध पत्र डेटा संदूषण (डेटा कंटैमिनेशन) के कारण बढ़े हुए टेस्ट स्कोर को ठीक करने के लिए एक विधि प्रस्तावित करता है, जिसमें मेमोराइजेशन प्रेडिक्टर्स (स्मरण भविष्यवक्ताओं) को कैलिब्रेट करने के लिए ज्ञात टेस्ट उदाहरणों के साथ प्रशिक्षण डेटा को जानबूझकर "स्पाइकिंग" (स्पाइक) किया जाता है, जिनका उपयोग फिर मॉडल प्रदर्शन मेट्रिक्स को सांख्यिकीय रूप से समायोजित करने के लिए किया जाता है।