Test of Time: Rethinking Temporal Signal of Benchmark Contamination
यह शोध पत्र इस धारणा को चुनौती देता है कि कटऑफ के बाद प्रदर्शन में गिरावट (post-cutoff performance decay) विश्वसनीय रूप से बेंचमार्क संदूषण (benchmark contamination) का संकेत देती है, और लाइवकोडबेंच (LiveCodeBench) तथा इन्फ्लुएंस फंक्शन्स (influence functions) के विश्लेषण के माध्यम से यह प्रदर्शित करता है कि यह टेम्पोरल सिग्नल प्रश्न निर्माण के प्रति अत्यधिक संवेदनशील है और इसे LLM-जनित रूपांतरणों द्वारा कृत्रिम रूप से प्रेरित या हटाया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Test of Time: Rethinking Temporal Signal of Benchmark Contamination" पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ तोड़कर समझाया गया है।
मुख्य विचार: "ताज़गी" (Freshness) टेस्ट दोषपूर्ण है
कल्पना कीजिए कि आप एक शिक्षक हैं जो यह देखने की कोशिश कर रहे हैं कि क्या किसी छात्र ने फाइनल परीक्षा में नकल की है। शिक्षक इस्तेमाल करने वाला एक सामान्य तरीका यह है कि वे देखते हैं कि क्या छात्र ने पिछले साल की किताब के सवालों (जिन्हें उसने याद कर लिया होगा) के मुकाबले इस साल की नई किताब के सवालों पर बेहतर प्रदर्शन किया है (जो छात्र के पढ़ाई बंद करने के बाद रिलीज़ हुई थी)।
यदि छात्र पुराने सवालों पर उच्च अंक प्राप्त करता है लेकिन नए सवालों पर कम, तो शिक्षक मान लेता है: "आहा! इसने पुरानी किताब को रट लिया है लेकिन इसे विषय की वास्तविक समझ नहीं है।" स्कोर में इस गिरावट को "पोस्ट-कटऑफ परफॉरमेंस डिके" (post-cutoff performance decay) कहा जाता है।
लंबे समय तक, शोधकर्ताओं ने इस "फ्रेशनेस टेस्ट" का उपयोग उन AI मॉडलों को पकड़ने के लिए किया है जिन्होंने गुप्त रूप से अपने ट्रेनिंग डेटा को रट लिया था (जिसे बेंचमार्क कंटैमिनेशन की समस्या कहा जाता है)। यदि कोई AI नए सवालों पर खराब प्रदर्शन करता है, तो इसे धोखाधड़ी का प्रमाण माना जाता था।
यह पेपर तर्क देता है कि यह टेस्ट अविश्वसनीय है। लेखक दिखाते हैं कि टेस्ट का परिणाम पूरी तरह से इस बात पर निर्भर करता है कि सवाल कैसे लिखे गए हैं, न कि केवल इस पर कि क्या AI ने उत्तरों को रट लिया है।
प्रयोग: "वही सूप, अलग कटोरे"
अपने बिंदु को सिद्ध करने के लिए, शोधकर्ताओं ने एक बहुत ही विशिष्ट प्रयोग तैयार किया जिसमें उन्होंने एक ही "सामग्री" (वैज्ञानिक शोध पत्रों से स्रोत सामग्री) का उपयोग किया लेकिन उन्हें दो अलग-अलग "कटोरों" (प्रश्न प्रारूपों) में परोसा।
1. कटोरा A: "रिक्त स्थान भरें" (Cloze) वाले प्रश्न
कल्पना कीजिए कि आप एक पाठ्यपुस्तक से एक वाक्य लेते हैं और सबसे महत्वपूर्ण शब्दों को काले टेप से ढक देते हैं, और छात्र को खाली स्थान भरने के लिए कहते हैं।
- उदाहरण: "फ्रांस की राजधानी [______] है।"
- परिणाम: जब AI ने इन सवालों को देखा, तो वह फ्रेशनेस टेस्ट में फेल हो गया। इसने पुराने सवालों पर उच्च स्कोर किया और नए सवालों पर कम। यह बिल्कुल नकल करने जैसा लग रहा था। AI स्पष्ट रूप से उस विशिष्ट टेक्स्ट को याद कर रहा था जिसे उसने पहले देखा था।
2. कटोरा B: "AI-द्वारा पुनर्गठित" (AI-Rewritten) प्रश्न
अब, कल्पना कीजिए कि आप उसी सटीक वाक्य को लेते हैं और एक सुपर-स्मार्ट AI से इसे एक बिल्कुल नए, जटिल पहेली में फिर से लिखने के लिए कहते हैं, जिसमें वही तर्क हल करने की आवश्यकता होती है, लेकिन अलग शब्दों और संरचना का उपयोग होता है।
- उदाहरण: "अगर आप उस शहर की यात्रा करते हैं जो एफिल टॉवर और लूव्र के लिए जाना जाता है, तो आप अपने पासपोर्ट पर क्या नाम लिखेंगे?" (मूल वाक्य के बजाय)।
- परिणाम: जब AI ने इन पुनर्गठित सवालों को देखा, तो "फ्रेशनेस टेस्ट" गायब हो गया। AI ने "नए" सवालों पर भी "पुराने" सवालों की तरह ही अच्छा स्कोर किया।
चौंका देने वाला निष्कर्ष: भले ही AI उसी सटीक स्रोत सामग्री को देख रहा था, लेकिन सवाल को पुनर्गठित करने मात्र से "धोखाधड़ी का संकेत" (नए सवालों पर स्कोर में गिरावट) गायब हो गया।
"डिटेक्टिव" प्रमाण: इन्फ्लुएंस फंक्शन्स (Influence Functions)
यह समझने के लिए कि ऐसा क्यों हुआ, शोधकर्ताओं ने एक "डिटेक्टिव टूल" का उपयोग किया जिसे इन्फ्लुएंस फंक्शन्स कहा जाता है। इसे एक फॉरेंसिक आवर्धक लेंस (magnifying glass) के रूप में सोचें जो AI से पूछता है: "आपके ट्रेनिंग लाइब्रेरी के किस विशिष्ट पृष्ठ ने इस प्रश्न का उत्तर देने में आपकी मदद की?"
- "रिक्त स्थान भरें" वाले सवालों पर: AI सीधे मूल शोध पत्र की ओर इशारा करता है। इसने कहा, "मैं यह जानता हूँ क्योंकि मैंने इस सटीक पृष्ठ को पढ़ा है।" (मेमोरी में उच्च विश्वास)।
- "AI-द्वारा पुनर्गठित" सवालों पर: AI को स्रोत की ओर इशारा करने में संघर्ष करना पड़ा। AI के लिए उत्तर को उस विशिष्ट पृष्ठ से जोड़ना बहुत कठिन था जिसे उसने याद किया था।
यह सिद्ध करता है कि प्रश्न को पुनर्गठित करने की क्रिया (चाहे किसी अन्य AI द्वारा की गई हो) प्रश्न और याद किए गए टेक्स्ट के बीच के सीधे संबंध को तोड़ देती है। AI वास्तव में बेहतर "तर्क" (reasoning) नहीं कर रहा है; बस अब वह सटीक मेमोरी मैच को ढूंढ नहीं पा रहा है।
यह क्यों मायने रखता है
पेपर निष्कर्ष निकालता है कि हम "फ्रेशनेस टेस्ट" (नए तारीखों पर स्कोर गिरने की जांच करना) को धोखाधड़ी के स्टैंडअलोन प्रमाण के रूप में भरोसा नहीं कर सकते।
- पुरानी धारणा: "यदि AI का स्कोर नए सवालों पर गिरता है, तो इसने पुराने वाले रट लिए होंगे।"
- नई वास्तविकता: "यदि AI का स्कोर नए सवालों पर गिरता है, तो ऐसा इसलिए हो सकता है क्योंकि नए सवाल ऐसे लिखे गए हैं जो पुराने वाले से बहुत अधिक मेल खाते हैं (जैसे फिल-इन-द-ब्लैंक)। यदि हम सवालों को पुनर्गठित करते हैं, तो 'चीटिंग' का संकेत गायब हो जाता है, भले ही AI के पास वही ज्ञान मौजूद हो।"
मुख्य सीख (The Takeaway)
लेखक AI अनुसंधान समुदाय को कह रहे हैं: धोखाधड़ी पकड़ने के लिए केवल एक तारीख-आधारित टेस्ट पर निर्भर रहना बंद करें।
सिर्फ इसलिए कि एक AI एक "नए" सवाल में विफल रहता है, इसका मतलब यह नहीं है कि वह दोषी है, और सिर्फ इसलिए कि वह एक "नए" सवाल को पास कर लेता है, इसका मतलब यह नहीं है कि वह निर्दोष है। आपके द्वारा टेस्ट प्रश्न लिखने का तरीका, AI की वास्तविक मेमोरी से अधिक परिणाम को बदल देता है। हमें यह जांचने के लिए बेहतर, अधिक मजबूत तरीकों की आवश्यकता है कि AI वास्तव में तर्क कर रहा है या केवल याद कर रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।