← नवीनतम पेपर
💬 NLP

SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

यह शोध पत्र SrDetection को प्रस्तुत करता है, जो एक स्व-संदर्भित ढांचा (self-referential framework) है जो मूल बेंचमार्क नमूनों के विरुद्ध उनके अर्थपूर्ण रूप से समकक्ष वेरिएंट्स पर मॉडल के प्रदर्शन की तुलना करके कोड लार्ज लैंग्वेज मॉडल्स में डेटा लीकेज की पहचान करता है, और बाहरी थ्रेशोल्ड या मालिकाना प्रशिक्षण डेटा पर निर्भर किए बिना ग्रे-बॉक्स और ब्लैक-बॉक्स दोनों सेटिंग्स में मौजूदा विधियों की तुलना में काफी अधिक पहचान सटीकता प्राप्त करता है।

मूल लेखक: Shuaimin Li, Liyang Fan, Zeyang Li, Zhuoyue Wan, Yufang Lin, Shiwen Ni, Feiteng Fang, Hamid Alinejad-Rokny, Yuanfeng Song, Kun Jing, Chen Jason Zhang, Min Yang

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuaimin Li, Liyang Fan, Zeyang Li, Zhuoyue Wan, Yufang Lin, Shiwen Ni, Feiteng Fang, Hamid Alinejad-Rokny, Yuanfeng Song, Kun Jing, Chen Jason Zhang, Min Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र की अंतिम परीक्षा का मूल्यांकन करने की कोशिश कर रहे हैं। आप यह जानना चाहते हैं कि क्या छात्र वास्तव में विषय को समझता है या उसने केवल उस चीट शीट (नकल के नोट्स) को रट लिया है जो उसे पहले मिली थी। आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से Code Large Language Models (Code LLMs) में, इस "चीट शीट" को डेटा लीकेज (data leakage) कहा जाता है। यह तब होता है जब एक मॉडल अनजाने में प्रशिक्षण चरण (training phase) के दौरान सटीक प्रश्नों को "पढ़" लेता है, जिससे वह वास्तव में जितना होशियार है, उससे कहीं अधिक स्मार्ट दिखने लगता है।

यह शोध पत्र एक नया टूल पेश करता है जिसे SrDetection कहा जाता है ताकि इस धोखाधड़ी को पकड़ा जा सके। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: टूटी हुई स्टॉपवॉच और गायब कुंजी (Missing Answer Key)

वर्तमान में, एक चीटिंग करने वाले AI को पकड़ने की कोशिश करना एक ऐसे पहेली को सुलझाने जैसा है जिसके टुकड़े गायब हैं।

  • "गायब उत्तर कुंजी" की समस्या (The "Missing Answer Key" Problem): यह जांचने के लिए कि क्या मॉडल ने किसी प्रश्न को रटा है, आपको आमतौर पर मॉडल की गुप्त 'ट्रेनिंग डायरी' (वह डेटा जिससे उसने सीखा है) देखने की आवश्यकता होती है। लेकिन कंपनियाँ इन डायरियों को निजी रखती हैं। हम इसके अंदर नहीं देख सकते।
  • "टूटी हुई स्टॉपवॉच" की समस्या (The "Broken Stopwatch" Problem): कुछ लोग कोड लिखे जाने की तारीख की जांच करके यह अनुमान लगाने की कोशिश करते हैं कि क्या मॉडल ने किसी प्रश्न को देखा था। यदि कोड मॉडल के प्रशिक्षित होने के बाद लिखा गया था, तो वे मान लेते हैं कि मॉडल उसे नहीं देख सकता था। लेकिन यह अविश्वसनीय है क्योंकि कोड को अक्सर पुराने प्रोजेक्ट्स से कॉपी, पेस्ट और पुन: उपयोग किया जाता है, जिससे तारीखें भ्रमित करने वाली हो जाती हैं।
  • "मनमानी रेखा" की समस्या (The "Arbitrary Line" Problem): अन्य विधियाँ एक निश्चित नियम सेट करने की कोशिश करती हैं (जैसे "यदि मॉडल 90% सुनिश्चित है, तो यह धोखाधड़ी है")। लेकिन कोड जटिल होता है; जो एक प्रकार के कोड के लिए उच्च स्कोर दिखता है, वह दूसरे के लिए सामान्य हो सकता है। हर चीज़ के लिए एक ही नियम सेट करना अक्सर विफल रहता है।

समाधान: "स्व-संदर्भित" दर्पण (The "Self-Referential" Mirror)

लेखकों ने SrDetection बनाया है, जो एक चतुर जासूस की तरह काम करता है जिसे न तो गुप्त डायरी की आवश्यकता है और न ही स्टॉपवॉच की। इसके बजाय, यह एक दर्पण का उपयोग करता है।

यहाँ उपमा दी गई है:
कल्पive कि आपके पास कागज के एक टुकड़े पर लिखा एक विशिष्ट वाक्य है: "The quick brown fox jumps over the lazy dog."

  • पुराना तरीका: आप AI से पूछते हैं, "क्या तुम यह वाक्य जानते हो?" यदि वह बहुत आत्मविश्वास के साथ "हाँ" कहता है, तो आपको संदेह होता है कि उसने इसे रट लिया है। लेकिन हो सकता है कि यह केवल एक बहुत ही सामान्य वाक्य हो, इसलिए आत्मविश्वास पूर्ण प्रमाण नहीं है।
  • SrDetection का तरीका: जासूस उस मूल वाक्य को लेता है और उसके 10 थोड़े अलग संस्करण बनाता है जो बिल्कुल वही अर्थ रखते हैं लेकिन सतह पर अलग दिखते हैं।
    • मूल: "The quick brown fox jumps..."
    • वेरिएंट 1: "The speedy brown fox leaps..."
    • वेरिएंट 2: "A fast brown fox hops..."
      (तर्क समान है, लेकिन शब्द बदल दिए गए हैं।)

फिर, जासूस AI को उन सभी को प्रोसेस करने के लिए कहता है।

"अहा!" क्षण (The "Aha!" Moment):
यदि AI ने मूल वाक्य को रट (memorized) लिया है, तो वह मूल संस्करण को बहुत आसानी से पूरा कर लेगा (क्योंकि उसने इसे पहले देखा है) लेकिन वेरिएंट्स (अलग संस्करणों) पर वह लड़खड़ा सकता है या हिचकिचा सकता है (क्योंकि उसने उन विशिष्ट शब्द संयोजनों को नहीं देखा है)।

  • धोखाधड़ी (The Cheat): मूल संस्करण अपने भाई-बहनों की तुलना में बहुत आसान है।
  • ईमानदार छात्र (The Honest Student): मूल और वेरिएंट सभी लगभग एक ही कठिनाई के होते हैं क्योंकि AI केवल तर्क को समझ रहा है, न कि एक स्क्रिप्ट को दोहरा रहा है।

यह दो मोड में कैसे काम करता है

शोध पत्र दिखाता है कि यह दो अलग-अलग परिदृश्यों में कैसे काम करता है:

  1. ग्रे-बॉक्स (The "Inside Look"): आप AI के आंतरिक आत्मविश्वास स्कोर देख सकते हैं (जैसे उसकी धड़कन देखना)। SrDetection यह जांचता है कि क्या मूल कोड AI की "धड़कन" को शांत और स्थिर बनाता है, जबकि वेरिएंट उसे घबरा देते हैं।
  2. ब्लैक-बॉक्स (The "Outside Look"): आप केवल AI द्वारा दिया गया अंतिम उत्तर देख सकते हैं। SrDetection यह जांचता है कि क्या मूल कोड के लिए AI का उत्तर एक सटीक, हूबहू मिलान है, जबकि इसके वेरिएंट के उत्तर थोड़े कम सटीक या कम व्यवस्थित हो सकते हैं।

परिणाम: एक बेहतर जासूस

लेखकों ने एक विशेष "प्रशिक्षण मैदान" (testbed) बनाया जहाँ वे ठीक से नियंत्रित कर सकते थे कि AI ने कौन सा कोड देखा और कौन सा नहीं, ताकि केवल इस नए टूल का परीक्षण किया जा सके।

  • स्कोर: अन्य विधियों की तुलना में, SrDetection नेв चेaters (धोखेबाजों) को पकड़ने में बहुत बेहतर प्रदर्शन किया। इसने "इंसाइड लुक" परिदृश्य में सटीकता (F1 स्कोर) में लगभग 21 अंक और "आउटसाइड लुक" परिदृश्य में 14 अंक का सुधार किया।
  • कोई निश्चित नियम नहीं: अन्य उपकरणों के विपरीत, इसे किसी पूर्व-निर्धारित "पास/फेल" रेखा की आवश्यकता नहीं है। यह बस मूल की तुलना उसके अपने भाई-बहनों से करता है। यदि मूल संस्करण संदिग्ध रूप से आसान खड़ा होता है, तो यह उसे फ्लैग (चिह्नित) कर देता है।

उन्होंने वास्तविक दुनिया में क्या पाया

शोधकर्ताओं ने 15 लोकप्रिय कोड AI मॉडल का चार प्रसिद्ध कोडिंग बेंचमार्क पर परीक्षण किया। उन्होंने पाया कि:

  • कुछ मॉडलों में विशिष्ट परीक्षणों (जैसे APPS और BigCodeBench डेटासेट) पर "धोखाधड़ी" का उच्च स्तर था।
  • धोखाधड़ी की मात्रा विशिष्ट परीक्षण के आधार पर बहुत भिन्न होती है, जो यह साबित करती है कि डेटा लीकेज के लिए एक ही धारणा (one-size-fits-all assumption) गलत है।

सारांश

SrDetection एक नया तरीका है जिससे उन AI मॉडलों को पकड़ा जा सकता है जिन्होंने परीक्षा के प्रश्नों को रट लिया है। गुप्त डेटा या तारीखों का अनुमान लगाने के बजाय, यह कोड के "जुड़वां" बनाता है ताकि यह देखा जा सके कि क्या मॉडल मूल के साथ अपने जुड़वाओं के साथ अलग व्यवहार करता है। यदि मॉडल मूल के साथ बहुत अधिक सहज है, तो इसकी संभावना है कि वह धोखाधड़ी कर रहा है। यह हमारे AI मूल्यांकन को बहुत अधिक निष्पक्ष और विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →