← नवीनतम पेपर
💬 NLP

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

ड्रीम टीम ने मशीन-जनित कोड के लिए मजबूत आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन प्राप्त करने हेतु संतुलित सैंपलिंग और कंजर्वेटिव फाइन-ट्यूनिंग के साथ एक SALSA-शैली के सिंगल-पास ऑटोरेग्रेसिव क्लासिफिकेशन फ्रेमवर्क का प्रस्ताव दिया है, जो SemEval-2026 टास्क 13 लीडरबोर्ड पर CodeBERT बेसलाइन से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो यह पता लगाने की कोशिश कर रहे हैं कि छात्र का होमवर्क छात्र ने खुद लिखा है या किसी बहुत ही बुद्धिमान AI से कॉपी किया गया है। यह वह चुनौती है जिसे इस शोध पत्र के लेखकों ने SemEval-2026 Task 13 नामक प्रतियोगिता के लिए हल किया।

यहाँ इस कहानी का वर्णन है कि उन्होंने इसे कैसे हल किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

समस्या: "गिरगिट" वाला कोड (The "Chameleon" Code)

अतीत में, AI द्वारा लिखे गए कोड का पता लगाना जंगल में गिरगिट को पहचानने जैसा था। AI कई अलग-अलग भाषाओं (जैसे Python, Java, या C++) और कई अलग-अलग कार्यों के लिए कोड लिख सकता था। यदि आप एक डिटेक्टर को Python में AI कोड पहचानने के लिए प्रशिक्षित करते, तो वह अक्सर विफल हो जाता जब AI ने Java में स्विच किया। डिटेक्टर बहुत अधिक "विशेषज्ञता" (specialized) वाला था और नई, अनदेखी स्थितियों को नहीं संभाल पाता था।

समाधान: "एक शब्द वाले उत्तर" का खेल (The "One-Word Answer" Game)

Dream Security Ltd. की टीम ने इस खेल को खेलने का एक नया तरीका प्रस्तावित किया, जिसे वे SALSA (Single-pass Autoregressive LLM Structured Classification) कहते हैं।

एक सामान्य AI चैटबॉट की कल्पना एक बातूनी तोते की तरह करें। यदि आप उससे पूछते हैं, "क्या यह कोड AI-लिखित है?", तो वह कह सकता है, "खैर, सिंटैक्स और वेरिएबल नामों को देखते हुए, मुझे लगता है कि यह शायद AI है क्योंकि..." और फिर वह एक पूरा पैराग्राफ लिख देता है। यह बहुत अव्यवस्थित है और ग्रेडिंग करना कठिन है।

SALSA नियमों को बदल देता है:

  1. प्रॉम्प्ट (The Prompt): वे AI को एक कोड स्निपेट देते हैं और एक बहुत ही विशिष्ट प्रश्न पूछते हैं: "क्या यह मशीन-जनित (machine-generated) है?"
  2. प्रतिबंध (The Constraint): वे AI को बताते हैं, "आपको केवल एक एकल शब्द के साथ उत्तर देने की अनुमति है: या तो '0' (नहीं) या '1' (हाँ)।"
  3. परिणाम (The Result): एक लंबे निबंध के बजाय, AI को एक त्वरित और निर्णायक चुनाव करने के लिए मजबूर किया जाता है। यह एक जज से 10 पन्नों का कानूनी राय लिखने के बजाय केवल एक बार हथौड़ा (gavel) गिराने के लिए कहने जैसा है।

प्रशिक्षण: "कम ही अधिक है" (The Training: "Less is More")

आमतौर पर, जब आप किसी कंप्यूटर मॉडल को नया कार्य सिखाते हैं, तो आप उसे लंबे समय तक तब तक ड्रिल करा सकते हैं जब तक कि वह आपके दिए गए विशिष्ट उदाहरणों को रट न ले। लेकिन लेखकों ने महसूस किया कि यदि आप मॉडल को विशिष्ट उदाहरणों पर बहुत अधिक ड्रिल करते हैं, तो वह नई स्थितियों को संभालने की क्षमता खो देता है (इसे "overfitting" कहा जाता है)।

उन्होंने एक "रूढ़िवादी प्रशिक्षण" (Conservative Training) दृष्टिकोण का उपयोग किया:

  • लर्निंग रेट (The Learning Rate): कल्पना कीजिए कि लर्निंग रेट रेडियो पर वॉल्यूम नॉब की तरह है। उन्होंने वॉल्यूम को बहुत कम कर दिया। इसने मॉडल को उसके मौजूदा ज्ञान पर चिल्लाए बिना नया कार्य सीखने की अनुमति दी।
  • अवधि (The Duration): उन्होंने मॉडल को केवल एक बार (एक इपोक/epoch) उदाहरणों का अध्ययन करने दिया। उन्होंने पाया कि बहुत लंबे समय तक अध्ययन करने से मॉडल एक सामान्य विशेषज्ञ (generalist) होने की क्षमता खो देता है और केवल प्रशिक्षण डेटा में बहुत अधिक विशिष्ट हो जाता है।
  • संतुलित आहार (Balanced Diet): प्रशिक्षण डेटा में Python कोड बहुत अधिक था जबकि Java या C++ में कम। मॉडल को "केवल-Python" विशेषज्ञ बनने से रोकने के लिए, उन्होंने इसे हर भाषा की समान मात्रा में "खिलाने" के लिए मजबूर किया, भले ही इसके लिए उन्हें कुछ अतिरिक्त Python डेटा को फेंकना पड़ा हो।

परिणाम: बेसलाइन को हराना (The Results: Bepping the Baseline)

प्रतियोगिता में एक "बेसलाइन" डिटेक्टर (CodeBERT) था जो एक पुराने, जंग लगे मेटल डिटेक्टर जैसा था। नई, अनदेखी भाषाओं पर परीक्षण करने पर इसका स्कोर 0.305 (बहुत खराब) रहा।

Dream Security टीम का SALSA सिस्टम एक हाई-टेक, अनुकूलन योग्य स्कैनर की तरह था।

  • जीरो-शॉट (Zero-Shot - बिना प्रशिक्षण के): विशेष प्रशिक्षण के बिना भी, उनका AI काफी अच्छा था (लगभग 0.5)।
  • प्रशिक्षण के साथ (With Training): उनके सावधानीपूर्ण, "एक-इपोक" प्रशिक्षण के बाद, उनके सर्वश्रेष्ठ सिस्टम ने 0.789 का स्कोर प्राप्त किया।

यह एक विशाल उछाल है। इसका मतलब है कि उनका सिस्टम AI कोड को पहचानने में बहुत बेहतर है, भले ही वह कोड किसी ऐसी भाषा या शैली में लिखा गया हो जिसे उसने पहले कभी नहीं देखा है।

पेच (The Catch)

शोध पत्र एक अजीब तथ्य नोट करता है: प्रशिक्षण से पहले, AI बहुत शर्मीला था। वह गलती करने से इतना डरता था कि वह लगभग हमेशा "मानव-लिखित" (0) का अनुमान लगाता था, भले ही वह AI द्वारा लिखा गया हो। इसने इसे उच्च "प्रिसिजन" (जब इसने AI का अनुमान लगाया, तो यह सही था) लेकिन खराब "रिकॉल" (इसने लगभग सभी AI कोड को मिस कर दिया) वाला दिखाया। प्रशिक्षण ने इस शर्मीलेपन को ठीक करने में मदद की, जिससे मॉडल को साहसी बनना सिखाया गया ताकि वह AI देखते ही "हाँ" कह सके।

संक्षेप में: उन्होंने एक ऐसा डिटेक्टर बनाया जो निबंध नहीं लिखता, न ही पाठ्यपुस्तक को रटता है, और न ही नई भाषाओं से अभिभूत होता है। यह बस कोड को देखता है, एक पल के लिए सोचता है, और एक सटीक "हाँ" या "नहीं" देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →