← नवीनतम पेपर
💬 NLP

KCLarity at SemEval-2026 Task 6: Encoder and Zero-Shot Approaches to Political Evasion Detection

KCLarity टीम के SemEval-2026 पेपर में राजनीतिक टालमटोल (political evasion) का पता लगाने के लिए एनकोडर-आधारित और ज़ीरो-शॉट डिकोडर-ओनली मॉडलों के उनके तुलनात्मक मूल्यांकन का विवरण दिया गया है, जिसमें यह पाया गया कि जहाँ RoBERTa-large ने सार्वजनिक परीक्षण सेट पर उत्कृष्ट प्रदर्शन किया, वहीं GPT-5.2 ने छिपे हुए मूल्यांकन सेट (hidden evaluation set) पर बेहतर सामान्यीकरण (generalization) प्रदर्शित किया।

मूल लेखक: Archie Sage, Salvatore Greco

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Archie Sage, Salvatore Greco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप टीवी पर एक गरमागरम राजनीतिक बहस देख रहे हैं। एक पत्रकार एक कठिन, विशिष्ट प्रश्न पूछता है: "क्या आपने मंगलवार को सैन्य हमले को अधिकृत किया था?"

राजनेता उत्तर देता है: "हम हमेशा अपनी सेनाओं की सुरक्षा के लिए प्रतिबद्ध हैं, और हम क्षेत्र में शांति सुनिश्चित करने के लिए अपने सहयोगियों के साथ कड़ी मेहनत कर रहे हैं।"

आप जानते हैं कि उन्होंने क्या किया। उन्होंने प्रश्न का उत्तर नहीं दिया। वे बात को घुमा रहे थे। वे बच रहे थे (evaded)

यह शोधपत्र कंप्यूटर को उस 'बचाव' को पहचानने के लिए सिखाने के बारे में है। किंग कॉलेज लंदन के शोधकर्ताओं (टीम "KCLarity") ने एक प्रतियोगिता में भाग लिया जिसका नाम SemEval-2026 है, ताकि एक ऐसा AI बनाया जा सके जो स्वचालित रूप से यह पता लगा सके कि राजनेता स्पष्ट हो रहे हैं या बच रहे हैं।

यहाँ उनके प्रयोग की कहानी सरल भाषा में दी गई है।

1. रोबोट को सिखाने के दो तरीके

टीम ने अपने AI को बचाव (evasion) को पहचानने के लिए सिखाने के दो अलग-अलग तरीके आजमाए। इन्हें एक नए कर्मचारी को प्रशिक्षण देने के दो अलग-अलग तरीकों के रूप में समझें:

  • तरीका A: सीधा दृष्टिकोण (The Direct Approach)
    उन्होंने AI को बताया: "इस उत्तर को देखो। क्या यह स्पष्ट (Clear), अनिश्चित (Ambivalent/vague), या गैर-उत्तर (Non-Reply) है? बस एक को चुनो।"
    यह एक छात्र को उसका काम दिखाए बिना सीधे अंतिम ग्रेड याद करने के लिए कहने जैसा है।

  • तरीका B: जासूसी दृष्टिकोण (The Detective Approach - विजेता)
    उन्होंने AI को बताया: "सिर्फ ग्रेड का अनुमान न लगाएं। पहले यह पहचानें कि वे कैसे बच रहे हैं। क्या वे 'विपथन' (Deflecting - विषय बदल रहे हैं) कर रहे हैं? क्या वे 'बच रहे' (Dodging - प्रश्न को अनदेखा करना) हैं? क्या वे 'आंशिक' (Partial - आधा उत्तर देना) हैं? एक बार जब आप विशिष्ट बचाव का पता लगा लेते हैं, तो हम गणितीय रूप से अंतिम ग्रेड की गणना कर सकते हैं।"
    यह छात्र को अपना काम दिखाने के लिए कहने जैसा है। टीम ने पाया कि राजनेता द्वारा इस्तेमाल किए गए विशिष्ट तरीके को समझने से AI को कुल स्पष्टता को बेहतर ढंग से समझने में मदद मिली।

2. दावेदार: "एनकोडर" बनाम "जीरो-शॉट दिग्गजों" (The "Encoders" vs. The "Zero-Shot Giants")

टीम ने दो प्रकार के AI मॉडल का परीक्षण किया, जिन्हें हम दो अलग-अलग प्रकार के एथलीट मान सकते हैं:

  • विशेष एथलीट (Encoder मॉडल्स जैसे RoBERTa):
    ये उन मैराथन धावकों की तरह हैं जिन्होंने विशेष रूप से इसी ट्रैक के लिए प्रशिक्षण लिया है। उन्हें हजारों राजनीतिक साक्षात्कारों पर "फाइन-ट्यून" किया गया था। वे इस खेल के विशिष्ट नियमों को अच्छी तरह से जानते हैं।

    • परिणाम: अभ्यास ट्रैक (पब्लिक टेस्ट सेट) पर, RoBERTa-large मॉडल सबसे तेज़ धावक था। यह ट्रिक्स को पकड़ने में अविश्वसनीय रूप से अच्छा था।
  • सामान्यज्ञ दिग्गज (Zero-Shot डिकोडर मॉडल्स जैसे GPT-5.2):
    ये ओलंपिक डेकाथलीटों की तरह हैं जिन्होंने कभी इस विशिष्ट ट्रैक को नहीं देखा है। ये विशाल, शक्तिशाली मॉडल (जैसे GPT-5.2) हैं जो दुनिया के बारे में सब कुछ जानते हैं। टीम ने उन्हें इस विशिष्ट डेटा पर प्रशिक्षित नहीं किया; उन्होंने बस निर्देश दिए और कहा, "जाओ और इसे समझो।" इसे जीरो-शॉट (Zero-Shot) कहा जाता है।

    • परिणाम: अभ्यास ट्रैक पर, वे विशेष धावकों की तुलना में थोड़े धीमे थे। हालांकि, जब वे आधिकारिक, गुप्त चैंपियनशिप ट्रैक (हिडन टेस्ट सेट) पर पहुंचे, तो GPT-5.2 दिग्गज ने सबको चौंका दिया। यह बेहतर तरीके से सामान्यीकरण (generalize) कर सका, जिसका अर्थ है कि इसने नए, अनदेखे राजनेताओं और प्रश्नों को विशेष धावकों की तुलना में अधिक सहजता से संभाला।

3. बड़ी चुनौती: "अनिश्चितता" का कोहरा (The "Ambivalent" Fog)

इस कार्य का सबसे कठिन हिस्सा स्पष्ट "हाँ" या स्पष्ट "नहीं" को पहचानना नहीं था। सबसे कठिन हिस्सा था अनिश्चित उत्तर (Ambivalent Reply)

कल्पना कीजिए कि एक राजनेता कहता है: "यह जटिल है, लेकिन हम इसकी जांच कर रहे हैं।"
क्या यह एक स्पष्ट उत्तर है? नहीं। क्या यह पूरी तरह से इनकार है? नहीं। यह एक धुंधला मध्य मार्ग है।
डेटा से पता चला कि 6-0% उत्तर इसी "धुंधले" प्रकार के थे। AI यहाँ संघर्ष कर रहा था क्योंकि मानव विशेषज्ञों के बीच भी इस बात पर असहमति थी कि ये उत्तर "बचावपूर्ण" थे या केवल "बारीक (nuanced)"। यह ग्रे रंग के पत्थरों के ढेर को "काले" और "सफेद" बाल्टियों में छांटने जैसा है; कभी-कभी पत्थर सिर्फ ग्रे होते हैं, और बाल्टियों के लिए बहस करने वाले इंसान भी एकमत नहीं हो पाते।

4. अंतिम स्कोरबोर्ड

जब धूल जमी और आधिकारिक परिणाम आए:

  • कार्य 1 (स्पष्टता - Clarity): AI ने लगभग 74% बार सही ढंग से पहचाना कि उत्तर स्पष्ट था या बचावपूर्ण (हिडन टेस्ट पर)।
  • कार्य 2 (बचाव का प्रकार - Evasion Type): विशिष्ट ट्रिक (जैसे "विपथन" बनाम "बचना") को पहचानना कठिन था, जिसका स्कोर लगभग 50% रहा।

टीम का सर्वश्रेष्ठ सबमिशन Zero-Shot GPT-5.2 था। यह स्पष्टता के लिए 44 टीमों में से 22वें स्थान पर और बचाव के प्रकार के लिए 33 टीमों में से 13वें स्थान पर रहा। हालांकि इसने पहला स्थान नहीं जीता, लेकिन इसने साबित कर दिया कि एक विशाल, पूर्व-प्रशिक्षित AI इस जटिल राजनीतिक बारीकी को लगभग उतना ही अच्छे से संभाल सकता है जितना कि एक विशेष रूप से प्रशिक्षित मॉडल।

5. क्या काम नहीं आया? (The "Gimmicks")

टीम ने अपने स्कोर को बढ़ाने के लिए कई फैंसी तरकीबें आजमाईं, लेकिन उनमें से अधिकांश डक्ट टेप से लीक होती नाव को ठीक करने जैसा था:

  • नाम छिपाना (Masking Names): उन्होंने राजनेताओं के नाम छिपाकर (जैसे "ट्रंप" को "[व्यक्ति]" में बदलकर) कोशिश की कि क्या AI व्यक्ति के बजाय शब्दों पर ध्यान केंद्रित करेगा। इससे कोई मदद नहीं मिली।
  • वित्तीय डेटा (Financial Data): उन्होंने AI को कॉर्पोरेट अर्निंग कॉल्स (जहाँ CEO भी सवालों से बचते हैं) का उपयोग करके सिखाने की कोशिश की। इसने AI को मदद करने के बजाय भ्रमित कर दिया।
  • संज्ञानात्मक विकृति (Cognitive Distortions): उन्होंने यह देखने की कोशिश की कि क्या AI "तर्कहीन सोच" के पैटर्न को पहचान सकता है। यह काम नहीं किया क्योंकि राजनीतिक साक्षात्कार और थेरेपी सत्र बहुत अलग होते हैं।

निष्कर्ष (The Takeaway)

शोधपत्र यह निष्कर्ष निकालता है कि राजनीतिक बचाव को पहचानना अविश्वसनीय रूप से कठिन है, आंशिक रूप से इसलिए क्योंकि मनुष्य भी हमेशा इस बात पर सहमत नहीं हो पाते कि क्या चीज़ "बचावपूर्ण" मानी जाए।

हालाँकि, इस अध्ययन ने एक दिलचस्प बदलाव दिखाया: विशेषज्ञ मॉडल (जो केवल इस डेटा पर प्रशिक्षित हैं) बुनियादी बातों में अच्छे हैं, लेकिन सामान्यज्ञ दिग्गज (जैसे GPT-5.2) नए राजनेताओं और नए प्रश्नों की वास्तविक दुनिया की अराजकता को संभालने में बेहतर हो सकते हैं।

संक्षेप में: राजनेता के झूठ को पकड़ने के लिए, आप या तो एक विशेषज्ञ को काम पर रख सकते हैं जो किताब का हर दांव-पेच जानता है, या आप एक सुपर-स्मार्ट जनरलिस्ट को पूछ सकते हैं जो जानता है कि पूरी दुनिया कैसे काम करती है। कभी-कभी, जनरलिस्ट जीत जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →