← नवीनतम पेपर
💬 NLP

CSE-UOI at SemEval-2026 Task 6: A Two-Stage Heterogeneous Ensemble with Deliberative Complexity Gating for Political Evasion Detection

CSE-UOI टीम ने एक नवीन डेलिब्रेटिव कॉम्प्लेक्सिटी गेटिंग मैकेनिज्म का उपयोग करते हुए, जो राजनीतिक टालमटोल (पॉलिटिकल इवेजन) का पता लगाने के लिए रिस्पॉन्स-लेंथ प्रॉक्सीज़ और क्रॉस-मॉडल सिग्नल्स का लाभ उठाता है, एक हेट्रोजेनियस डुअल-LLM एन्सेम्बल के माध्यम से 0.85 के मैक्रो-F1 स्कोर के साथ SemEval-2026 टास्क 6 में तीसरा स्थान प्राप्त किया।

मूल लेखक: Christos Tzouvaras, Konstantinos Skianis, Athanasios Voulodimos

प्रकाशित 2026-03-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christos Tzouvaras, Konstantinos Skianis, Athanasios Voulodimos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप टीवी पर एक राजनीतिक बहस देख रहे हैं। एक पत्रकार एक कठिन, सीधा सवाल पूछता है जैसे, "क्या आपने इस खर्च को मंजूरी दी?" राजनेता जवाब तो देता है, लेकिन "हाँ" या "नहीं" कहने के बजाय, वह अर्थव्यवस्था के बारे में बात करता है, पिछली सरकार को दोष देता है, या "लोगों के लिए कड़ी मेहनत करने" के बारे में एक अस्पष्ट भाषण देता है।

आपका दिमाग तुरंत जान जाता है: वे सवाल से बच रहे हैं।

यह शोध पत्र एक ऐसे कंप्यूटर सिस्टम का वर्णन करता है जो ठीक वही करने के लिए बनाया गया है जो आपका दिमाग करता है, लेकिन एक साथ हजारों इंटरव्यू के लिए। यूनीवर्सिटी ऑफ इओनिना (University of Ioannina) और नेशनल टेक्निकल यूनिवर्सिटी ऑफ एथेंस की टीम ने राजनेताओं द्वारा बात को घुमाने या टालने को पकड़ने के लिए एक "डिजिटल डिटेक्टिव" (Digital Detective) बनाया है।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, सरल उपमाओं (analogies) के माध्यम से:

1. समस्या: "बचाव" का खेल (The "Evasion" Game)

राजनीतिक इंटरव्यू ट्रिक्स से भरे होते हैं। एक राजनेता:

  • स्पष्ट उत्तर दे सकता है: "हाँ, मैंने यह किया।"
  • अस्पष्ट हो सकता है: "हम राजकोषीय जिम्मेदारी के प्रति प्रतिबद्ध हैं।" (क्या यह हाँ है या ना? कौन जाने!)
  • भाग सकता है: "आइए हमारे शानदार बुनियादी ढांचे की योजना के बारे में बात करते हैं।"

प्रतियोगिता (SemEval-2026) का लक्ष्य कंप्यूटर को इन जवाबों को तीन श्रेणियों (buckets) में वर्गीकृत करना सिखाना था: स्पष्ट उत्तर (Clear Reply), द्विअर्थी/अस्पष्ट (Ambivalent - चालाकी भरा/अस्पष्ट), या स्पष्ट गैर-जवाब (Clear Non-Reply - भाग जाना)

2. समाधान: एक दो-चरणीय जासूसी दल (A Two-Stage Detective Squad)

टीम ने केवल एक कंप्यूटर दिमाग का उपयोग नहीं किया; उन्होंने दो अलग-अलग, शक्तिशाली AI मॉडलों (जिन्हें Grok और Gemini नाम दिया गया है) का उपयोग करके एक दो-चरणीय टीम बनाई। इन्हें दो अलग-अलग शैलियों वाले जासूसों के रूप में समझें।

चरण 1: "बचाव प्रथम" रणनीति (The "Evasion First" Strategy)

AI से यह पूछने के बजाय कि "क्या यह उत्तर स्पष्ट है?", उन्होंने एक स्मार्ट सवाल पूछा: "राजनेता कौन सी विशिष्ट ट्रिक (चाल) का उपयोग कर रहा है?"

उन्होंने AI को 9 अलग-अलग प्रकार की ट्रिक्स (जैसे "बचना/Dodging," "दोष मढ़ना/Blame-Shifting," या "आंशिक उत्तर/Partial Answer") पहचानने के लिए प्रशिक्षित किया। एक बार जब AI ने ट्रिक को पहचान लिया, तो उसने स्वचालित रूप से उसे अंतिम उत्तर (स्पष्ट, द्विअर्थी, या गैर-जवाब) में बदल दिया।

  • ऐसा क्यों किया? यह एक डॉक्टर द्वारा किसी विशिष्ट बीमारी (जैसे "फ्लू") का निदान करने जैसा है, बजाय इसके कि केवल यह अनुमान लगाया जाए कि "आप बीमार महसूस कर रहे हैं।" यह अधिक सटीक है।

उन्होंने सेल्फ-कंसिस्टेंसी (Self-Consistency) नामक तकनीक का उपयोग किया। कल्पना करें कि एक ही जासूस से केस को 5 बार हल करने के लिए कहा गया है। यदि 5 में से 4 बार वह कहता है कि "यह एक बचाव (dodge) है," तो आप काफी आश्वस्त हो सकते हैं कि यह बचाव ही है। उन्होंने Grok और Gemini दोनों के लिए यह किया और फिर उन्हें अंतिम उत्तर पर वोट करने दिया।

चरण 2: "डेलिब्रेटिव कॉम्प्लेक्सिटी गेटिंग" (The "Deliberative Complexity Gating" - DCG)

यह शोध पत्र का मुख्य आकर्षण (secret sauce) है। दो जासूसों के होने के बावजूद, वे कभी-कभी सबसे कठिन मामलों में भ्रमित हो जाते हैं। टीम ने एक दिलचस्प बात देखी: जब कोई AI अनिश्चित होता है या चालाकी करने की कोशिश करता है, तो वह अधिक बातें करने लगता है।

  • उपमा (Analogy): कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है। यदि उन्हें उत्तर पता है, तो वे इसे जल्दी से लिख देते हैं। यदि वे समय टाल रहे हैं या बहाना बना रहे हैं, तो वे एक लंबा, भटका हुआ पैराग्राफ लिखते हैं।
  • तंत्र (Mechanism): सिस्टम में एक "गेटिंग" (Gating) नियम (ट्रैफिक लाइट की तरह) है।
    1. लंबाई की जाँच करें: यदि AI का उत्तर असामान्य रूप से लंबा है (जैसे कि समय टालने वाला छात्र), तो यह "अस्पष्टता" (Ambiguity) के लिए एक रेड फ्लैग है।
    2. आत्मविश्वास की जाँच करें: क्या AI ने अपने 5 प्रयासों के दौरान अपना विचार बदला? यदि वह असंगत (inconsistent) था, तो यह एक और रेड फ्लैग है।
    3. गेट (The Gate): यदि दोनों स्थितियाँ पूरी होती हैं (लंबा उत्तर + असंगत व्यवहार), तो सिस्टम कहता है, "रुको, यह एक पेचीदा मामला है। आइए वोट को ओवरराइड करें और इसे द्विअर्थी (Ambivalent) के रूप में चिह्नित करें।"

यह "गेट" एक सुरक्षा जाल की तरह कार्य करता है, जो उन मामलों को पकड़ लेता है जहाँ मुख्य जासूस गलती करने ही वाले थे क्योंकि राजनेता बहुत अधिक फिसलन भरा (slippery) व्यवहार कर रहा था।

3. सिर्फ एक बहस क्यों नहीं?

शोधकर्ताओं ने एक अलग विचार भी आजमाया: मल्टी-एजेंट डिबेट (Multi-Agent Debate)। उन्होंने कल्पना की कि दोनों AI एक अदालत में सच्चाई खोजने के लिए वकीलों की तरह एक-दूसरे से बहस करेंगे।

  • परिणाम: यह अच्छा काम नहीं कर पाया। बहस ने उन्हें या तो भ्रमित कर दिया या समय बर्बाद किया।
  • सबक: दो अलग-अलग विशेषज्ञों (Grok और Gemini) को मिलकर वोट करने देना, उन्हें आपस में बहस करने देने से बेहतर था। "विचारों की विविधता" ने "गरमागरम बहस" को हरा दिया।

4. परिणाम

सिस्टम एक बड़ी सफलता रहा।

  • यह दुनिया भर की 41 टीमों में से तीसरे स्थान पर रहा।
  • इसने 0.85 का स्कोर प्राप्त किया (जहाँ 1.0 पूर्ण है)।
  • यह विशेष रूप से "द्विअर्थी" (Ambivalent) उत्तरों को पकड़ने में अच्छा था—वे उत्तर जो उत्तर की तरह लगते हैं लेकिन वास्तव में नहीं होते।

सारांश

टीम ने एक स्मार्ट सिस्टम बनाया है जो केवल शब्दों को नहीं पढ़ता; यह व्यवहार का विश्लेषण करता है।

  1. यह दो अलग-अलग AI विशेषज्ञों से उपयोग की जा रही विशिष्ट "ट्रिक" को पहचानने के लिए कहता है।
  2. यह सुनता है कि वे कितनी बातें करते हैं और वे कितने आत्मविश्वासी महसूस करते हैं।
  3. यदि AI बहुत अधिक बोलने लगता है और अनिश्चित लगने लगता है, तो सिस्टम गलती को सुधारने के लिए "एम्बिग्युटी बटन" (Ambiguity Button) दबा देता है।

यह एक सुपर-स्मार्ट संपादक की तरह है जो जानता है कि जब कोई राजनेता (या AI) बिना कुछ कहे बहुत अधिक बातें करने लगता है, तो वे शायद कुछ छिपा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →