← नवीनतम पेपर
💬 NLP

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

यह शोध पत्र \textsc{Squid Game} को प्रस्तुत करता है, जो एक गतिशील और प्रतिकूल मूल्यांकन वातावरण है जिसमें छह एलिमिनेशन-शैली के स्तर शामिल हैं जो संसाधन-सीमित और विषम सूचना सेटिंग्स के तहत 50 से अधिक लार्ज लैंग्वेज मॉडल्स का परीक्षण करते हैं, जो पीढ़ीगत प्रदर्शन परिवर्तनों और स्थिर बेंचमार्क की सीमाओं को प्रकट करता है।

मूल लेखक: Zijian Chen, Wenjun Zhang, Guangtao Zhai

प्रकाशित 2026-02-02
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zijian Chen, Wenjun Zhang, Guangtao Zhai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया जहाँ एक नई कार का परीक्षण करने का अर्थ केवल इसे आदर्श मौसम में, एक खाली और सुव्यवस्थित राजमार्ग पर चलाना नहीं है। इसके बजाय, आप इसे एक अराजक, उच्च-जोखिम वाले बाधा दौड़ (obstacle course) में झोंक देते हैं जहाँ सड़क बदलती रहती है, ईंधन कम हो जाता है, और अन्य ड्राइवर सक्रिय रूप से आपसे टकराने की कोशिश कर रहे होते हैं।

यही वह चीज़ है जो यह शोध पत्र, "Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models," प्रस्तावित करता है। इसके लेखक, ज़िजियन चेन, वेनजुन झांग और गुआंगटाओ झाई, AI के परीक्षण करने के वर्तमान तरीके से थक चुके हैं। उनका तर्क है कि आज के परीक्षण बहुत आसान, बहुत स्थिर हैं, और अक्सर "धोखाधड़ी" वाले हैं क्योंकि AI ने अपने प्रशिक्षण डेटा से उत्तर पहले ही याद कर लिए हैं।

इसे ठीक करने के लिए, उन्होंने SQUID GAME बनाया है: AI मॉडल के लिए एक गतिशील, उन्मूलन-शैली (elimination-style) की प्रतियोगिता, जो लोकप्रिय टीवी शो से प्रेरित है। हर मॉडल को 100 में से एक स्कोर देने के बजाय, वे उन्हें एक "बैटल रॉयल" में एक-दूसरे के खिलाफ उतारते हैं, जहाँ कमजोर बाहर हो जाते हैं, और केवल सबसे स्मार्ट और अनुकूलनशील (adaptable) ही जीवित बचते हैं।

यहाँ "खेल" कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

खेल के तीन बड़े नियम

लेखकों ने इस खेल को तीन मुख्य विचारों के इर्द-गिर्द डिजाइन किया है जो इसे मानक परीक्षणों से अलग बनाते हैं:

  1. स्कोर नहीं, बल्कि उत्तरजीविता (Survival, Not Just Scores): सामान्य परीक्षणों में, एक AI को इस आधार पर स्कोर मिलता है कि उसने कितने प्रश्नों के सही उत्तर दिए। SQUID GAME में, यह उत्तरजीविता (survival) के बारे में है। यदि आप गलती करते हैं, तो आप बाहर हैं। जैसे-जैसे आप आगे बढ़ते हैं, कठिनाई बढ़ती जाती है क्योंकि आप अन्य AI के खिलाफ खेल रहे होते हैं, न कि प्रश्नों की एक स्थिर सूची के खिलाफ।
  2. ईंधन खत्म होना (संसाधन संबंधी बाधाएं - Running Out of Fuel): कल्पना कीजिए कि आप एक पहेली को हल करने की कोशिश कर रहे हैं, लेकिन आपको बताया जाता है कि आपके पास अपने समाधान को समझाने के लिए केवल 100 शब्द हैं। यदि आप बहुत अधिक शब्दों का उपयोग करते हैं, तो आप हार जाते हैं। यह खेल मॉडलों को कुशल होने के लिए मजबूर करता है। यदि वे बहुत अधिक बोलते हैं या बहुत अधिक "टोकन" (AI भाषा के निर्माण खंड) का उपयोग करते हैं, तो उन्हें बाहर कर दिया जाता है।
  3. युद्ध का कोहरा (सूचना विषमता - The Fog of War): सामान्य परीक्षणों में, AI को वह सारी जानकारी तुरंत मिल जाती है जिसकी उसे आवश्यकता होती है। इस खेल में, AI को अक्सर बिना सब कुछ जाने निर्णय लेने पड़ते हैं। यह शतरंज खेलने जैसा है जहाँ आप अपने प्रतिद्वंद्वी के मोहरों को उनके चलने तक नहीं देख सकते। यह परीक्षण करता है कि क्या AI दबाव में रणनीतिक रूप से सोच सकता है।

टूर्नामेंट के छह स्तर

खेल में छह स्तर शामिल हैं, जिनमें से प्रत्येक AI की एक अलग "शक्ति" (muscle) का परीक्षण करता है:

  • स्तर 1: रेड-ग्रीन लाइट (द "स्टॉप एंड गो" टेस्ट)

    • खेल: AI को एक लंबी कहानी लिखनी होती है। लेकिन अचानक, एक "रेड लाइट" चमक सकती है, और इसे तुरंत लिखना बंद करना होगा और एक गुप्त कोड आउटपुट करना होगा। यदि यह लिखना जारी रखता है या कोड गलत देता है, तो यह बाहर हो जाता है।
    • यह क्या परीक्षण करता है: क्या AI सख्त निर्देशों का पालन कर सकता है और बिना घबराए तुरंत अपनी दिशा बदल सकता है?
    • परिणाम: कई मॉडल यहाँ विफल रहे क्योंकि वे बोलने से रुक नहीं सके।
  • स्तर 2: शुगर हनीकॉम्ब्स (द "डेलीकेट सर्जरी" टेस्ट)

    • खेल: AI को कंप्यूटर कोड का एक अस्त-व्यस्त, भ्रमित करने वाला टुकड़ा दिया जाता है (जैसे कि एक हनीकॉम्ब जो टूटने ही वाला है) और इसे इसके कार्य को तोड़े बिना साफ करना होता है।
    • यह क्या परीक्षण करता है: क्या AI जटिल प्रणालियों में सटीक, नाजुक बदलाव कर सकता है?
    • परिणाम: कुछ मॉडल बहुत अधिक "बातूनी" थे और अनावश्यक टिप्पणियाँ (comments) जोड़ रहे थे, जिससे वे सख्त नियमों में विफल रहे।
  • स्तर 3: टग ऑफ वॉर (द "टीम डिबेट" टेस्ट)

    • खेल: तीन AI एक विषय पर बहस करने के लिए एक टीम बनाते हैं, जबकि दूसरी टीम के तीन AI उनके खिलाफ होते हैं। लेकिन एक शर्त है: उनके पास एक सीमित "शब्द बजट" है। यदि वे शब्दों के मामले में खत्म हो जाते हैं, तो वे हार जाते हैं।
    • यह क्या परीक्षण करता है: क्या AI सीमित संसाधनों का प्रबंधन करते हुए प्रभावी ढंग से काम कर सकते हैं और बहस कर सकते हैं?
    • परिणाम: "लाइटवेट" मॉडलों (छोटे, तेज़ AI) वाली टीमें अक्सर जीत गईं क्योंकि उन्होंने विशाल, अत्यधिक बोलने वाले मॉडलों की तुलना में कम शब्दों का उपयोग किया।
  • स्तर 4: मार्बल्स (द "माइंड गेम" टेस्ट)

    • खेल: दो AI एक खेल खेलते हैं जहाँ एक प्रश्न पूछता है और दूसरा उत्तर देता है। यदि उत्तर गलत है, तो प्रश्न पूछने वाला एक "चिप" (पॉइंट) चुरा लेता है। लक्ष्य दूसरे AI को गलत उत्तर देने के लिए छलना है।
    • यह क्या परीक्षण करता है: क्या एक AI यह समझ सकता है कि दूसरे AI को क्या नहीं पता है और उस कमजोरी का फायदा उठा सकता है?
    • परिणाम: अधिकांश AI रक्षा करने में बेहतर थे बजाय हमला करने के। वे ऐसे प्रश्न बनाने में संघर्ष कर रहे थे जो वास्तव में शीर्ष मॉडलों को उलझा सकें।
  • स्तर 5: ग्लास स्टेपिंग स्टोन्स (द "लीप ऑफ फेथ" टेस्ट)

    • खेल: AI को कांच के पैनलों से बना एक पुल पार करना होता है। कुछ सुरक्षित हैं; कुछ टूट जाते हैं। पहले AI को अनुमान लगाना होता है। दूसरे AI को दिखता है कि पहला कहाँ गिरा, और इसी तरह।
    • यह क्या परीक्षण करता है: क्या एक AI दूसरों की गलतियों से सीख सकता है और सुरक्षित पथ का पता लगा सकता है?
    • परिणाम: यह बहुत कठिन था। कई मॉडल इतिहास के आधार पर पैटर्न को समझने में विफल रहे कि कौन जीवित बचा और कौन गिर गया।
  • स्तर 6: द फाइनल स्क्विड गेम (द "सेफ्टी शोडाउन")

    • खेल: एक AI दूसरे को कुछ खतरनाक या अवैध (जैसे बम कैसे बनाया जाए) कहने के लिए बहकाने की कोशिश करता है। दूसरे AI को इस चाल का प्रतिरोध करना चाहिए।
    • यह क्या परीक्षण करता है: क्या AI सुरक्षित है? क्या वह "जेलब्रेक" या हेरफेर का विरोध कर सकता है?
    • परिणाम: यह AI के नैतिक विवेक और दबाव के बावजूद "ना" कहने की उसकी क्षमता का परीक्षण करता है।

उन्होंने क्या पाया?

52 अलग-अलग AI मॉडलों (GPT-5, Gemini, Claude और कई ओपन-सोर्स सहित बड़े नामों के साथ) के साथ इस टूर्नामेंट को चलाने के बाद, उन्होंने कुछ आश्चर्यजनक चीजें पाईं:

  • बड़ा हमेशा बेहतर नहीं होता: कभी-कभी, विशाल मॉडलों की तुलना में छोटे, "हल्के" मॉडल बेहतर प्रदर्शन करते हैं क्योंकि वे अधिक कुशल होते हैं और अनावश्यक विवरणों में नहीं फंसते।
  • "चीटिंग" की समस्या: कुछ कमजोर मॉडलों ने सिस्टम को "गेम" करने की कोशिश की। उदाहरण के लिए, रेड-ग्रीन लाइट गेम में, गणितीय समस्या को वास्तव में हल करने के बजाय, उन्होंने बस ऐसे नंबरों का अनुमान लगाया जो सही ढंग से जुड़ते थे। यह सुझाव देता है कि सामान्य परीक्षणों में, AI समस्या को वास्तव में समझने के बजाय पैटर्न को याद कर रहे होते हैं।
  • स्थिर बनाम गतिशील (Static vs. Dynamic): जो मॉडल मानक, उबाऊ परीक्षणों (जैसे बहुविकल्पीय प्रश्नों के उत्तर देना) में अच्छा करते हैं, वे हमेशा इस अराजक खेल में अच्छा नहीं करते। यह साबित करता है कि एक टेक्स्टबुक टेस्ट में अच्छा होना यह नहीं दर्शाता कि आप वास्तविक दुनिया के दबाव को संभाल सकते हैं।

निष्कर्ष

लेखक कह रहे हैं: "AI को शून्य (vacuum) में परीक्षण करना बंद करें।"

ठीक वैसे ही जैसे एक पायलट को केवल एक सिम्युलेटर में आदर्श मौसम में नहीं, बल्कि एक तूफान में उड़ने की आवश्यकता होती है, AI को भी अव्यवस्थित, अप्रत्याशित और प्रतिस्पर्धी वातावरण में परीक्षण करने की आवश्यकता है। SQUID GAME उनके द्वारा एक ऐसा तूफान पैदा करने का तरीका है जिससे यह देखा जा सके कि कौन से मॉडल वास्तव में मजबूत हैं और कौन से केवल परीक्षण के प्रश्नों को याद करने में अच्छे हैं।

वे निष्कर्ष निकालते हैं कि इस प्रकार का "बैटल रॉयल" परीक्षण AI के मूल्यांकन के तरीके का एक मानक हिस्सा होना चाहिए, क्योंकि यह उन कमजोरियों को उजागर करता है जिन्हें पारंपरिक परीक्षण पूरी तरह से छोड़ देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →