← नवीनतम पेपर
💬 NLP

Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation

यह अध्ययन प्रदर्शित करता है कि नियंत्रित शाब्दिक और वाक्य संरचनात्मक विक्षोभ (perturbations) प्रमुख बेंचमार्क पर बड़े भाषा मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से कम करते हैं और उनकी रैंकिंग को अस्थिर करते हैं, जो मजबूत भाषाई सक्षमता के बजाय सतही पैटर्न पर निर्भरता को प्रकट करता है और मानक मूल्यांकनों में सुदृढ़ता परीक्षण की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

मूल लेखक: Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bogdan Kostić, Conor Fallon, Julian Risch, Alexander Löser

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुकिंग प्रतियोगिता में एक जज हैं। आपके पास 23 अलग-अलग शेफ (AI मॉडल्स) हैं और आप देखना चाहते हैं कि सबसे अच्छा व्यंजन कौन बनाता है। आमतौर पर, आप उन्हें बिल्कुल एक ही रेसिपी और सामग्री देते हैं, परिणाम का स्वाद लेते हैं, और उन्हें 1st से 23rd स्थान तक रैंक करते हैं।

यह शोध पत्र इस बारे में है कि क्या होता है जब आप गुप्त रूप से रेसिपी में थोड़ा सा बदलाव करते हैं—बिना वास्तविक स्वाद या अंतिम व्यंजन को बदले—और देखते हैं कि क्या जज (AI) भ्रमित हो जाते हैं।

यहाँ उनके प्रयोग की कहानी है, जिसे सरल रूप में समझाया गया है:

1. सेटअप: "वही व्यंजन, अलग मेनू"

शोधकर्ताओं ने AI को टेस्ट करने के लिए उपयोग किए जाने वाले तीन प्रसिद्ध "रेसिपी बुक्स" (बेंचमार्क) को लिया:

  • MMLU: एक सामान्य ज्ञान की क्विज़ (जैसे कि ट्रिविया नाइट)।
  • SQuAD: एक रीडिंग कॉम्प्रिहेन्शन टेस्ट (एक कहानी में उत्तर खोजना)।
  • AMEGA: एक मेडिकल गाइडलाइन टेस्ट (यह जांचना कि क्या एक डॉक्टर नियमों का पालन करता है)।

उन्होंने 23 अलग-अलग AI शेफ को ये टेस्ट हल करने के लिए कहा। लेकिन फिर, उन्होंने यह देखने के लिए दो विशेष "ट्रिक्स" बनाईं कि क्या AI वास्तव में स्मार्ट है या सिर्फ मेनू को रट रहा है:

  • ट्रिक #1: पर्यायवाची बदलना (लेक्सिकल परटर्बेशन - Lexical Perturbation)।
    मान लीजिए रेसिपी कहती है, "नमक का एक बड़ा (large) चुटकी डालें।" शोधकर्ताओं ने इसे बदलकर, "नमक का एक बड़ा (big) चुटकी डालें" कर दिया। अर्थ बिल्कुल समान है, लेकिन शब्द अलग हैं।
  • ट्रिक #2: वाक्य का क्रम बदलना (सिंटैक्टिक परटर्बेशन - Syntactic Perturbation)।
    मान लीजिए रेसिपी कहती है, "शेफ ने प्याज काटा (chopped)।" उन्होंने इसे बदलकर, "प्याज शेफ द्वारा काटे गए (were chopped by the chef)" कर दिया। क्रिया वही है, लेकिन वाक्य की संरचना बदल गई है।

2. बड़ा सरप्राइज: AI एक "शब्द-मैचर" है, "विचारक" नहीं

जब शोधकर्ताओं ने टेस्ट चलाए, तो उन्हें कुछ चौंकाने वाला पता चला:

  • AI को नए शब्दों से नफरत है: जब उन्होंने शब्दों को बदला (जैसे "large" को "big" में), तो AI का प्रदर्शन धड़ाम से गिर गया। यह उस छात्र की तरह था जिसने उत्तर कुंजी रट ली थी लेकिन टेस्ट में फेल हो गया क्योंकि शिक्षक ने "large" के बजाय "big" लिख दिया था। ऐसा लगा जैसे AI उन विशिष्ट शब्दों पर बहुत अधिक निर्भर करता है जिन्हें उसने पहले देखा था, न कि अवधारणा (concept) को समझने पर।
  • AI वाक्य बदलने में ठीक है: जब उन्होंने वाक्य की संरचना को बदला, तो AI काफी स्थिर रहा। वह शब्द बदलने की तुलना में वाक्य के क्रम को बेहतर तरीके से संभाल सका।

उपमा (Analogy): AI को एक तोते की तरह समझें। यदि आप तोते को सिखाते हैं कि "आसमान नीला है," तो वह भ्रमित हो सकता है यदि आप उससे पूछें, "क्या आसमान नीला है?" या "नीला है आसमान।" वह उन विशिष्ट ध्वनियों पर प्रतिक्रिया दे रहा है जो उसने सुनी थीं, न कि आसमान के विचार पर। यह पेपर दिखाता है कि वर्तमान AI गहरे विचारकों के बजाय तोतों की तरह काम कर रहे हैं।

3. लीडरबोर्ड एक "ताश के पत्तों का घर" है

AI की दुनिया में, कुछ सार्वजनिक लीडरबोर्ड होते हैं (जैसे हाई-स्कोर लिस्ट) जो हमें बताते हैं कि कौन सा AI "सबसे अच्छा" है।

शोधकर्ताओं ने पाया कि ये लीडरबोर्ड भंगुर (brittle) हैं।

  • सामान्य ज्ञान के टेस्ट (MMLU) पर, रैंकिंग ज्यादातर वैसी ही रही।
  • लेकिन रीडिंग और मेडिकल टेस्ट पर, रैंकिंग पूरी तरह से बदल गई
    • एक मॉडल जिसे #1 रैंक दी गई थी, वह केवल इसलिए #12 पर गिर गया क्योंकि किसी ने कुछ शब्द बदल दिए थे।
    • एक मॉडल जो #14 पर था, वह केवल इसलिए #9 पर आ गया क्योंकि वाक्य की संरचना बदल गई थी।

रूपक (Metaphor): एक दौड़ की कल्पना करें जहाँ धावकों को सबसे पहले फिनिश लाइन पार करने वाले के रूप में रैंक किया जाता है। लेकिन फिर, रेफरी फिनिश लाइन की टेप का रंग लाल से बदलकर नीला कर देता है। अचानक, जो धावक दूसरे स्थान पर था वह जीत जाता है और विजेता हार जाता है। यह पेपर कहता है कि हमारे वर्तमान AI लीडरबोर्ड उस दौड़ की तरह हैं—वे अस्थिर हैं और उन पर तब भरोसा नहीं किया जा सकता जब "टेप का रंग" (शब्दों की बनावट) थोड़ा बदल जाता है।

4. बड़ा होना हमेशा बेहतर नहीं होता

तकनीक में एक आम धारणा है कि "बड़े मॉडल्स अधिक स्मार्ट और मजबूत होते हैं।" शोधकर्ताओं ने छोटे और विशाल मॉडल्स की तुलना करके इसकी जांच की।

  • परिणाम: आकार सुरक्षा की गारंटी नहीं देता।
    • ट्रिविया टेस्ट पर, सबसे बड़े मॉडल्स का स्कोर वास्तव में सबसे खराब रहा जब शब्दों को बदला गया। वे इतने विशिष्ट (specialized) थे कि वे आसानी से टूट गए।
    • रीडिंग टेस्ट पर, बड़े मॉडल्स वास्तव में अधिक मजबूत (robust) थे।

उपमा: यह एक बॉडीबिल्डर की तरह है। एक बॉडीबिल्डर भारी वजन उठाने में अविश्वसनीय रूप से मजबूत हो सकता है (एक विशिष्ट कार्य पर बड़ा मॉडल), लेकिन यदि आप उसे एक नाजुक डांस मूव करने के लिए कहते हैं (एक अलग कार्य), तो वे एक हल्के वजन वाले जिम्नास्ट की तुलना में अधिक अनाड़ी हो सकते हैं। "बड़ा" होना आपको हर चीज़ में अच्छा नहीं बनाता।

मुख्य निष्कर्ष (The Takeaway): हमें क्या करना चाहिए?

पेपर यह निष्कर्ष निकालता है कि हम वर्तमान में इन AI को कितना "स्मार्ट" समझते हैं, उसका बहुत अधिक आकलन कर रहे हैं। वे उन शब्दों के पैटर्न को पहचानने में बहुत अच्छे हैं जिन्हें उन्होंने पहले देखा है, लेकिन वे वास्तव में अर्थ को नहीं समझते हैं।

समाधान:
इससे पहले कि हम किसी महत्वपूर्ण काम (जैसे बीमारियों का निदान करना या कानूनी अनुबंध लिखना) के लिए AI पर भरोसा करें, हमें केवल यह नहीं पूछना चाहिए, "आपका स्कोर क्या है?" बल्कि हमें यह पूछना चाहिए, "अगर मैं उसी बात को अलग तरीके से कहूँ, तो आप इसे कैसे संभालते हैं?"

हमें AI को सटीकता (accuracy) के साथ-साथ मजबूती (robustness/toughness) के लिए भी टेस्ट करना शुरू करना होगा। यदि कोई AI पर्यायवाची बदलने पर टूट जाता है, तो वह वास्तविक दुनिया के लिए तैयार नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →