← नवीनतम पेपर
💬 NLP

FLUKE: A Linguistically-Driven and Task-Agnostic Framework for Robustness Evaluation

यह शोध पत्र FLUKE को प्रस्तुत करता है, जो एक भाषाई रूप से संचालित और कार्य-अज्ञेय (task-agnostic) ढांचा है जो मॉडल की मजबूती (robustness) का मूल्यांकन करने के लिए भाषाई स्तरों पर नियंत्रित विविधताओं का उपयोग करता है, जिससे यह पता चलता है कि प्राकृतिक प्रवाहपूर्ण संशोधन और निषेध (negation), सतही स्तर के भ्रष्टाचार (surface-level corruptions) की तुलना में अधिक चुनौतियां पेश करते हैं, और यह भी कि तर्क करने की क्षमताएं आवश्यक रूप से बेहतर मजबूती के साथ सह-संबंधित नहीं होती हैं।

मूल लेखक: Yulia Otmakhova, Hung Thinh Truong, Rahmad Mahendra, Zenan Zhai, Rongxin Zhu, Daniel Beck, Jey Han Lau

प्रकाशित 2026-02-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yulia Otmakhova, Hung Thinh Truong, Rahmad Mahendra, Zenan Zhai, Rongxin Zhu, Daniel Beck, Jey Han Lau

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान रोबोट बनाया है जो पढ़ सकता है, लिख सकता है और समस्याओं को हल कर सकता है। आपने इसका परीक्षण एक मानक गणित की क्विज़ पर किया, और इसने A+ प्राप्त किया। अब आप इसे काम पर लगाने के लिए तैयार हैं!

लेकिन तभी, एक दोस्त पूछता है: "क्या होगा अगर मैं वही गणित का सवाल पूछूँ, लेकिन मैं उसे अलग लहजे (accent) में लिखूँ? या अगर मैं 'big' शब्द को 'huge' से बदल दूँ? या अगर मैं गलती से 'the' की जगह 'teh' टाइप कर दूँ?"

ज्यादातर समय, हम मान लेते हैं कि एक स्मार्ट रोबोट बिना किसी परेशानी के इन छोटी-मोटी चीजों को संभाल लेगा। लेकिन आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये छोटे बदलाव अक्सर रोबोट को क्रैश कर देते हैं, गलत उत्तर देते हैं, या पूरी तरह से भ्रमित कर देते हैं।

यह पेपर FLUKE (Linguistically-Driven and Task-Agnostic Robustness Evaluation के लिए फ्रेमवर्क) नामक एक नया टूल पेश करता है जो ठीक इसी चीज़ का परीक्षण करने के लिए है। FLUKE को एक "स्ट्रेस टेस्ट जिम" की तरह समझें।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "मिरर मेज़" (दर्पण भूलभुलैया) की उपमा

कल्पना कीजिए कि आप एक कमरे में चल रहे हैं जहाँ एक दर्पण है। यदि आप आगे बढ़ते हैं, तो दर्पण आपको आगे बढ़ते हुए दिखाता है। AI आमतौर पर इसी तरह से टेस्ट किया जाता है: वह ऐसा डेटा देखता है जो बिल्कुल वैसा ही दिखता है जैसा उसने स्कूल में सीखा है।

FLUKE एक दर्पणों का हॉल बनाता है जहाँ प्रतिबिंब थोड़ा विकृत (distorted) होता है।

  • विकृति (The Distortion): यह एक सामान्य वाक्य लेता है जैसे "Everyone loves dogs" और इसके विभिन्न संस्करण बनाता है:
    • टाइपिंग की गलतियाँ (The Typos): "Evryone loves dogs" (वर्तनी/Spelling)
    • आवाज़ का बदलाव (The Voice Change): "Dogs are loved by everyone" (कर्मवाच्य/Passive voice)
    • नकारात्मकता (The Negation): "No one loves dogs" ( "not" जोड़ना)
    • लहजा (The Accent): "He dun wan say no" (सिंग्लिश बोली/Singlish dialect)
    • शैली (The Style): "It's no fun seeing a kid suffer" (अनौपचारिक बोलचाल/Casual slang)

FLUKE इन "विकृत" टेस्ट प्रश्नों को बनाने के लिए एक सुपर-स्मार्ट AI (एक LLM) का उपयोग करता है, और फिर इंसान यह जांचते हैं कि क्या प्रश्न अभी भी अर्थपूर्ण हैं।

2. "भंगुर कांच" (Brittle Glass) की खोज

शोधकर्ताओं ने कई अलग-अलग AI मॉडल्स (BERT जैसे छोटे मॉडल से लेकर GPT-4o और Claude जैसे विशाल मॉडल्स तक) को इस जिम में डाला। उन्हें यहाँ क्या मिला:

  • "कार्य-विशिष्ट" कमजोरी (The "Task-Specific" Weakness): सिर्फ इसलिए कि एक रोबोट एक चीज़ में अच्छा है, इसका मतलब यह नहीं है कि वह हर चीज़ में अच्छा है।

    • उपमा: कल्पना कीजिए कि एक शतरंज का ग्रैंडमास्टर जो करतब दिखाने (juggling) में बहुत बुरा है। यदि आप उन्हें करतब दिखाने के लिए टेस्ट करते हैं, तो वे विफल हो जाते हैं। इसी तरह, कुछ AI मॉडल्स नाम पहचानने (जैसे "New York") में बेहतरीन होते हैं, लेकिन वाक्य की संरचना बदलने पर बिखर जाते हैं। अन्य मॉडल्स गणित में अच्छे होते हैं लेकिन फॉन्ट या कैपिटलाइजेशन बदलने पर भ्रमित हो जाते हैं।
    • सबक: आप सभी AI के लिए एक ही "मानक टेस्ट" का उपयोग नहीं कर सकते। आपको हर काम के लिए एक कस्टम स्ट्रेस टेस्ट की आवश्यकता होती है।
  • "बड़ा दिमाग" वाला जाल (The "Big Brain" Trap): आप सोच सकते हैं कि बड़े, स्मार्ट मॉडल्स (जैसे नए "Reasoning" मॉडल्स) अटूट होंगे।

    • उपमा: यह एक बहुत महंगी स्पोर्ट्स कार की तरह है। यह तेज़ है और घुमावों को अच्छी तरह संभालती है, लेकिन यदि आप इसे गड्ढे (एक विशिष्ट भाषाई बदलाव) के ऊपर से चलाते हैं, तो यह एक सस्ते सेडान की तरह ही आसानी से टूट सकती है।
    • आश्चर्य: कभी-कभी, "Reasoning" मॉडल्स (जो गहराई से सोचने के लिए बने हैं) कुछ बदलावों, जैसे नकारात्मकता ("not") का सामना करने पर बुनियादी मॉडल्स की तुलना में वास्तव में अधिक नाजुक पाए गए।
  • "प्राकृतिक बनाम नकली" परीक्षण (The "Natural vs. Fake" Test):

    • उपमा: कल्पना कीजिए कि कोई रोबोट को बेवकूफ बनाने की कोशिश कर रहा है।
      • नकली चाल (Fake Trick): वे रोबोट की आँखों में मुट्ठी भर रेत फेंक देते हैं (रैंडम टाइपो, अक्षरों को उलटना)।
      • प्राकृतिक चाल (Natural Trick): वे रोबोट से एक अलग बोली में बात करते हैं या आवाज़ का लहजा बदलते हैं।
    • निष्कर्ष: रोबोट अक्सर "प्राकृतिक चाल" (शैली या बोली बदलना) से अधिक भ्रमित होते हैं बजाय "नकली चाल" (टाइपो) के। वे टाइपो को अनदेखा करने में आश्चर्यजनक रूप से अच्छे हैं लेकिन यह समझने में खराब हैं कि "The boss fired the worker" का अर्थ वही है जो "The worker was fired by the boss" का है।
  • "जनरेशन बनाम समझ" का विरोधाभास (The "Generation vs. Understanding" Paradox):

    • उपमा: कल्पना कीजिए कि एक व्यक्ति स्कॉटिश लहजे में कविता को पूरी तरह से सुना (Recite) सकता है (Generation) लेकिन यदि कोई उनसे स्कॉटिश लहजे में बात करता है, तो वे पूरी तरह से भ्रमित हो जाते हैं (Understanding)।
    • निष्कर्ष: सिर्फ इसलिए कि एक AI किसी विशिष्ट व्याकरण नियम या बोली का उपयोग करके वाक्य लिख सकता है, इसका मतलब यह नहीं है कि वह प्रश्न में दिखने वाले उसी नियम को समझ भी सकता है। ये दो अलग-अलग कौशल हैं।

3. यह क्यों मायने रखता है?

वर्तमान में, हम AI मॉडल्स को एक "रिपोर्ट कार्ड" के साथ रिलीज़ करते हैं जो कहता है, "इस मॉडल ने गणित की परीक्षा में 90% प्राप्त किए।"

FLUKE का तर्क है कि यह रिपोर्ट कार्ड अधूरा है। यह एक कार के बारे में यह कहने जैसा है कि वह "सुरक्षित" है क्योंकि उसने 30 mph की गति पर क्रैश टेस्ट पास किया है, लेकिन हमने कभी इसे 60 mph या बर्फीले रास्तों पर टेस्ट नहीं किया।

निष्कर्ष:
AI पर वास्तव में भरोसा करने के लिए, हमें केवल उससे बार-बार एक ही सवाल पूछना बंद करना होगा। हमें उसे हिलाना होगा, शब्दों को बदलना होगा, टाइपो जोड़ने होंगे, बोली बदलनी होगी, और देखना होगा कि क्या वह अभी भी अपना आधार बनाए रखता है। FLUKE वह टूलकिट है जो हमें ठीक यही करने में मदद करता है, यह सुनिश्चित करता है कि AI केवल उत्तर रट नहीं रहा है, बल्कि वास्तव में दुनिया को समझ रहा है।

संक्षेप में: FLUKE वह "कठोर प्रेम" (tough love) वाला कोच है जो AI डेवलपर्स को कहता है, "मुझे केवल अपना सर्वश्रेष्ठ प्रदर्शन न दिखाएं; मुझे दिखाएं कि आप वास्तविक जीवन की अव्यवस्था को कैसे संभालते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →