← नवीनतम पेपर
💬 NLP

SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

यह शोध पत्र SAGE का प्रस्ताव करता है, जो एक स्केलेबल फ्रेमवर्क है जो LLM ज्ञान बेंचमार्क के मजबूत, कम लागत वाले वेरिएंट्स को स्वचालित रूप से उत्पन्न करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) और एक रूब्रिक-आधारित सत्यापनकर्ता (verifier) के साथ फाइन-ट्यून किए गए छोटे मॉडलों का लाभ उठाता है, जो कार्य-विशिष्ट फाइन-ट्यूनिंग के बिना मानव-एनोटेटेड मानकों के तुलनीय गुणवत्ता प्राप्त करता है।

मूल लेखक: Xiaoyuan Li, Yuzhe Wang, Moxin Li, Keqin Bao, Rui Men, Yichang Zhang, Dayiheng Liu, Wenjie Wang, Fuli Feng

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoyuan Li, Yuzhe Wang, Moxin Li, Keqin Bao, Rui Men, Yichang Zhang, Dayiheng Liu, Wenjie Wang, Fuli Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान छात्र (एक AI) है, जिसने आपके द्वारा दिए गए हर मानक टेस्ट में उत्कृष्ट प्रदर्शन किया है। वह हर चीज़ पर 90% या उससे अधिक अंक प्राप्त करता है। आप सोच सकते हैं, "वाह, यह छात्र सब कुछ जानता है!"

लेकिन फिर, आप उसे चकमा देने का निर्णय लेते हैं। आप एक ऐसा प्रश्न लेते हैं जिसका उत्तर उसने सही दिया था और उसे थोड़ा अलग तरीके से पूछते हैं:

  • मूल: "महिला करेगी..." (The lady will...)
  • ट्रिक: "महिला नहीं करेगी..." (The lady will not...)

अचानक, वह छात्र असफल हो जाता है। उसके अंक 90% से गिरकर 9% हो जाते हैं। यह इस बात को उजागर करता है कि छात्र ने वास्तव में अवधारणा (concept) को समझा नहीं था; उसने केवल प्रश्न के पैटर्न को रट लिया था। यह "भंगुर" (brittle) ज्ञान क्षमता को दर्शाता है।

यह पेपर SAGE (Scalable Automated Robustness Augmentation) पेश करता है, जो एक नया सिस्टम है जिसे इन "ट्रिक प्रश्नों" को स्वचालित रूप से, सस्ते में और विश्वसनीय रूप से बनाने के लिए डिज़ाइन किया गया है।

SAGE कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

समस्या: महंगा "मानव ट्यूटर"

पहले, इन ट्रिक प्रश्नों को बनाने के लिए, शोधकर्ताओं को विशाल, महंगे AI मॉडल (जैसे GPT-4) का उपयोग करके उन्हें लिखवाना पड़ता था और फिर उनकी जाँच करनी पड़ती थी।

  • समस्या: यह एक साधारण सैंडविच बनाने के लिए एक विश्व-प्रसिद्ध शेफ को काम पर रखने जैसा था। अधिकांश समय, शेफ ब्रेड जला देता या पनीर डालना भूल जाता (कम उत्पादकता)। फिर, आपको एक और महंगे शेफ को चखने के लिए काम पर रखना पड़ता जो कहता, "नहीं, यह खराब है।"
  • लागत: यह प्रक्रिया अविश्वसनीय रूप से धीमी और महंगी थी, जिससे ट्रिक प्रश्नों का एक विशाल पुस्तकालय बनाना असंभव हो गया था।

समाधान: SAGE के "प्रशिक्षु इंटर्न" (Trainable Interns)

SAGE उन महंगे विश्व-प्रसिद्ध शेफों की जगह दो छोटे, विशिष्ट "इंटर्न" (छोटे AI मॉडल) का उपयोग करता है जिन्हें वह इस काम को पूरी तरह से करने के लिए प्रशिक्षित करता है।

1. इंटर्न "निरीक्षक" (VariantQual)

सबसे पहले, SAGE एक छोटे मॉडल को एक सख्त निरीक्षक (Inspector) के रूप में प्रशिक्षित करता है।

  • यह कैसे सीखता है: मनुष्य इसे अच्छे और बुरे ट्रिक प्रश्नों के कुछ उदाहरण देते हैं। निरीक्षक एक विशिष्ट चेकलिस्ट (एक "रूब्रिक") सीखता है जिसके आधार पर वह उन्हें ग्रेड करता है:
    1. क्या उन्होंने नियमों का पालन किया? (उदाहरण के लिए, क्या उन्होंने वास्तव में "not" जोड़ा यदि वह कार्य था?)
    2. क्या उत्तर अभी भी सही है? (क्या नए प्रश्न का अभी भी एक स्पष्ट सही उत्तर है?)
    3. क्या उत्तर अद्वितीय है? (क्या कोई भ्रमित करने वाले डुप्लिकेट उत्तर मौजूद हैं?)
  • जादू: यह निरीक्षक केवल "अच्छा/बुरा" कहने के बजाय, यह पहचानने में सक्षम होता है कि कोई प्रश्न खराब क्यों है। यह एक बहुत ही विश्वसनीय निर्णायक बन जाता है।

2. इंटर्न "लेखक" (VariantGen)

इसके बाद, SAGE दूसरे छोटे मॉडल को लेखक (Writer) के रूप में प्रशिक्षित करता है।

  • चरण 1 (अनुकरण/Imitation): लेखक मानव-लिखित उदाहरणों की नकल करना शुरू करता है। यह प्रश्न को फिर से लिखने के बुनियादी तरीके सीखता है।
  • चरण 2 (कोचिंग): यह सबसे चतुर हिस्सा है। लेखक एक नया ट्रिक प्रश्न बनाने की कोशिश करता है। निरीक्षक उसे ग्रेड करता है।
    • यदि निरीक्षक कहता है "अच्छा," तो लेखक को एक "पुरस्कार" (जैसे कि गोल्ड स्टार) मिलता है।
    • यदि निरीक्षक कहता है "बुरा," तो लेखक को "दंड" (penalty) मिलता है।
  • परिणाम: लेखक इन पुरस्कारों और दंडों (जिसे सुदृढीकरण लर्निंग या Reinforcement Learning कहा जाता है) से सीखता है ताकि वह ऐसे ट्रिक प्रश्न लिखने में माहिर हो सके जो निरीक्षक के सख्त परीक्षण में पास हो सकें।

परिणाम: एक विशाल, सस्ता पुस्तकालय

इस "लेखक + निरीक्षक" टीम के उपयोग से, SAGE पुराने तरीके की तुलना में बहुत कम लागत (लगभग 7,000केमुकाबले7,000 के मुकाबले 284) में 16,800 ट्रिक प्रश्नों का एक विशाल पुस्तकालय बना सकता है।

  • गुणवत्ता: पेपर दिखाता है कि SAGE द्वारा निर्मित AI-जनरेटेड ट्रिक प्रश्न उतने ही अच्छे हैं जितने कि मानव द्वारा लिखे गए प्रश्न।
  • सामान्यीकरण (Generalization): इससे भी बेहतर, एक बार जब इसे एक प्रकार के टेस्ट (HellaSwag) पर प्रशिक्षित किया जाता है, तो यह बिना पुन: प्रशिक्षण के तुरंत एक पूरी तरह से अलग टेस्ट (MMLU) पर अपने कौशल को लागू कर सकता है। यह एक छात्र को कहानी में झूठ पकड़ना सिखाने जैसा है, और फिर वह तुरंत गणित की समस्या में भी झूठ पकड़ सकता है।

यह क्यों महत्वपूर्ण है

पेपर निष्कर्ष निकालता है कि SAGE हमें "स्थिर" (static) टेस्ट (जहाँ AI केवल उत्तर रट लेता है) से "मजबूत" (robust) टेस्ट (जहाँ AI को वास्तव में तर्क को समझना होता है) की ओर बढ़ने की अनुमति देता है। यह सिद्ध करता है कि हमें ये टेस्ट बनाने के लिए महंगे, विशाल AI मॉडल की आवश्यकता नहीं है; हमें बस स्मार्ट, छोटे मॉडलों की आवश्यकता है जिन्हें विशिष्ट प्रकार के प्रश्न बनाने और जाँचने में कुशल होने के लिए प्रशिक्षित किया गया है।

संक्षेप में: SAGE एक ऐसी फैक्ट्री है जो एक सख्त गुणवत्ता-नियंत्रण रोबोट और एक सीखने वाले रोबोट का उपयोग करके ट्रिक प्रश्नों का बड़े पैमाने पर उत्पादन करती है, जो यह प्रकट करते हैं कि क्या कोई AI वास्तव में बुद्धिमान है या केवल पैटर्न रट रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →