SLMJury: Can Small Language Models Judge as Well as Large Ones?
यह शोध पत्र SLMJury को पेश करता है, जो एक व्यापक ढांचा है जो बंद-अंत (closed-ended) और खुले-अंत (open-ended) कार्यों में न्यायाधीश के रूप में 16 छोटे भाषा मॉडलों (SLMs) का बेंचमार्किंग करता है, जिससे यह पता चलता है कि हालांकि कोई भी एक मॉडल हावी नहीं है, अनुकूलित तर्क रणनीतियों और बहस प्रोटोकॉल के माध्यम से SLM बड़े मॉडलों के तुलनीय विश्वसनीय मूल्यांकन प्रदर्शन प्राप्त कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास होमवर्क के उत्तरों का एक विशाल पुस्तकालय है। यह जांचने के लिए कि वे सही हैं या नहीं, आप आमतौर पर दुनिया के सबसे बेहतरीन और बेहद महंगे प्रोफेसरों (लार्ज लैंग्वेज मॉडल्स, या LLMs) को काम पर रखते हैं। वे बहुत बुद्धिमान हैं, लेकिन वे धीमे हैं, उन्हें काम पर रखना महंगा है, और आप हमेशा यह नहीं देख सकते कि उन्होंने किसी उत्तर को सही या गलत क्यों माना।
"SLMJURY" नामक शोध पत्र एक सरल प्रश्न पूछता है: क्या हम ग्रेडिंग करने के लिए स्मार्ट, स्थानीय हाई स्कूल शिक्षकों (स्मॉल लैंग्वेज मॉडल्स, या SLMs) की एक टीम को काम पर रख सकते हैं? ये "शिक्षक" बहुत सस्ते, तेज़ हैं और एक ही कंप्यूटर पर चल सकते हैं, लेकिन क्या वे सटीक रूप से काम को जांचने के लिए पर्याप्त बुद्धिमान हैं?
यहाँ शोधकर्ताओं ने जो पाया है, उसे सरल उपमाओं के माध्यम से समझाया गया है:
1. "त्वरित नज़र" बनाम "गहन अध्ययन" की दुविधा
कल्पना कीजिए कि आप गणित का एक टेस्ट चेक कर रहे हैं।
- त्वरित नज़र (10 टोकन): आप केवल अंतिम उत्तर देखते हैं। यदि वह 'की' (key) से मेल खाता है, तो आप उसे "सही" मार्क कर देते हैं।
- गहन अध्ययन (8,000+ टोकन): उत्तर को सही या गलत मार्क करने से पहले आप छात्र के पूरे स्टेप-बाय-स्टेप तर्क (reasoning) को पढ़ते हैं।
निष्कर्ष: यह विषय पर निर्भर करता है।
- गणित के लिए: "त्वरित नज़र" अक्सर बेहतर होती है! कभी-कभी, जब शिक्षक गणित की समस्या के हर एक स्टेप को पढ़ने की कोशिश करते हैं, तो वे छात्र के चतुर लेकिन गलत तर्क से भ्रमित हो जाते हैं और गलती से एक सही उत्तर को गलत मार्क कर देते हैं। वास्तव में, अंतिम संख्या की त्वरित जांच करना अधिक विश्वसनीय होता है।
- सामान्य ज्ञान के लिए: "गहन अध्ययन" जीतता है। यदि प्रश्न सामान्य ज्ञान (जैसे, "आदमी ने आइसक्रीम क्यों गिरा दी?") के बारे में है, तो त्वरित नज़र काफी नहीं है। सही होने के लिए शिक्षक को कहानी के माध्यम से सोचना होगा।
सबक: कोई भी एक तरीका "हर जगह फिट" नहीं बैठता। गणित के लिए, गति जीतती है। सामान्य तर्क (reasoning) के लिए, सोचने का समय जीतता है।
2. "विशेषज्ञ" बनाम "सर्वगुण संपन्न" शिक्षक
शोधकर्ताओं ने चार अलग-अलग परिवारों के 16 अलग-अलग "शिक्षकों" (AI मॉडल्स) का परीक्षण किया।
- गणित विशेषज्ञ: कुछ शिक्षक गणित में अद्भुत थे (98% सही) लेकिन सामान्य ज्ञान (trivia) में बहुत खराब थे (केवल 55% सही)। वे एक ऐसे जीनियस गणित ट्यूटर की तरह थे जिसे इतिहास या सामाजिक व्यवहार के बारे में कुछ भी नहीं पता।
- सर्वगुण संपन्न शिक्षक: अन्य शिक्षक हर चीज़ में अच्छे थे। वे गणित में 98% तो नहीं ला पाए, लेकिन वे सामान्य प्रश्नों पर पूरी तरह विफल भी नहीं हुए।
सबक: सिर्फ इसलिए कि कोई मॉडल बड़ा है या गणित में अच्छा है, इसका मतलब यह नहीं है कि वह हर चीज़ के लिए एक अच्छा जज है। यदि आप विभिन्न विषयों का मिश्रण ग्रेड करना चाहते हैं, तो आपको एक "सर्वगुण संपन्न" शिक्षक की आवश्यकता है।
3. "बहस" ने मदद नहीं की
शोधकर्ताओं ने एक क्लासिक विचार आज़माया: "यदि तीन जज असहमत हैं, तो उन्हें सच्चाई तक पहुँचने के लिए बहस करने दें।" उन्होंने तीन AI शिक्षकों को इस बात पर बहस करने के लिए सेट किया कि कोई उत्तर सही था या गलत।
- परिणाम: बहस ने चीज़ों को और खराब कर दिया। एक-दूसरे को सुधारने के बजाय, शिक्षक अक्सर एक-दूसरे को गलत उत्तर पर सहमत होने के लिए राजी कर लेते थे। यह दोस्तों के एक समूह की तरह है जो एक पहेली सुलझाने की कोशिश कर रहे हैं; यदि एक दोस्त आत्मविश्वासी है लेकिन गलत है, तो दूसरे शायद विवाद से बचने के लिए बस उनके साथ सहमत हो जाएंगे।
सबक: सरल "सही या गलत" की जाँच के लिए, बहस करने वाली समिति के बजाय एक मजबूत, आत्मविश्वासी जज बेहतर होता है।
4. "रोल-प्ले" का जाल
शोधकर्ताओं ने शिक्षकों को नकली व्यक्तित्व देकर उन्हें धोखा देने की कोशिश की, जैसे कि "एक सख्त, कठोर प्रोफेसर बनें" या "एक बहुत ही उदार, दयालु शिक्षक बनें।"
- परिणाम: "कमजोर" शिक्षक टूट गए। "दयालु" होने के निर्देश मिलने पर, वे गलत उत्तरों को भी पास करने लगे। जब उन्हें "सख्त" होने के लिए कहा गया, तो वे सही उत्तरों को भी फेल कर दिए।
- मजबूत शिक्षक: सबसे अच्छे मॉडल्स (जैसे Phi-4 और Qwen3-14B) अडिग चट्टान की तरह थे। आप चाहे जो भी व्यक्तित्व उन पर थोपें, वे तथ्यों पर टिके रहे और एक जैसा ग्रेड दिया।
सबक: एक अच्छे जज का आंतरिक दिशा-सूचक (internal compass) मजबूत होता है। एक बुरा जज आसानी से हेरफेर किया जा सकता है।
5. "दो अलग-अलग काम" का आश्चर्य
शोधकर्ताओं ने पाया कि "सही/गलत" गणित के सवालों को ग्रेड करने में कुशल होना, "यह निबंध कितना अच्छा है?" इसे ग्रेड करने के कौशल से अलग है।
- सबसे अच्छा "गणित ग्रेडर" निबंध ग्रेड करने में बहुत खराब था।
- सबसे अच्छा "निबंध ग्रेडर" (जो गहराई से सोचना पसंद करता है) गणित में औसत था।
सबक: आप सभी जजिंग कार्यों के लिए केवल एक ही AI मॉडल नहीं चुन सकते। यदि आप गणित ग्रेड कर रहे हैं, तो तेज़, त्वरित-चेक वाला मॉडल चुनें। यदि आप रचनात्मक लेखन या बातचीत को ग्रेड कर रहे हैं, तो उस मॉडल को चुनें जो गहराई से सोचना पसंद करता है।
मुख्य निष्कर्ष (The Bottom Line)
आपको होमवर्क ग्रेड करने के लिए सबसे महंगे, विशाल "सुपर-प्रोफेसर" (लार्ज AI) को काम पर रखने की ज़रूरत नहीं है। आप छोटे, सस्ते, स्थानीय "शिक्षकों" (स्मॉल AI) का उपयोग कर सकते हैं और शानदार परिणाम प्राप्त कर सकते हैं—बशर्ते आप सही काम के लिए सही शिक्षक चुनें।
- गणित के लिए: एक तेज़, त्वरित-चेक वाला शिक्षक उपयोग करें।
- निबंध/चैट के लिए: एक विचारशील, गहराई से सोचने वाला शिक्षक उपयोग करें।
- बचें: उन्हें बहस करने देने से या नकली व्यक्तित्वों के साथ उन्हें धोखा देने की कोशिश करने से।
यह शोध पत्र सिद्ध करता है कि बजट बिगाड़े बिना विश्वसनीय, स्वचालित ग्रेडिंग संभव है, लेकिन इसके लिए यह जानना आवश्यक है कि विशिष्ट कार्य के लिए किस "शिक्षक" को काम पर रखना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।