Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors
यह अध्ययन प्रदर्शित करता है कि सिचुएशनल जजमेंट टेस्ट के लिए एक ड्यूल-आर्किटेक्चर एलएलएम-आधारित स्कोरिंग सिस्टम अर्थहीन पाठ, वर्तनी की त्रुटियों और लेखन की परिष्कार जैसे अप्रासंगिक कारकों के प्रति आम तौर पर सुदृढ़ है, हालांकि यह विषय से हटकर प्रतिक्रियाओं और टेक्स्ट के दोहराव को उचित रूप से दंडित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, स्वचालित रोबोट शिक्षक है। इसका काम छात्रों के निबंधों को ग्रेड देना है, लेकिन यह व्याकरण या फैंसी शब्दावली पढ़ने के बजाय, कुछ गहरा मापने की कोशिश कर रहा है: एक छात्र कितनी अच्छी तरह सोचता है, समस्याओं को हल करता है और दूसरों के साथ मिलकर काम करता है।
यह शोध पत्र उस रोबोट के लिए एक "तनाव परीक्षण" (stress test) की तरह है। शोधकर्ता यह देखना चाहते थे कि क्या इस रोबोट को खराब उत्तरों पर उच्च ग्रेड देने के लिए बहकाया जा सकता है, या क्या यह अव्यवस्थित लेखन से भ्रमित हो जाएगा। उन्होंने पूछा: क्या यह रोबोट वास्तव में वही माप रहा है जो महत्वपूर्ण है, या यह केवल आसान शॉर्टकट ढूंढ रहा है?
यहाँ उनके प्रयोग का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:
1. "पैडिंग" टेस्ट (लंबाई बढ़ाकर धोखाधड़ी करने की कोशिश)
चाल: कल्पना कीजिए कि एक छात्र को उत्तर नहीं पता है। वह अपने ही पैराग्राफ को तीन बार कॉपी करके या "टीमवर्क के बारे में यह सवाल है" जैसे कई निरर्थक वाक्य जोड़कर, निबंध को लंबा और प्रभावशाली दिखाने की कोशिश करके धोखाधड़ी करने का प्रयास करता है।
पुराना रोबोट: अतीत में, पुराने ग्रेडिंग रोबोट आसानी से मूर्ख बन जाते थे। यदि आपने निबंध को लंबा कर दिया, तो वे सोचते थे, "वाह, अधिक शब्द = अधिक प्रयास = उच्च ग्रेड!" यह एक ऐसे जज की तरह था जो उस व्यक्ति को पुरस्कार देता है जो सबसे लंबे समय तक बोलता है, भले ही उसने कुछ भी नया न कहा हो।
नया AI रोबोट: शोधकर्ताओं ने पाया कि यह नया LLM-आधारित रोबोट इस दिखावे को पहचानने में काफी स्मार्ट है।
- यदि आप निबंध को लंबा करने के लिए अपने टेक्स्ट को कॉपी-पेस्ट करते हैं, तो रोबोट वास्तव में आपका स्कोर कम कर देता है। वह सोचता है, "यह व्यक्ति बस मेरा समय बर्बाद कर रहा है।"
- यदि आप उबाऊ, दोहराव वाले वाक्य जोड़ते हैं, तो रोबोट उन्हें अनदेखा कर देता है। वह लंबाई से धोखा नहीं खाता।
2. "अव्यवस्थित लिखावट" टेस्ट (वर्तनी और शैली)
चाल: कल्पना कीजिए कि दो छात्र बिल्कुल एक ही शानदार विचार दे रहे हैं।
- छात्र A पूरी तरह से लिखता है, "synergistic" और "collaborative" जैसे बड़े शब्दों का उपयोग करता है, और उसकी वर्तनी (spelling) एकदम सही है।
- छात्र B वही विचार लिखता है लेकिन टाइपो (typos - जैसे "collabration") के साथ, सरल शब्दों ("working together") और छोटे वाक्यों के साथ।
पुराना रोबोट: पारंपरिक ग्रेडिंग सिस्टम अक्सर छात्र A को पसंद करते थे और छात्र B को दंडित करते थे। वे एक सख्त अंग्रेजी शिक्षक की तरह थे जो विचार से ज्यादा फॉन्ट और स्पेलिंग की परवाह करते हैं।
नया AI रोबोट: यह रोबोट एक बुद्धिमान संरक्षक की तरह है जिसे संदेश की परवाह है, संदेशवाहक की नहीं। - इसने दोनों छात्रों को समान उच्च स्कोर दिया।
- भले ही उन्होंने जानबूझकर टेक्स्ट में गलतियाँ की थीं (30% तक अक्षर गलत थे), रोबोट फिर भी अर्थ समझ सका। यह एक ऐसे टेक्स्ट मैसेज को पढ़ने जैसा है जो स्लैंग और गलतियों से भरा है, फिर भी आप मजाक समझ जाते हैं।
- यह क्यों मायने रखता है: "टीमवर्क" या "नैतिकता" जैसे परीक्षणों में, स्पेलिंग मायने नहीं रखती। यह रोबोट साबित करता है कि यह "सुंदर पैकेजिंग" को अनदेखा कर सकता है और "अंदर मौजूद उपहार" पर ध्यान केंद्रित कर सकता है।
3. "गलत विषय" टेस्ट (गलत चीज़ के बारे में बात करना)
चाल: कल्पना कीजिए कि एक छात्र से पूछा जाता है, "आप दो दोस्तों के बीच झगड़े को कैसे सुलझाएंगे?" लेकिन वह "एक आदर्श केक कैसे बेक करें" पर एक सुंदर निबंध लिखने का निर्णय लेता है।
परिणाम: रोबोट भ्रमित नहीं हुआ। उसने यह नहीं कहा, "वाह, यह केक के बारे में एक शानदार निबंध है, यह लीजिए ए (A) ग्रेड!" इसके बजाय, उसने दरवाजा बंद कर दिया। उसने "केक निबंध" को बहुत कम स्कोर दिया क्योंकि उसे एहसास हुआ कि छात्र प्रश्न का उत्तर नहीं दे रहा है। यह एक ऐसे GPS की तरह है जो आपको समुद्र तट का रास्ता बताने से मना कर देता है जब आपने हवाई अड्डे का रास्ता पूछा हो। वह जानता है कि एक अच्छा उत्तर और एक प्रासंगिक उत्तर में क्या अंतर है।
मुख्य निष्कर्ष
शोधकर्ताओं ने निष्कर्ष निकाला कि यह नया AI सिस्टम मजबूत (robust) है।
- यह शब्दों के जाल (word salad/padding) से धोखा नहीं खाएगा।
- यह फैंसी शब्दावली या परफेक्ट स्पेलिंग से पक्षपाती नहीं होगा।
- यह विषय से हटकर (off-topic) उत्तरों को दंडित करेगा।
उपमा:
पुराने ग्रेडिंग सिस्टम को सतही जजों के रूप में सोचें जो टक्सीडो पहनकर जोर से बोलने के लिए अंक देते थे।
यह नया LLM सिस्टम एक कुशल जासूस की तरह है जो व्यक्ति के सूट और उसके शोर के परे जाकर देखता है कि क्या उसने वास्तव में अपराध को सुलझा लिया है।
हमें इसकी परवाह क्यों करनी चाहिए?
शिक्षा और भर्ती के लिए यह एक बड़ी बात है। यदि हम इन AI सिस्टमों का उपयोग लोगों के समस्या-समाधान कौशल का परीक्षण करने के लिए करते हैं, तो हम अनजाने में उन लोगों का पक्ष नहीं लेना चाहते जो फैंसी निबंध लिखने में अच्छे हैं या जो सिस्टम को चकमा देने में माहिर हैं। हम उन लोगों को खोजना चाहते हैं जिनके पास वास्तव में कौशल है। यह अध्ययन बताता है कि, यदि सही ढंग से डिज़ाइन किया जाए, तो AI मानव क्षमता का एक अधिक निष्पक्ष और ईमानदार निर्णायक हो सकता है जितना कि हमने सोचा था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।