MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following
यह शोध पत्र MCJudgeBench प्रस्तुत करता है, जो मल्टी-कन्स्ट्रेंट इंस्ट्रक्शन फॉलोइंग के लिए बाधा स्तर (constraint level) पर LLM जजों का मूल्यांकन करने हेतु डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि समग्र जज प्रदर्शन विशिष्ट लेबल श्रेणियों में विश्वसनीयता या गड़बड़ी (perturbations) के विरुद्ध स्थिरता की गारंटी नहीं देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जो एक छात्र के निबंध का मूल्यांकन कर रहे हैं। शिक्षक के पास एक बहुत ही विशिष्ट चेकलिस्ट है: निबंध ठीक 500 शब्दों का होना चाहिए, इसमें 10 अक्षरों से लंबे शब्दों का उपयोग नहीं किया जाना चाहिए, इसमें शेक्सपियर का एक उद्धरण शामिल होना चाहिए, और इसे एक समुद्री डाकू (pirate) की शैली में लिखा जाना चाहिए।
अतीत में, यदि आपने किसी AI (एक "जज") से इस निबंध को ग्रेड करने के लिए कहा होता, तो वह केवल एक एकल स्कोर देता: "अच्छा काम किया" या "बुरा काम किया।" लेकिन क्या होगा यदि AI "अच्छा काम किया" कहता है भले ही छात्र शेक्सपियर का उद्धरण भूल गया हो? या क्या होगा यदि वह केवल इसलिए "बुरा काम किया" कहता है क्योंकि छात्र ने एक अलग फ़ॉन्ट का उपयोग किया था, भले ही उसने अन्य सभी नियमों का पालन किया हो?
यह शोध पत्र इस समस्या को ठीक करने के लिए MCJudgeBench नामक एक नया टूल पेश करता है। यह चेकलिस्ट पर प्रत्येक विशिष्ट नियम की जांच करने के लिए शिक्षक को एक आवर्धक लेंस (magnoring glass) देने जैसा है, बजाय इसके कि केवल पूरे निबंध को एक साथ देखा जाए।
यहाँ एक सरल विवरण दिया गया कि शोधकर्ताओं ने क्या किया और क्या पाया:
1. समस्या: "अंधा" जज
वर्तमान AI जज अक्सर उस व्यक्ति की तरह होते हैं जो केवल यह तय करने के लिए कि कहानी अच्छी है या नहीं, किताब के कवर को देखते हैं। वे कह सकते हैं, "यह बहुत अच्छा लग रहा है!" बिना यह देखे कि कहानी में एक अध्याय गायब है या उसका अंत गलत है।
- समस्या: जब एक AI से एक साथ कई नियमों (multi-constraint) का पालन करने के लिए कहा जाता है, तो वह अक्सर भ्रमित हो जाता है। वह "बड़ी तस्वीर" को सही पकड़ सकता है लेकिन विशिष्ट विवरणों में विफल हो सकता है।
- जोखिम: यदि हम इन जजों पर आँख मूंदकर भरोसा करते हैं, तो हमें लग सकता है कि एक AI निर्देशों का पूरी तरह से पालन कर रहा है जबकि वास्तव में वह आधे आवश्यकताओं को मिस कर रहा है।
2. समाधान: MCJudgeBench (द "माइक्रोस्कोप")
शोधकर्ताओं ने MCJudgeBench नामक एक नया परीक्षण बनाया है। इसे AI जजों के लिए एक "तनाव परीक्षण" (stress test) समझें।
- सेटअप: उन्होंने कई नियमों वाले 141 पेचीदा निर्देश बनाए (जैसे कि समुद्री डाकू वाला निबंध उदाहरण)।
- स्वर्ण मानक (The Gold Standard): मनुष्यों ने उत्तरों को देखा और सटीक रूप से चिह्नित किया कि कौन से नियमों का पालन किया गया ("हाँ"), कौन से आंशिक रूप से पालन किए गए ("आंशिक"), और कौन से टूट गए ("नहीं")।
- ट्विस्ट (The Perturbations): यह सबसे चतुर हिस्सा है। शोधकर्ताओं ने उसी उत्तर को लिया और उसमें छोटे, हानिरहित बदलाव किए, जैसे:
- पैराफ्रेसिंग (Paraphrasing): "The cat sat" को "The feline rested" में बदलना। (अर्थ वही है)।
- पुनर्व्यवस्था (Reordering): दो वाक्यों के क्रम को बदलना।
- प्रॉम्प्ट परिवर्तन (Prompt Changes): AI जज से वही प्रश्न पूछना लेकिन अलग शब्दों का उपयोग करना।
यदि AI जज वास्तव में विश्वसनीय है, तो उसे मूल उत्तर और इन थोड़े बदले हुए संस्करणों के लिए बिल्कुल समान स्कोर देना चाहिए। यदि वह केवल शब्दों के इधर-उधर होने से अपना मन बदल लेता है, तो वह अस्थिर है।
3. निष्कर्ष: जज दोषपूर्ण हैं
शोधकर्ताओं ने इस नए माइक्रोस्कोप का उपयोग करके कई प्रसिद्ध AI मॉडलों (जैसे GPT, Claude, और Gemini) का परीक्षण किया। यहाँ उनकी खोजें दी गई हैं:
- उच्च स्कोर भ्रामक हो सकते हैं: एक AI जज को उच्च समग्र सटीकता स्कोर मिल सकता है, लेकिन वह इसलिए है क्योंकि वह "हाँ" (नियमों का पालन किया गया) को पहचानने में बहुत अच्छा है। वह "नहीं" या "आंशिक" (नियम टूटे या आधे-अधूरे थे) को पहचानने में अक्सर बहुत बुरा होता है। यह एक सुरक्षा गार्ड की तरह है जो बैज वाले लोगों को पहचानने में तो बहुत अच्छा है लेकिन बिना बैज वाले लोगों को पहचानने में बहुत बुरा है।
- "कांपते हाथ" की समस्या (Inconsistency): जब शोधकर्ताओं ने एक ही AI जज को एक ही उत्तर को पांच बार लगातार ग्रेड करने के लिए कहा, तो AI अक्सर हर बार अलग उत्तर देता था। यह एक सिक्का उछालने जैसा था। इसे आंतरिक असंगतता (intrinsic inconsistency) कहा जाता है।
- "संवेदनशील कान" की समस्या (Procedural Inconsistency): जब उन्होंने प्रश्न की शब्दावली बदली या उत्तर को थोड़ा इधर-उधर किया, तो कई जजों ने अपना निर्णय बदल लिया। वे जानकारी को प्रस्तुत करने के तरीके से आसानी से भ्रमित हो गए, न कि स्वयं सामग्री से।
- तर्क (Reasoning) हमेशा मदद नहीं करता: कुछ मॉडलों को ग्रेड करने से पहले "चरण-दर-चरण सोचने" के लिए कहा गया। हालांकि इससे कभी-कभी वे अधिक सटीक हुए, लेकिन इसने उन्हें हमेशा अधिक स्थिर नहीं बनाया। कभी-कभी, अधिक सोचने से वे "हाँ" और "नहीं" के बीच और अधिक झूलने लगते हैं।
4. निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि हम केवल एक संख्या को देखकर यह तय नहीं कर सकते कि एक AI जज अच्छा है या नहीं। हमें जांचना होगा:
- सटीकता (Accuracy): क्या वह नियमों को सही ढंग से पहचानता है?
- स्थिरता (Stability): क्या वह एक ही प्रश्न को अलग तरीके से पूछने पर भी समान उत्तर देता है?
- विवरण (Detail): क्या वह कठिन मामलों (टूटे हुए नियमों) को पहचानने में अच्छा है, या केवल आसान मामलों में?
संक्षेप में: शोध पत्र तर्क देता है कि हमें AI जजों को केवल एक "स्कोरकार्ड" के रूप में देखना बंद करना चाहिए और उन्हें निरीक्षकों की एक टीम के रूप में देखना शुरू करना चाहिए। हमें यह जांचना होगा कि क्या वे सुसंगत हैं, क्या वे छोटी गलतियों को पकड़ते हैं, और क्या वे इस बात से भ्रमित हो जाते हैं कि हम उनसे सवाल कैसे पूछते हैं। जब तक हम ऐसा नहीं करते, हम जटिल कार्यों को ग्रेड करने के लिए उन पर पूरी तरह से भरोसा नहीं कर सकते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।