BiasScope: Towards Automated Detection of Bias in LLM-as-a-Judge Evaluation
यह शोध पत्र **BiasScope** का प्रस्ताव करता है, जो LLM-as-a-judge मूल्यांकनों में अज्ञात पूर्वाग्रहों को सक्रिय रूप से खोजने के लिए डिज़ाइन किया गया एक स्वचालित LLM-संचालित फ्रेमवर्क है, और **JudgeBench-Pro** का परिचय देता है, जो एक अधिक चुनौतीपूर्ण बेंचमार्क है जो सबसे शक्तिशाली वर्तमान मूल्यांकनकर्ताओं में भी महत्वपूर्ण विश्वसनीयता अंतराल को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
"अविश्वसनीय न्यायाधीश" की समस्या: AI को अधिक निष्पक्ष बनाना
कल्पना कीजिए कि आप एक उच्च-स्तरीय कुकिंग प्रतियोगिता में भाग ले रहे हैं। विजेता का निर्णय करने के लिए, आयोजक किसी मानव शेफ को नहीं रखते; इसके बजाय, वे एक "रोबोट जज" (एक AI) को नियुक्त करते हैं।
शुरुआत में, रोबोट जज एकदम सटीक लगता है। यह तेज़ है, कभी थकता नहीं है, और नियमों का पालन करता है। लेकिन जैसे-जैसे प्रतियोगिता आगे बढ़ती है, आप कुछ अजीब देखते हैं। रोबोट जज किसी भी ऐसे व्यंजन को अतिरिक्त अंक देता हुआ प्रतीत होता है जिसे किसी शानदार सुनहरे प्लेट में परोसा गया हो, भले ही भोजन का स्वाद औसत दर्जे का हो। यह उन शेफों का भी पक्ष लेता हुआ दिखता है जो अपने अवयवों (ingredients) के लिए लंबे, जटिल नामों का उपयोग करते हैं, भले ही व्यंजन वास्तव में काफी सरल हो।
ये केवल यादृच्छिक गलतियाँ नहीं हैं; ये पूर्वाग्रह (biases) हैं। रोबोट जज ने ऐसे "ब्लाइंड स्पॉट्स" विकसित कर लिए हैं जो उसके निर्णयों को अनुचित बनाते हैं।
समस्या: हम वह नहीं जानते जो हम नहीं जानते
वर्तमान में, शोधकर्ता अन्य AI को परखने के लिए AI का उपयोग करते हैं। इसे "LLM-as-a-Judge" कहा जाता है। समस्या यह है कि हम केवल "प्रसिद्ध" पूर्वाग्रहों (जैसे कि रोबलेट का लंबे उत्तरों को पसंद करना) के बारे में ही जानते हैं। हमें इस बारे में कोई जानकारी नहीं है कि इन AI जजों में अन्य कौन से अजीब, छिपे हुए पूर्वाग्रह हो सकते हैं। यह एक विशाल भूमिगत पाइप प्रणाली में रिसाव खोजने जैसा है—आप केवल उन लीकेज को नहीं खोज सकते जिन्हें आपने पहले देखा है; आपको उन्हें भी खोजना होगा जो अभी तक हुए ही नहीं हैं।
समाधान: BIASSCOPE (द "स्ट्रेस-टेस्टर")
शोधकर्ताओं ने BIASSCOPE नामक एक उपकरण बनाया है। BIASSCOPE को एक जज के रूप में नहीं, बल्कि एक "केओस एजेंट" (Chaos Agent) या एक "स्ट्रेस-टेस्टर" के रूप में सोचें।
पूर्वाग्रह के होने का इंतज़ार करने के बजाय, BIASSCOPE सक्रिय रूप से AI जज को "तोड़ने" की कोशिश करता है ताकि उसकी कमजोरियों का पता लगाया जा सके। यह एक चतुर, दो-चरणीय लूप (loop) में काम करता है:
खोज चरण (The "Prankster"):
BIASSCOPE एक बिल्कुल सही उत्तर लेता है और उसके साथ "मजाक" (prank) करता है। यदि उसे संदेह है कि जज "अधिकार/सत्ता" (authority) के प्रति पक्षपाती हो सकता है, तो वह एक गलत उत्तर लेता है और उसमें किसी प्रसिद्ध वैज्ञानिक का फर्जी उद्धरण जोड़ देता है। फिर वह जज को देखता है। यदि जज अचानक अपना मन बदल लेता है और केवल इसलिए गलत उत्तर चुन लेता है क्योंकि एक "वैज्ञानिक" ने ऐसा कहा था, तो BIASSCOPE चिल्लाता है, "आहा! मुझे एक नया पूर्वाग्रह मिल गया: अथॉरिटी बायस (Authority Bias)!"सत्यापन चरण (The "Fact-Checker"):
एक बार जब BIASSCOPI को लगता है कि उसने एक नया पूर्वाग्रह ढूंढ लिया है, तो वह केवल जश्न नहीं मनाता। वह यह सुनिश्चित करने के लिए कि यह केवल एक इत्तेफाक नहीं था, एक व्यापक परीक्षण चलाता है। वह इन "प्रैंक्ड" (मजाक किए गए) प्रश्नों की एक पूरी लाइब्रेरी बनाता है ताकि यह देखा जा सके कि क्या यह पूर्वाग्रह सुसंगत है। यदि जज बार-बार एक ही तरह के धोखे में आता है, तो उस पूर्वाग्रह को आधिकारिक तौर पर ज्ञात खामियों की "ब्लैक बुक" में जोड़ दिया जाता है।
परिणाम: JudgeBench-Pro (द "अल्टीमेट ऑब्स्टेकल कोर्स")
इन सभी नए, अजीब पूर्वाग्रहों को खोजने के बाद, शोधकर्ताओं ने एक नया, बहुत कठिन परीक्षण बनाया जिसे JudgeBench-Pro कहा जाता है।
यदि पुराना परीक्षण पार्क में एक सुखद सैर जैसा था, तो JudgeBench-Pro जालों से भरा एक कठिन बाधा दौड़ (obstacle course) है। जब उन्होंने दुनिया के सबसे शक्तिशाली AI (जैसे GPT-4o) का इस नए कोर्स पर परीक्षण किया, तो उन्हें कुछ चौंकाने वाला पता चला: सबसे बुद्धिमान AI भी बुरी तरह विफल रहे। वे उतनी ही बार जाल में फंसे जितनी बार वे केवल अनुमान लगा रहे होते।
यह क्यों मायने रखता है?
जैसे-जैसे हम उस युग में प्रवेश कर रहे हैं जहाँ AI हर चीज़ का निर्णय करेगा—चाहे वह यह हो कि एक छात्र ने निबंध कितनी अच्छी तरह लिखा है या एक सेल्फ-ड्राइविंग कार कितनी सुरक्षित है—हम छिपे हुए पूर्वाग्रहों वाले "रोबोट जजों" को बर्दाश्त नहीं कर सकते।
BIASSCOPE हमें इन छिपे हुए दोषों को स्वचालित रूप से खोजने का एक तरीका देता है, जिससे हमें ऐसे AI जज बनाने में मदद मिलती है जो न केवल तेज़ हैं, बल्कि वास्तव में निष्पक्ष और विश्वसनीय भी हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।