Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity
यह शोध पत्र VOIR DIRE बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि सांस्कृतिक रूप से संदिग्ध सामग्री का मूल्यांकन करते समय MLLM-as-a-Judge सिस्टम विशिष्ट अंशांकन (कैलिब्रेशन) और ओरिएंटेशन विफलताओं से ग्रस्त होते हैं, जो यह प्रकट करता है कि विशिष्ट सांस्कृतिक मानदंडों के प्रति मॉडल के पूर्वाग्रह स्केल कंप्रेशन को ठीक करने के बाद भी बने रहते हैं और इन्हें पर्सोना प्रॉम्प्टिंग या इन-कॉन्टेक्स्ट प्रदर्शनों द्वारा पूरी तरह से हल नहीं किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने छात्रों के निबंधों को ग्रेड देने या तस्वीरों को रेट करने के लिए एक सुपर-स्मार्ट रोबोट जज को काम पर रखा है। आमतौर पर, हम यह देखने के लिए जाँच करते हैं कि क्या यह रोबोट मानव शिक्षकों के साथ सहमत है ताकि यह पता चल सके कि वह अपना काम अच्छा कर रहा है। लेकिन यह शोध पत्र एक पेचीदा सवाल पूछता है: रोबोट किन मानव शिक्षकों के साथ सहमत हो रहा है?
लेखक, डैनियल ली और उनकी टीम ने एक विशेष परीक्षण बनाया जिसे VOIR DIRE कहा जाता है (इसका नाम कानूनी प्रक्रिया से लिया गया है जिसमें छिपे हुए पूर्वाग्रहों को खोजने के लिए जूरी से पूछताछ की जाती है)। वे यह देखना चाहते थे कि क्या इन AI जजों में तस्वीरों को देखते समय एक "सांस्कृतिक पूर्वाग्रह" (cultural bias) है, विशेष रूप से यह तुलना करते हुए कि वे चीजों को अमेरिकी दृष्टिकोण बनाम मुख्य भूमि चीनी दृष्टिकोण के माध्यम से कैसे देखते हैं।
यहाँ उनके द्वारा पाए गए निष्कर्षों का सरल विवरण दिया गया है:
1. सेटअप: दो अलग-अलग दुनिया
शोधकर्ताओं ने 626 छवियों के जोड़े बनाए। प्रत्येक जोड़े में एक ही "अवधारणा" (जैसे कि उत्सव का भोजन, एक फैशन पोशाक, या एक इमारत) दिखाई गई थी, लेकिन उसे दो अलग-अलग तरीकों से स्टाइल किया गया था: एक बहुत ही अमेरिकी और एक बहुत ही चीनी।
उन्होंने दो समूहों के मानव विशेषज्ञों से इन छवियों को रेट करने के लिए कहा:
- समूह A: अमेरिकी विशेषज्ञ।
- समूह B: चीनी विशेषज्ञ।
ट्विस्ट: विशेषज्ञों ने अपने ही समूहों के भीतर एक-दूसरे के साथ सहमति जताई (वे सुसंगत थे), लेकिन वे एक ही छवियों पर एक-दूसरे से कड़ाई से असहमत थे।
- उदाहरण: एक सुविधा स्टोर के भोजन की छवि को अमेरिकियों द्वारा "कम गुणवत्ता" वाला माना जा सकता है, लेकिन चीनी विशेषज्ञों द्वारा "ताज़ा और विश्वसनीय" माना जा सकता है। दोनों समूह अपने स्वयं के सांस्कृतिक नियमों के आधार पर "सही" हैं, लेकिन संख्याएँ पूरी तरह से अलग हैं।
2. समस्या: रोबोट जज "अटका हुआ" है
जब AI जजों ने इन छवियों को देखा, तो उन्होंने एक तटस्थ रेफरी की तरह काम नहीं किया। उन्होंने दो विशिष्ट गलतियाँ कीं:
गलती A: "पॉजिटिविटी फ्लोर" (रबर बैंड)
एक ऐसे रूलर की कल्पना करें जहाँ निचले नंबर (1 और 2) "खराब" या "कम गुणवत्ता" का प्रतिनिधित्व करते हैं।
- मानवीय वास्तविकता: अमेरिकी अक्सर कुछ चीनी सांस्कृतिक वस्तुओं को "खराब" (1 या 2 रेटिंग देना) के रूप में रेट करते हैं।
- रोबोट की समस्या: AI जज रूलर के निचले हिस्से का उपयोग करने से मना कर देते हैं। वे लगभग कभी 1 या 2 नहीं देते। वे लगभग 3 के "फ्लोर" (न्यूनतम स्तर) पर अटक जाते हैं।
- परिणाम: क्योंकि AI कम स्कोर नहीं देता, यह अनजाने में चीनी विशेषज्ञों के साथ सहमत हो जाता है (जिन्होंने उन वस्तुओं को उच्च रेट किया) और अमेरिकी विशेषज्ञों के साथ असहमत हो जाता है (जिन्होंने उन्हें कम रेट किया)। AI "चीन को चुन" नहीं रहा है; यह बस इतना विनम्र है कि "यह बुरा है" नहीं कह पाता।
गलती B: "डिफ़ॉल्ट सेटिंग" (कम्पास)
भले ही शोधकर्ताओं ने इस "विनम्रता" के मुद्दे को ठीक करने के लिए AI को यह कहकर प्रयास किया कि, "मानो कि आप एक अमेरिकी हैं," AI पूरी तरह से गियर नहीं बदल पाया।
- यह एक GPS को बताने जैसा है, "न्यूयॉर्क की ओर चलो," लेकिन कार थोड़ा भटकती रहती है क्योंकि उसका आंतरिक कम्पास उत्तर की ओर ही अटका हुआ है।
- AI का एक डिफ़ॉल्ट सांस्कृतिक झुकाव होता है। यहाँ तक कि जब इसे अमेरिकी होने के लिए कहा जाता है, तब भी यह चीनी छवियों को जज करते समय थोड़ा चीनी सांस्कृतिक मानदंडों की ओर झुक जाता है। यह "ड्रिफ्ट" (भटकाव) केवल निर्देशों को बदलकर ठीक नहीं किया जा सका।
3. प्रयोग: पूर्वाग्रह को ठीक करने की कोशिश
टीम ने यह देखने के लिए विभिन्न तरकीबें आजमाईं कि क्या वे AI को एक निष्पक्ष जज बना सकते हैं:
- व्यक्तित्व बदलना (Persona): उन्होंने AI को कहा, "आप एक विशिष्ट अमेरिकी हैं" या "आप एक विशिष्ट चीनी व्यक्ति हैं।"
- परिणाम: इसने थोड़ी मदद की, लेकिन AI पूरी तरह से नहीं बदला। यह उन चीजों को कम स्कोर देने में सक्षम नहीं था जिन्हें अमेरिकन नापसंद करते हैं, भले ही उसे अमेरिकी होने के लिए कहा गया हो।
- उदाहरण दिखाना (In-Context Learning): उन्होंने AI को पूछने से पहले यह दिखाने के लिए उदाहरण दिखाए कि मनुष्यों ने समान चित्रों को कैसे रेट किया था।
- परिणाम: इसने वास्तव में चीजों को और खराब कर दिया। पूर्ण स्केल (1 से 5) का उपयोग करना सीखने के बजाय, AI ने केवल और भी उच्च स्कोर देना शुरू कर दिया (4 और 5)। इसने निष्पक्ष होना नहीं सीखा; इसने बस अधिक उत्साही होना सीख लिया।
4. मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि आप केवल एक "सहमति स्कोर" को देखकर यह नहीं बता सकते कि एक AI जज अच्छा है या नहीं।
- पुराना तरीका: "यह AI 80% समय मनुष्यों के साथ सहमत है।" (लेकिन कौन से मनुष्य? अमेरिकी? चीनी? दोनों?)
- नया तरीका: आपको दो स्कोर रिपोर्ट करने होंगे: "यह अमेरिकियों के साथ कितनी अच्छी तरह सहमत है?" और "यह चीनी लोगों के साथ कितनी अच्छी तरह सहमत है?"
यदि एक AI अमेरिकियों के साथ सहमत है लेकिन चीनी लोगों के साथ असहमत है (या इसके विपरीत), तो यह डेटा में गलती नहीं है—यह AI का एक गुण (property) है। यह प्रकट करता है कि AI कौन सा सांस्कृतिक "लेंस" पहन रहा है।
निचोड़
AI जज उन जूरी सदस्यों की तरह हैं जिनकी पूरी तरह से जांच नहीं की गई है। उनके पास छिपे हुए सांस्कृतिक पूर्वाग्रह हैं जो उन्हें एक समूह के लोगों के साथ "सहमत" बनाते हैं जबकि वे दूसरे समूह के साथ चुपचाप असहमत होते हैं। पेपर का तर्क है कि हमें यह मानना बंद कर देना चाहिए कि ये जज तटस्थ हैं और हमें सटीक रूप से मापना चाहिए कि वे किसकी संस्कृति का प्रतिनिधित्व कर रहे हैं।
मुख्य रूपक (Metaphor):
AI को एक थर्मामीटर के रूप में सोचें जो "कमरे के तापमान" पर अटका हुआ है।
- यदि आप इसे फ्रीजर (एक संस्कृति जो चीजों को कम रेट करती है) में रखते हैं, तो यह "जमा देने वाले तापमान" तक नहीं गिरेगा। यह "कमरे के तापमान" पर ही रहेगा।
- यदि आप इसे ओवन (एक संस्कृति जो उच्च रेट करती है) में रखते हैं, तो यह थोड़ा ऊपर जा सकता है, लेकिन यह उतना गर्म नहीं होगा जितना कि उसे होना चाहिए।
- पेपर कहता है: "केवल यह न कहें कि थर्मामीटर 'सटीक' है क्योंकि यह ओवन से मेल खाता है। हमें बताएं कि यह टूटा हुआ है क्योंकि यह ठंड को मापने से इनकार करता है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।