Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor
यह शोध पत्र एक नवीन बहुआयामी (multimodal) और बहुभाषी बेंचमार्क प्रस्तुत करता है जिसमें अंग्रेजी और अरबी में 3,000 टेक्स्ट, 6,000 चित्र और 1,200 वीडियो शामिल हैं, जो सुरक्षित, प्रत्यक्ष रूप से हानिकारक और गुप्त रूप से हानिकारक हास्य के बीच अंतर करने की अत्याधुनिक मॉडलों की क्षमता का मूल्यांकन करने के लिए है, जो क्लोज्ड-सोर्स और ओपन-सोर्स मॉडलों के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और सांस्कृतिक रूप से आधारित सुरक्षा संरेखण (safety alignment) की तत्काल आवश्यकता पर प्रकाश डालता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि इंसानी चुटकुले कैसे समझे जाते हैं। आप उसे टोपी पहने हुए एक बिल्ली की तस्वीर दिखाते हैं, और वह हंस पड़ता है। आसान है! लेकिन फिर आप उसे एक ऐसा चुटकुला दिखाते हैं जो ऊपर से तो मजेदार लगता है लेकिन वास्तव में दुर्भावनापूर्ण (mean-spirited) है, या एक ऐसा मीम (meme) जो किसी विशिष्ट सांस्कृतिक अंदरूनी मजाक पर आधारित है। अचानक, रोबोट भ्रमित हो जाता है। वह एक हानिरहित चुटकुले को खतरनाक मान सकता है, या इससे भी बुरा, वह एक ऐसे चुटकुले पर हंस सकता है जो वास्तव में कष्टदायक है।
यह शोध पत्र, "Harm or Humor" (हानि या हास्य), ठीक इसी बात का परीक्षण करने के लिए डिज़ाइन किया गया एक विशाल, पेचीदा "फाइनल एग्जाम" है कि AI यह पहचानने में कितना सक्षम है कि एक मजेदार चुटकुले और एक हानिकारक एक के बीच का अंतर क्या है।
यहाँ रोज़मर्रा के उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:
1. समस्या: रोबोट का "सांस्कृतिक अंधापन"
AI मॉडल्स को उन नए नियुक्त इंटर्न के रूप में सोचें जिन्होंने लाइब्रेरी की हर किताब पढ़ ली है लेकिन वे वास्तव में वास्तविक दुनिया में कभी नहीं रहे। वे शब्दों की शब्दकोश वाली परिभाषाएं जानते हैं, लेकिन वे बारीकियों (nuance) को नहीं समझते।
- "ओवर्ट" (स्पष्ट) हानि: यह एक ऐसे जोकर की तरह है जिसने एक साइन बोर्ड पहना है जिस पर लिखा है "मैं बुरा व्यवहार कर रहा हूँ।" AI इसे आसानी से पहचान सकता है क्योंकि "बुरा" हिस्सा बड़े, गहरे अक्षरों में लिखा है।
- "कवर्ट" (अंतर्निहित/अस्पष्ट) हानि: यह एक ऐसे जोकर की तरह है जो एक विशेष गाँव के लोगों के बीच समझ में आने वाला चुटकुला फुसफुसा रहा है। एक बाहरी व्यक्ति के लिए, यह मासूम लगता है। लेकिन ग्रामीणों के लिए, यह एक क्रूर अपमान है। वर्तमान AI मॉडल अक्सर इन फुसफुसाहटों को मिस कर देते हैं क्योंकि उनमें सांस्कृतिक संदर्भ और "लाइनों के बीच पढ़ने" की क्षमता की कमी होती है।
2. समाधान: "Harm or Humor" परीक्षा
शोधकर्ताओं ने एक विशाल, तीन-भाग वाला परीक्षण बनाया ताकि यह देखा जा सके कि क्या AI "सांस्कृतिक बुद्धिमत्ता" (Cultural Intelligence) के पाठ्यक्रम को पास कर सकता है। उन्होंने केवल टेक्स्ट का उपयोग नहीं किया; उन्होंने विभिन्न मीडिया का उपयोग किया, ठीक वैसे ही जैसे हम वास्तविक जीवन में हास्य का उपभोग करते हैं।
- टेक्स्ट सेक्शन: 3,000 चुटकुले (अंग्रेजी और अरबी में)।
- इमेज सेक्शन: 6,000 मीम्स (टेक्स्ट के साथ चित्र)।
- वीडियो सेक्शन: 1,200 लघु क्लिप्स (जहाँ टाइमिंग, आवाज़ और विजुअल्स मायने रखते हैं)।
ट्विस्ट: उन्होंने केवल यह नहीं पूछा, "क्या यह मजेदार है?" उन्होंने पूछा, "क्या यह सुरक्षित है?" और यदि यह सुरक्षित नहीं है, तो क्या खतरा स्पष्ट है (जैसे फिसलकर गिरना) या छिपा हुआ (जैसे कोई सूक्ष्म रूढ़िवादी धारणा/stereotype)?
3. टेस्ट सब्जेक्ट्स: "छात्र"
उन्होंने दो प्रकार के AI "छात्रों" का परीक्षण किया:
- प्राइवेट स्कूल (क्लोज्ड-सोर्स मॉडल्स): ये OpenAI (GPT) और Google (Gemini) जैसी कंपनियों के बड़े, महंगे AI मॉडल्स हैं। उन्होंने बहुत सारा डेटा देखा है और उनके सख्त नियम हैं।
- पब्लिक स्कूल (ओपन-सोर्स मॉडल्स): ये वे मॉडल्स हैं जिन्हें कोई भी डाउनलोड कर सकता है और अध्ययन कर सकता है। वे अक्सर अधिक लचीले होते हैं लेकिन कभी-कभी कम अनुशासित भी।
4. परिणाम: कौन पास हुआ?
परिणाम काफी चौंकाने वाले थे, जैसे कोई छात्र गणित के टेस्ट में तो अव्वल आए लेकिन स्थानीय रीति-रिवाजों के टेस्ट में फेल हो जाए।
- "अंग्रेजी" का पक्षपात (Bias): AI मॉडल्स अंग्रेजी में चुटकुलों को समझने में अरबी की तुलना में बहुत बेहतर थे। यह एक ऐसे छात्र की तरह है जो फ्रेंच में तो कुशल है लेकिन साधारण स्पेनिश मुहावरों में लड़खड़ा जाता है। सबसे स्मार्ट मॉडल्स भी अरबी के सांस्कृतिक सूक्ष्मताओं को समझने में संघर्ष करते दिखे।
- "इम्प्लिसिट" (अंतर्निहित) जाल: मॉडल्स "साइन बोर्ड वाले जोकरों" (स्पष्ट हानि) को पहचानने में बहुत अच्छे थे। लेकिन जब बात "फुसफुसाए गए चुटकुलों" (अंतर्निहित हानि) की आई, तो वे अक्सर विफल रहे। वे छिपे हुए अपमानों को मिस कर गए क्योंकि वे गहरे अर्थ के बजाय सतही कीवर्ड्स को देख रहे थे।
- "सेफ्टी ओवररिएक्शन" (सुरक्षा के नाम पर अति-प्रतिक्रिया): कुछ ओपन-सोर्स मॉडल्स गलती करने के डर से इतने डरे हुए थे कि उन्होंने उत्तर देने से इनकार कर दिया या हर चीज़ को "सुरक्षित" लेबल कर दिया। यह एक ऐसे सुरक्षा गार्ड की तरह है जो, बुरा आदमी अंदर न आ जाए इस डर से, दरवाज़ा बंद कर देता है और हर किसी को बाहर ही रखता है। यह बुरा है क्योंकि इसका मतलब है कि वे वास्तविक हानिकारक चुटकुलों को भी मिस कर देते हैं।
5. बड़ा निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि AI को बड़ा बनाना ही काफी नहीं है। आप केवल एक AI को अधिक डेटा खिलाकर यह उम्मीद नहीं कर सकते कि वह मानव संस्कृति को समझ जाएगा।
AI को सुरक्षित बनाने के लिए, हमें उसे सांस्कृतिक सहानुभूति (cultural empathy) सिखानी होगी। हमें उसे यह सिखाने की आवश्यकता है कि चुटकुला क्यों दुख पहुँचाता है, न कि केवल यह कि किन शब्दों का उपयोग किया गया है। वर्तमान में, AI एक ऐसे पर्यटक की तरह है जो नक्शा तो जानता है लेकिन स्थानीय रीति-रिवाजों को नहीं जानता; उसे वास्तव में हास्य और सुरक्षा को समझने के लिए एक स्थानीय (local) बनना सीखना होगा।
संक्षेप में: इस शोध पत्र ने यह दिखाने के लिए एक कठिन टेस्ट बनाया है कि हालांकि AI स्मार्ट हो रहा है, फिर भी वह हास्य के "अलिखित नियमों" को समझने में संघर्ष करता है, खासकर अंग्रेजी और अन्य संस्कृतियों के अलावा अन्य भाषाओं में। जब तक हम इसे ठीक नहीं करते, AI अनजाने में उन चीजों पर हंसता रहेगा जिन्हें उसे नहीं हंसना चाहिए, या उन चीजों से आहत होता रहेगा जिनसे उसे नहीं होना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।