← नवीनतम पेपर
🤖 machine learning

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

यह शोध पत्र OpenAI के GPT-4o mini में एक महत्वपूर्ण "यूनिमोडल बॉटलनेक" (Unimodal Bottleneck) की पहचान करता है, जहाँ संदर्भ-अंध (context-blind) सुरक्षा फ़िल्टर केवल पृथक दृश्य या पाठ्य संकेतों के आधार पर हानिकारक और निर्दोष दोनों प्रकार की मल्टीमॉडल सामग्री को अंधाधुंध रूप से रोक देते हैं, जिससे मॉडल की उन्नत तर्क क्षमताओं में बाधा आती है और अधिक एकीकृत संरेखण रणनीतियों की आवश्यकता पर बल मिलता है।

मूल लेखक: Niruthiha Selvanayagam, Ted Kurti

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Niruthiha Selvanayagam, Ted Kurti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, उच्च प्रशिक्षित सुरक्षा गार्ड है जिसका नाम GPT-4o mini है। इस गार्ड का काम एक विशाल डिजिटल पार्टी के गेट पर खड़ा होना और यह तय करना है कि कौन से मीम्स (मजेदार चित्र और टेक्स्ट) सुरक्षित रूप से अंदर आने दे सकते हैं और कौन से घृणास्पद हैं जिन्हें प्रतिबंधित किया जाना चाहिए।

यह पेपर एक जासूसी रिपोर्ट की तरह है जो इस बात की जांच करती है कि यह गार्ड कभी-कभी अजीब गलतियां क्यों करता है। शोधकर्ताओं ने पाया कि भले ही गार्ड को मजाक को समझने के लिए चित्र और टेक्स्ट दोनों को एक साथ देखने का विशेषज्ञ होना चाहिए, लेकिन यह अक्सर अपने ही सुरक्षा नियमों से "अंधा" हो जाता है।

यहाँ इस पेपर की खोजों का विवरण दिया गया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. "दो-सिर वाला" सुरक्षा तंत्र

शोधकर्ताओं ने पाया कि गार्ड वास्तव में चित्र और टेक्स्ट को पहले एक साथ नहीं देखता है। इसके बजाय, मुख्य मस्तिष्क के शामिल होने से पहले इसके पास दो अलग-अलग, आंखों पर पट्टी बंधे स्कैनर काम कर रहे होते हैं:

  • स्कैनर A केवल चित्र को देखता है।
  • स्कैनर B केवल टेक्स्ट को देखता है।

यदि किसी भी स्कैनर को एक अकेला शब्द या एक अकेला चित्र दिखता है जो अपने आप में "जोखिम भरा" लगता है, तो वह तुरंत दरवाजा बंद कर देता है। वह यह देखने के लिए इंतजार नहीं करता कि चित्र और टेक्स्ट मिलकर वास्तव में एक हानिरहित मजाक बना रहे हैं या नहीं।

उपमा: एक क्लब के बाउंसर की कल्पना करें जो आपको सिर्फ इसलिए रोकता है क्योंकि आपने लाल शर्ट पहनी है (स्कैनर A) या क्योंकि आपके हाथ में चाकू के आकार का लेटर ओपनर है (स्कैनर B)। वह यह देखने के लिए इंतजार नहीं करता कि आप वास्तव में एक पार्टी के लिए सामग्री लेकर आ रहे शेफ हैं, या वह लाल शर्ट सिर्फ एक फैशन पसंद है। वह बस कहता है, "प्रवेश निषेध," और आपको ब्लॉक कर देता है।

2. "50/50" का विभाजन

शोधकर्ताओं ने 144 बार परीक्षण किया कि कब गार्ड ने एक मीम को अंदर आने से मना कर दिया। उन्होंने एक सटीक विभाजन पाया:

  • 50% समय, केवल चित्र ने अलार्म बजाया।
  • 50% समय, केवल टेक्स्ट ने अलार्म बजाया।

यह साबित करता है कि गार्ड अपना "मल्टीमॉडल" (संयुक्त दृष्टि) मस्तिष्क उपयोग करके स्मार्ट निर्णय नहीं ले रहा है। वह केवल इन दो अलग-अलग, कठोर फिल्टरों पर निर्भर है।

3. "भंगुर" फिल्टर (अति-प्रतिक्रिया देना)

पेपर दिखाता है कि ये सुरक्षा फिल्टर "भंगुर" (brittle) हैं, जिसका अर्थ है कि वे आसानी से टूट जाते हैं और अति-प्रतिक्रिया देते हैं।

  • अच्छी प्रतिक्रिया: गार्ड एडोल्फ हिटलर की तस्वीर को सही ढंग से ब्लॉक करता है। यह अपेक्षित है।
  • खराब प्रतिक्रिया: गार्ड लियोनार्डो डिकैप्रियोओ के पार्टी में हंसने वाली एक तस्वीर को भी ब्लॉक कर देता है। क्यों? क्योंकि गार्ड ने सीखा है कि "लियोनार्डो डिकैप्रियो" एक लोकप्रिय मीम फॉर्मेट है, और कहीं न कहीं उसके प्रशिक्षण में, यह छवि बुरी चीजों के साथ मिल गई थी। इसलिए, वह सुरक्षित रहने के लिए एक हानिरहित, मजेदार तस्वीर को ब्लॉक कर देता है।

उपमा: यह हवाई अड्डे के मेटल डिटेक्टर जैसा है जो न केवल बंदूकों के लिए बीप करता है, बल्कि एक विशिष्ट ब्रांड के बेल्ट बकल के लिए भी बीप करता है जो बंदूक जैसा दिखता है। गार्ड उन सभी को रोकता है जिनके पास वह बेल्ट बकल है, भले ही वे केवल जन्मदिन की पार्टी में जा रहे हों।

4. "नकली कहानी" की समस्या

जब गार्ड एक मीम को अंदर जाने देता है लेकिन फिर भी उसे घृणास्पद समझता है, तो वह कभी-कभी एक कहानी गढ़ लेता है।

  • यदि वह एक मूल अमेरिकी (Native American) की तस्वीर देखता है और टेक्स्ट बैंक के बारे में है, तो वह एक संबंध बना सकता है, यह सोचते हुए, "ओह, यह घर चोरी करने के बारे में होगा!" भले ही वह मीम वास्तव में निर्दोष हो।
  • यदि वह "व्हाइट गिल्ट" (white guilt) के बारे में कोई मजाक देखता है, तो वह सोच सकता है कि मजाक अपमानजनक है, बजाय इसके कि वह समझ सके कि यह एक व्यंग्य (satire) है।

उपमा: यह एक संदिग्ध जासूस जैसा है जो, सूट पहने और ब्रीफकेस पकड़े एक आदमी को देखकर, तुरंत मान लेता है कि वह एक जासूस है, भले ही वह केवल एक बैठक के लिए जा रहा एक व्यवसायी हो। जासूस खतरे को मिस करने से इतना डरता है कि वह वहां भी खतरे बना देता है जहां कोई खतरा नहीं है।

5. मुख्य निष्कर्ष

पेपर तर्क देता है कि "स्मार्ट" होने और "सुरक्षित" होने के बीच एक मौलिक तनाव है।

  • सुरक्षित होने के लिए, गार्ड सरल, भारी नियमों का उपयोग करता है (कोई लाल शर्ट नहीं! कोई चाकू नहीं!)।
  • स्मार्ट होने के लिए, गार्ड को संदर्भ (context) को समझने की आवश्यकता है (वह लाल शर्ट एक वर्दी है; वह चाकू एक लेटर ओपनर है)।

वर्तमान में, "सुरक्षा नियम" जीत रहे हैं। वे इतने आक्रामक हैं कि वे गार्ड को एक मजाक की बारीकियों को समझने के लिए अपने उन्नत मस्तिष्क का उपयोग करने से रोक देते हैं। इससे बहुत सारे गलत अलार्म (false alarms) उत्पन्न होते हैं जहाँ हानिरहित, मजेदार या महत्वपूर्ण सामग्री को ब्लॉक कर दिया जाता है।

निष्कर्ष: पेपर सुझाव देता है कि AI के वास्तव में सहायक और सुरक्षित होने के लिए, हम केवल एक ऐसे बाउंसर के साथ नहीं रह सकते जो एक कीवर्ड या छवि के आधार पर चीजों को ब्लॉक करता है। हमें एक ऐसी प्रणाली की आवश्यकता है जो पूरा मामला समझे—चित्र, टेक्स्ट और संदर्भ—इससे पहले कि वह दरवाजा बंद करने का निर्णय ले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →