← नवीनतम पेपर
💬 NLP

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

यह शोध पत्र FBHM प्रस्तुत करता है, जो एक नया बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक विजन-लैंग्वेज मॉडल डेटासेट ह्यूरिस्टिक्स (dataset heuristics) पर निर्भरता के कारण घृणास्पद मीम डिटेक्शन (hateful meme detection) में सामान्यीकरण करने में विफल रहते हैं, और LSV प्रस्तावित करता है, जो एक लो-डेटा स्टीयरिंग वेक्टर विधि है जो कॉज़ल इंटरवेंशन (causal interventions) लागू करके प्रदर्शन में महत्वपूर्ण सुधार करती है।

मूल लेखक: Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: नफरत भरे भाषणों का "फेक न्यूज़" (Fake News)

कल्पना कीजिए कि आप एक सुरक्षा गार्ड को काम पर रख रहे हैं ताकि वह उन लोगों को पकड़ सके जो हथियार लेकर इमारत में घुसने की कोशिश कर रहे हैं। आप इस गार्ड को स्पष्ट हथियारों, जैसे कि एक बड़ी लाल बंदूक की तस्वीरों से प्रशिक्षित (train) करते हैं। गार्ड उस लाल बंदूक को पहचानने में माहिर हो जाता है।

लेकिन फिर, एक नया अपराधी आता है। उसके पास लाल बंदूक नहीं है; वह एक केले को हाथ में लिए हुए है जिसे बंदूक जैसा दिखने के लिए पेंट किया गया है, या उसने हथियार को एक टोस्टर के अंदर छिपा रखा है।

गार्ड पूरी तरह विफल हो जाता है। क्यों? क्योंकि गार्ड ने यह नहीं सीखा कि "हथियार" वास्तव में क्या होता है (खतरे की अवधारणा); उसने केवल उस विशिष्ट "लाल बंदूक" को पहचानना सीखा जो उसने ट्रेनिंग के दौरान देखी थी।

यही वह बात है जो यह पेपर कहता है कि वर्तमान AI मॉडल (VLMs) के साथ नफरत भरे मीम्स (hateful memes) को पहचानने में हो रही है।

  • ट्रेनिंग (The Training): वर्तमान AI मॉडल मानक डेटासेट्स (जैसे फेसबुक का हेटफुल मीम्स डेटासेट) पर प्रशिक्षित होते हैं। ये डेटासेट्स "अवलोकन संबंधी" (observational) होते हैं, जिसका अर्थ है कि वे केवल नफरत के उदाहरण दिखाते हैं, लेकिन यह नहीं बताते कि नफरत का निर्माण कैसे किया गया है।
  • विफलता (The Failure): जब ये AI मॉडल किसी नए प्रकार के नफरत भरे मीम का सामना करते हैं—जो किसी अलग विज़ुअल ट्रिक, अलग जोक या किसी अलग समूह को निशाना बनाता है—तो वे पूरी तरह विफल हो जाते हैं। उनका प्रदर्शन रैंडम अनुमान लगाने से भी बेहतर नहीं होता। वे "लाल बंदूक" को खोजने में ही फंसे रह जाते हैं और "केले" को पहचान नहीं पाते।

समाधान भाग 1: नया टेस्ट (FBHM)

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया, अत्यंत सख्त टेस्ट बनाया जिसे FBHM (फंक्शनैलिटी बेस्ड हेटफुल मीम्स) कहा जाता है।

इसे एक कार के लिए सॉफ्टवेयर स्ट्रेस टेस्ट की तरह समझें। केवल सामान्य सड़क पर गाड़ी चलाने के बजाय, आप इसे एक-एक करके हर विशिष्ट इलाके पर टेस्ट करते हैं: कीचड़, बर्फ, रेत और खड़ी ढलानें।

  • संरचना (The Structure): उन्होंने 5,000 मीम्स बनाए।
  • 25 "फंक्शनैलिटीज़" (The 25 Functionalities): ये नफरत को छिपाने के लिए इस्तेमाल किए जाने वाले विभिन्न "ट्रिक्स" हैं। उदाहरण के लिए:
    • नफरत व्यक्त करने के लिए इमोजी का उपयोग करना।
    • अपशब्दों (slurs) को छिपाने के लिए गलत स्पेलिंग का उपयोग करना।
    • एक "सकारात्मक" इमेज के साथ "नकारात्मक" कैप्शन का उपयोग करना (विडंबना/irony)।
    • एक नफरत भरी बात रखने के लिए चार्ट या ग्राफ का उपयोग करना।
  • 10 "लक्षित समुदाय" (The 10 Target Communities): उन्होंने इन ट्रिक्स का परीक्षण 10 अलग-अलग समूहों (जैसे मुस्लिम, यहूदी, महिलाएं, अप्रवासी आदि) के खिलाफ किया।

परिणाम: जब उन्होंने अपने सबसे अच्छे AI मॉडल्स को इस नए टेस्ट पर चलाया, तो मॉडल बुरी तरह विफल रहे। उन्होंने साबित कर दिया कि AI वास्तव में नफरत के बारे में "सोच" नहीं रहा था; वह केवल अपने पुराने ट्रेनिंग डेटा से पैटर्न को याद कर रहा था।

समाधान भाग 2: "स्टीयरिंग व्हील" (LSV)

शोधकर्ताओं को इस AI को बिना शुरुआत से दोबारा प्रशिक्षित किए (जो महंगा और धीमा है) या केवल कुछ उदाहरण दिखाकर (जो पर्याप्त नहीं है) ठीक करने के तरीके की आवश्यकता थी।

उन्होंने LSV (लर्नेबल स्टीयरिंग वेक्टर्स) नामक एक विधि का आविष्कार किया।

उपमा (The Analogy):
कल्पना कीजिए कि AI एक विशाल, जमी हुई मूर्ति है। आप इसे पिघलाकर फिर से आकार नहीं दे सकते (वह रिट्रेनिंग है)। आप इसे केवल कुछ निर्देश देकर नहीं समझा सकते (वह फ्यू-शॉट लर्निंग है)।

इसके बजाय, कल्पना कीजिए कि आप मूर्ति के आंतरिक गियर में एक छोटा, अदृश्य चुंबकीय स्टीयरिंग व्हील लगा देते हैं।

  • इस स्टीयरिंग व्हील को कैलिब्रेट करने के लिए आपको केवल 500 उदाहरणों (डेटा की बहुत कम मात्रा) की आवश्यकता है।
  • एक बार कैलिब्रेट होने के बाद, यह "स्टीयरिंग व्हील" हर बार जब वह किसी मीम को देखता है, तो मूर्ति के आंतरिक गियर को धीरे से दिशा देता है।
  • यह मूर्ति का चेहरा या शरीर नहीं बदलता; यह केवल उसके सोचने की दिशा को बदल देता है।

जादू (The Magic):

  • पहले: AI इस नए टेस्ट पर लगभग 46% सही था (लगभग तुक्का मार रहा था)।
  • LSV के बाद: AI उछलकर लगभग 74–75% सही हो गया।
  • सबसे अच्छी बात: क्योंकि हमने मूर्ति को ठीक करने के लिए उसे तोड़ा नहीं, इसलिए AI अभी भी अपने मूल काम में उतना ही अच्छा है। उसने "केले" को पहचानने के लिए "लाल बंदूक" को पहचानने की क्षमता खोई नहीं।

यह क्यों महत्वपूर्ण है

यह पेपर दिखाता है कि वर्तमान AI सुरक्षा उपकरण नाजुक हैं। वे क्लासरूम (मानक डेटासेट्स) में बहुत अच्छा काम करते हैं, लेकिन वास्तविक दुनिया (नए, चालाकी भरे मीम्स) में विफल हो जाते हैं।

शोधकर्ताओं ने सिद्ध किया कि:

  1. पुराने तरीके विफल होते हैं: केवल AI को कुछ उदाहरण दिखाना (In-Context Learning) या उसके वेट्स (weights) को थोड़ा बदलना (PEFT) तब काम नहीं करता जब डेटा कम हो।
  2. स्टीयरिंग काम करती है: इस "स्टीयरिंग वेक्टर" विधि का उपयोग करके, हम AI को नफरत की सामग्री (क्या) के बजाय नफरत की संरचना (कैसे) को समझने के लिए सिखा सकते हैं, और वह भी बहुत कम डेटा का उपयोग करके।

सीमाएं (The Catch)

लेखक इस बारे में ईमानदार हैं कि यह क्या नहीं करता है:

  • यह कोई जादुई छड़ी नहीं है: AI अभी भी सबसे जटिल, विडंबनापूर्ण या गणितीय रूप से छिपी हुई नफरत के साथ संघर्ष करता है।
  • यह एक सहायक है, बॉस नहीं: इन मॉडल्स का उपयोग मानव मॉडरेटर्स की मदद करने के लिए किया जाना चाहिए, उन्हें बदलने के लिए नहीं।
  • सुरक्षा सर्वोपरि: चूंकि यह शोध हमें सिखाता है कि नफरत कैसे बनाई जाती है, इसलिए डेटासेट और "स्टीयरिंग" टूल्स को निजी रखा गया है। वे केवल प्रमाणित शोधकर्ताओं के लिए उपलब्ध हैं ताकि बुरे तत्व इनका उपयोग बेहतर नफरत फैलाने के लिए न कर सकें।

संक्षेप में: इस पेपर ने एक बेहतर टेस्ट बनाया यह दिखाने के लिए कि AI नए प्रकार की नफरत के बारे में "मूर्ख" है, और फिर एक "स्टीयरिंग व्हील" का आविष्कार किया ताकि AI को उसका दिमाग खराब किए बिना नफरत के बारे में सोचना सिखाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →