← नवीनतम पेपर
🤖 AI

MiSCHiEF: A Benchmark in Minimal-Pairs of Safety and Culture for Holistic Evaluation of Fine-Grained Image-Caption Alignment

यह शोध पत्र MiSCHiEF को प्रस्तुत करता है, जो विज़न-लैंग्वेज मॉडल्स में सूक्ष्म-स्तरीय इमेज-कैप्शन संरेखण (alignment) का मूल्यांकन करने के लिए सुरक्षा और संस्कृति के न्यूनतम-जोड़ी (minimal-pair) डेटासेट्स वाला एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल सटीक क्रॉस-मोडल ग्राउंडिंग में संघर्ष करते हैं और सूक्ष्म अर्थ संबंधी एवं दृश्य अंतरों को पहचानने में विशिष्ट पूर्वाग्रह प्रदर्शित करते हैं।

मूल लेखक: Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sagarika Banerjee, Tangatar Madi, Advait Swaminathan, Nguyen Dao Minh Anh, Shivank Garg, Kevin Zhu, Vasu Sharma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को तस्वीरें दिखाकर और बोलकर विवरण पढ़कर दुनिया को समझना सिखा रहे हैं। आप चाहते हैं कि यह रोबोट इतना स्मार्ट हो कि वह एक सुरक्षित स्थिति और एक खतरनाक स्थिति के बीच का सूक्ष्म अंतर पहचान सके, या एक देश की सांस्कृतिक परंपरा और दूसरे देश की बहुत मिलती-जुलती परंपरा के बीच का अंतर जान सके।

"MiSCHiEF" नामक शोध पत्र एक नए परीक्षण के बारे में है जो यह देखने के लिए बनाया गया है कि क्या ये रोबोट (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) वास्तव में ध्यान दे रहे हैं, या वे सिर्फ अंदाज़ा लगा रहे हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: रोबोट "लापरवाह" है

वर्तमान AI मॉडलों को एक ऐसे छात्र की तरह समझें जो बड़ी तस्वीर (big picture) पढ़ने में तो बहुत अच्छा है लेकिन टाइपिंग की गलतियाँ (typos) पकड़ने में बहुत बुरा है।

  • परिदृश्य: आप रोबोट को एक महिला द्वारा दीवार के सॉकेट में लैंप प्लग करने की तस्वीर दिखाते हैं। कैप्शन कहता है, "एक महिला आउटलेट में एक लैंप लगा रही है।" रोबोट कहता है, "हाँ, यह सही है।"
  • जाल: आप वही ठीक वही तस्वीर दिखाते हैं, लेकिन कैप्शन को बदलकर ऐसा कर देते हैं: "एक महिला आउटलेट में एक कांटा (fork) लगा रही है।"
  • परिणाम: एक इंसान तुरंत समझ जाएगा कि यह खतरनाक और गलत है। लेकिन AI अक्सर कहता है, "हाँ, यह भी सही है!" क्योंकि वह एक महिला और एक सॉकेट को देखता है और वहीं रुक जाता है। वह जीवन-मरण के सूक्ष्म विवरण को मिस कर देता है।

2. समाधान: "MiSCHiEF" टेस्ट

शोधकर्ताओं ने MiSCHiEF (जो Minimal-Safety and Culture Holistic Image-Evaluation Framework का संक्षिप्त रूप है) नामक एक नया टेस्ट बनाया है।

इस टेस्ट को एक "अंतर पहचानो" (Spot the Difference) खेल की तरह समझें, लेकिन यहाँ अंतर अविश्वसनीय रूप से सूक्ष्म हैं और दांव पर बहुत कुछ लगा है। इस टेस्ट के दो मुख्य स्तर हैं:

  • स्तर 1: सुरक्षा स्तर (MiS)

    • उपमा: एक ऐसे खेल की कल्पना करें जहाँ आपको एक पंक्ति में से वह एक तस्वीर ढूंढनी है जो किसी को कुछ खतरनाक करते हुए दिखाती है।
    • टेस्ट: AI दो लगभग एक जैसी तस्वीरें देखता है। एक में एक बच्चा ब्लॉक्स (blocks) के साथ खेल रहा है (सुरक्षित)। दूसरे में वही बच्चा चाकू (knife) के साथ खेल रहा है (असुरक्षित)। कैप्शन लगभग एक जैसे हैं, बस "ब्लॉक्स" शब्द को "चाकू" से बदल दिया गया है।
    • लक्ष्य: क्या AI यह बता सकता है कि दूसरा वाला एक बड़ी आपदा है?
  • स्तर 2: संस्कृति स्तर (MiC)

    • उपमा: एक फैशन शो की कल्पना करें जहाँ दो मॉडल बहुत समान दिखते हैं, लेकिन एक ने घाना का पारंपरिक केन्टे क्लॉथ (Kente cloth) पहना है, और दूसरे ने एंडीज का पोंचो (Poncho) पहना है।
    • टेस्ट: AI दो तस्वीरें देखता है। एक कैप्शन कहता है, "एक व्यक्ति केन्टे क्लॉथ पहने हुए है।" दूसरा कहता है, "एक व्यक्ति पोंचो पहने हुए है।" छवियां (images) ऐसी बनाई गई हैं कि वे बहुत समान दिखें, लेकिन सांस्कृतिक विवरण अलग-अलग हैं।
    • लक्ष्य: क्या AI संस्कृति का सम्मान करने के लिए इतना सक्षम है कि वह जान सके कि कौन सा पहनावा किस परंपरा का है, बजाय इसके कि वह उन्हें आपस में मिला दे?

3. उन्होंने इस टेस्ट को कैसे बनाया

शोधकर्ताओं ने केवल रैंडम तस्वीरें नहीं लीं। उन्होंने इन पेयर्स (pairs) को बनाने के लिए एक "फैक्ट्री" बनाई:

  1. स्क्रिप्ट लिखना: उन्होंने दो वाक्य लिखने के लिए AI का उपयोग किया जो 99% समान थे, जिनमें केवल एक छोटा सा शब्द बदला गया था (जैसे "लैंप" से "कांटा" या "पोलैंड" से "तुर्की")।
  2. तस्वीर बनाना: उन्होंने उन वाक्यों से मेल खाने वाली दो छवियां बनाने के लिए AI आर्ट जनरेटर का उपयोग किया।
  3. मानवीय जाँच: वास्तविक मनुष्यों ने हर एक जोड़ी को देखा ताकि यह सुनिश्चित किया जा सके कि "खतरनाक" वाली तस्वीर वास्तव में खतरनाक दिख रही है और "सांस्कृतिक" वाली तस्वीर सटीक है। यह एक शिक्षक द्वारा टेस्ट को ग्रेड करने जैसा है ताकि यह सुनिश्चित किया जा सके कि प्रश्न गलत नहीं हैं।

4. उन्हें क्या मिला (बुरी खबर)

जब उन्होंने अपने AI मॉडलों को इस टेस्ट के माध्यम से चलाया, तो परिणाम थोड़े शर्मनाक थे:

  • "हाँ-में-हाँ मिलाने वाला" (Yes-Man) पूर्वाग्रह: रोबोट तब बहुत अच्छे थे जब चीजें मैच होती थीं। यदि आप उन्हें एक सुरक्षित तस्वीर और एक सुरक्षित कैप्शन दिखाते, तो वे सही होते। लेकिन यदि आप उन्हें एक खतरनाक तस्वीर दिखाते और पूछते, "क्या यह सुरक्षित है?", तो वे अक्सर फिर भी कहते, "हाँ।" वे सहमत होने के लिए बहुत उत्सुक रहते हैं और "ना" कहने में खराब हैं।
  • एकतरफा रास्ता: रोबोट एक तस्वीर को देखकर कैप्शन का अनुमान लगाने में बेहतर थे, लेकिन कैप्शन को देखकर तस्वीर का अनुमान लगाने में बहुत खराब थे। यह ऐसा है जैसे वे फोटो का वर्णन तो अच्छी तरह कर सकते हैं, लेकिन वे उस फोटो को नहीं ढूंढ सकते जो एक विवरण से मेल खाती हो।
  • भ्रम (Confusion): जब उन्हें एक साथ दो तस्वीरों को दो कैप्शन से मिलाने के लिए कहा गया, तो रोबोट बहुत भ्रमित हो गए, जैसे कोई व्यक्ति आँखों पर पट्टी बांधकर पहेली सुलझाने की कोशिश कर रहा हो।

5. यह क्यों मायने रखता है

हमें इस बात से क्या फर्क पड़ता है कि एक रोबोट कांटे (fork) और लैंप के बीच भ्रमित हो जाता है?

  • सुरक्षा: यदि किसी रोबोट का उपयोग घरों की सुरक्षा की निगरानी के लिए किया जाता है (जैसे बच्चों पर नज़र रखना), और वह खिलौने और हथियार के बीच अंतर नहीं कर सकता, तो वह वास्तविक आपात स्थिति को मिस कर सकता है।
  • संस्कृति: यदि एक रोबोट का उपयोग इतिहास सिखाने या सोशल मीडिया मॉडरेशन के लिए किया जाता है, और वह एक संस्कृति के पारंपरिक पहनावे को दूसरी संस्कृति के साथ मिला देता है, तो वह गलत सूचना फैलाता है और लोगों की पहचान का अनादर करता है।

निष्कर्ष (The Bottom Line)

MiSCHiEF टेस्ट एक चेतावनी है। यह दिखाता है कि जबकि हमारे AI "जंगल" को देखने में स्मार्ट होते जा रहे हैं, वे अभी भी "पेड़ों" को देखने में बहुत खराब हैं। जब तक ये मॉडल उन सूक्ष्म अंतरों को नहीं पहचान लेते जो सुरक्षा को खतरे से और सम्मान को अनादर से अलग करते हैं, हम पूरी तरह से वास्तविक दुनिया में उन पर भरोसा नहीं कर सकते।

शोधकर्ता मूल रूप से कह रहे हैं: "हमने AI को उसकी अपनी कमियों (blind spots) को दिखाने के लिए एक छोटा, चालाकी भरा दर्पण बनाया है, और परिणाम यह है कि AI अभी भी थोड़ा अंधा है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →