← नवीनतम पेपर
🤖 AI

CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs

यह शोधपत्र CrossCult-KIBench प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में क्रॉस-कल्चरल नॉलेज इंसर्शन का मूल्यांकन करने के लिए अंग्रेजी, चीनी और अरबी संस्कृतियों के 9,800 इमेज-ग्राउंडेड मामलों वाला एक व्यापक बेंचमार्क है, साथ ही इसमें मेमोरी-कंडीशन्ड नॉलेज इंसर्शन (MCKI) नामक एक प्रस्तावित बेसलाइन विधि भी दी गई है, जो सांस्कृतिक अनुकूलन और व्यवहार संरक्षण के बीच संतुलन बनाने की वर्तमान चुनौतियों को उजागर करती है।

मूल लेखक: Zhen Zeng, Leijiang Gu, Feng Li, Jing Yu, Zenglin Shi

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhen Zeng, Leijiang Gu, Feng Li, Jing Yu, Zenglin Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सर्वज्ञानी रोबोट शेफ है। इस शेफ ने लाखों कुकबुक्स पढ़ी हैं, लेकिन उनमें से लगभग सभी अंग्रेजी में लिखी गई हैं और पश्चिमी रसोई पर आधारित हैं। यदि आप इस शेफ से पूछते हैं, "क्या यह व्यंजन परोसना ठीक है?" तो वे कह सकते हैं "हाँ!" क्योंकि उनके प्रशिक्षण डेटा में वह व्यंजन हर जगह लोकप्रिय है।

लेकिन यहाँ एक समस्या है: यदि आप एक विशिष्ट सांस्कृतिक संदर्भ में हैं जहाँ उस व्यंजन में सूअर का मांस (pork) शामिल है, और आप एक मुस्लिम परिवार को वह परोस रहे हैं, तो शेफ का "हाँ" कहना एक बहुत बड़ी गलती होगी। वे बदतमीजी नहीं कर रहे हैं; बस उनके पास इस विशिष्ट स्थिति के लिए अपनी याददाश्त में कोई विशेष सांस्कृतिक नियम नहीं है।

यह शोध पत्र इस रोबोट शेफ को ठीक करने का एक नया तरीका पेश करता है, बिना उन्हें फिर से प्रशिक्षित किए (जो कि पूरे रोबोट को फिर से बनाने जैसा होगा)।

समस्या: "एक ही आकार के सभी के लिए" वाला शेफ (The "One-Size-Fits-All" Chef)

लेखकों ने पाया कि वर्तमान AI मॉडल (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स कहा जाता है) चित्र देखने और बात करने में बहुत अच्छे हैं, लेकिन वे अक्सर सांस्कृतिक विवरणों को गलत समझते हैं। वे चीन या अरब की स्थितियों में भी "पश्चिमी" तर्क लागू करने की प्रवृत्ति रखते हैं।

  • उपमा: कल्पना कीजिए कि एक पर्यटक जानता है कि अमेरिका में (सड़क के दाईं ओर) कैसे गाड़ी चलाई जाती है। यदि आप उन्हें बिना यह बताए कि साइड बदल लें, यूके में छोड़ देते हैं, तो वे गलत साइड पर गाड़ी चलाएंगे और दुर्घटना का कारण बनेंगे। कार (AI) ठीक काम करती है, लेकिन ड्राइवर का ज्ञान नए वातावरण के अनुकूल नहीं है।

समाधान: "सांस्कृतिक ज्ञान का समावेश" (Cultural Knowledge Insertion)

कार को फिर से बनाने के बजाय, लेखक एक नया कार्य प्रस्तावित करते हैं जिसे क्रॉस-कल्चरल नॉलेज इंसर्शन (Cross-Cultural Knowledge Insertion) कहा जाता है।

  • रूपक: इसे इस तरह सोचें जैसे आप रोबोट शेफ को एक विशिष्ट यात्रा के लिए एक विशेष, जेब में रखने योग्य 'चीट शीट' दे रहे हैं।
    • यदि शेफ चीन के रात्रिभोज के लिए जा रहा है, तो आप उसकी जेब में एक कार्ड डाल देते हैं जिसमें लिखा है: "चीन में, हरी टोपी पहनना अशुभ माना जाता है।"
    • यदि वे अरब के रात्रिभोज के लिए जा रहे हैं, तो आप उस कार्ड को बदलकर एक ऐसा कार्ड रख देते हैं जो कहता है: "अरब संस्कृति में, सूअर का मांस वर्जित है।"
    • शर्त: जब शेफ वापस एक सामान्य अंग्रेजी रात्रिभोज में जाता है, तो उसे उस 'चीट शीट' को भूलना होगा और बिल्कुल पहले की तरह व्यवहार करना होगा। उन्हें यह नहीं सोचना चाहिए कि न्यूयॉर्क में हरी टोपी पहनना बुरा है।

परीक्षण: CrossCult-KIBench

यह देखने के लिए कि क्या यह "चीट शीट" वाला विचार काम करता है, लेखकों ने एक विशाल परीक्षण बनाया जिसे CrossCult-KIBench कहा जाता है।

  • परीक्षण में क्या है? यह 9,800 चित्र-आधारित प्रश्नों का एक विशाल पुस्तकालय है।
  • परिदृश्य: ये 49 अलग-अलग सांस्कृतिक स्थितियों को कवर करते हैं, जैसे "क्या हरी टोपी पहनना ठीक है?" या "क्या यहाँ समलैंगिक विवाह स्वीकार्य है?"
  • भाषाएँ: वे इसका परीक्षण अंग्रेजी (US), चीनी (चीन) और अरबी (अरब क्षेत्र) में करते हैं।
  • लक्ष्य: यह परीक्षण दो चीजें जाँचता है:
    1. क्या चीट शीट ने काम किया? (क्या AI ने विशिष्ट संस्कृति के लिए सही उत्तर दिया?)
    2. क्या चीट शीट ने किसी और चीज़ को बिगाड़ दिया? (क्या AI अन्य संस्कृतियों के लिए गलत उत्तर देने लगा क्योंकि उसे नया कार्ड दिया गया था?)

नई विधि: MCKI (द स्मार्ट लाइब्रेरियन)

लेखकों ने इन चीट शीट्स के लिए एक "स्मार्ट लाइब्रेरियन" के रूप में एक नई विधि बनाई जिसे MCKI (मेमोरी-कंडीशन्ड नॉलेज इंसर्शन) कहा जाता है।

  • यह कैसे काम करता है: रोबोट के मस्तिष्क को स्थायी रूप से बदलने के बजाय, MCKI सांस्कृतिक तथ्यों का एक पुस्तकालय रोबोट के बाहर रखता है।
  • प्रक्रिया:
    1. रोबोट एक चित्र देखता है (जैसे, सूअर के मांस की एक प्लेट)।
    2. MCKI पूछता है: "क्या यह चित्र हमारे सांस्कृतिक पुस्तकालय में मौजूद किसी चीज़ के समान है?"
    3. यदि हाँ, तो MCKI केवल इस क्षण के लिए सही सांस्कृतिक नियम रोबोट के कान में फुसफुसाता है।
    4. रोबोट सही उत्तर देता है।
    5. अगली तस्वीर के लिए (जैसे, अमेरिका में बीफ की एक प्लेट), MCKI पुस्तकालय की जाँच करता है, कोई मिलान नहीं पाता, और रोबोट को सामान्य रूप से उत्तर देने देता है।

उन्होंने क्या पाया

लेखकों ने अन्य तरीकों (जैसे रोबोट को फिर से प्रशिक्षित करने या केवल उदाहरण दिखाने) के मुकाबले इनका परीक्षण किया।

  • बुरी खबर: अधिकांश वर्तमान तरीके अनाड़ी हैं। यदि आप रोबोट को चीनी संस्कृति के बारे में सिखाने की कोशिश करते हैं, तो वह अक्सर अमेरिका में व्यवहार करने का तरीका भूल जाता है, या वह भ्रमित हो जाता है और अजीब उत्तर देने लगता है। यह एक कुत्ते को नया करतब सिखाने जैसा है, लेकिन इस प्रक्रिया में, आप उसे बैठना भुला देते हैं।
  • अच्छी खबर: उनकी नई विधि, MCKI, इन दोनों के बीच संतुलन बनाने में सबसे अच्छी थी। इसने रोब l को उसके पुराने व्यवहार को बिगाड़े बिना सफलतापूर्वक नया सांस्कृतिक नियम सिखाया। यह एक ऐसे अनुवादक की तरह है जो केवल आवश्यकता पड़ने पर हस्तक्षेप करता है, न कि रोबोट के पूरे व्यक्तित्व को फिर से लिखने की कोशिश करता है।

सारांश

यह शोध पत्र कहता है: "हम यह मानकर नहीं चल सकते कि AI हर संस्कृति के बारे में सब कुछ जानता है। हमें एक ऐसा तरीका चाहिए जिससे AI की अन्य स्थानों पर कार्य करने की क्षमता को बिगाड़े बिना, मौके पर विशिष्ट सांस्कृतिक नियम जोड़े जा सकें। हमने यह साबित करने के लिए एक परीक्षण बनाया कि यह कठिन है, और हमने एक नया उपकरण (MCKI) बनाया जो इसे अभी तक किसी भी अन्य की तुलना में बेहतर तरीके से करता है।"

उन्होंने यह दावा नहीं किया कि यह सभी AI पूर्वाग्रहों को हल कर देगा या अभी अस्पतालों में उपयोग किया जाएगा; उन्होंने केवल यह सिद्ध किया कि यह विशिष्ट "नियम जोड़ने वाला" दृष्टिकोण संभव है और सांस्कृतिक रूप से जागरूक AI बनाने के लिए आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →