← नवीनतम पेपर
💬 NLP

Progressing beyond Art Masterpieces or Touristic Clichés: how to assess your LLMs for cultural alignment?

यह शोध पत्र नए डिज़ाइन दिशानिर्देशों का प्रस्ताव करके, एक संगत डेटासेट का निर्माण करके और यह प्रदर्शित करके कि यह दृष्टिकोण सांस्कृतिक रूप से विशिष्ट मॉडलों के बीच अंतर करने में अधिक विभेदक परिणाम देता है, लार्ज लैंग्वेज मॉडल्स के सांस्कृतिक संरेखण के आकलन के लिए मौजूदा डेटासेट्स की सीमाओं को संबोधित करता है।

मूल लेखक: António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: António Branco, João Silva, Nuno Marques, Luis Gomes, Ricardo Campos, Raquel Sequeira, Sara Nerea, Rodrigo Silva, Miguel Marques, Rodrigo Duarte, Artur Putyato, Diogo Folques, Tiago Valente

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशिष्ट पड़ोस में काम करने के लिए एक नया कर्मचारी नियुक्त करने की कोशिश कर रहे हैं। आप यह जानना चाहते हैं कि क्या वे वास्तव में उस समुदाय के माहौल, अंदरूनी चुटकुलों और अलिखित नियमों को समझते हैं, या वे केवल एक पर्यटक हैं जिन्होंने कुछ गाइडबुक तथ्यों को रट लिया है।

यह शोध पत्र इस बारे में है कि हम लार्ज लैंग्वेज मॉडल्स (LLMs) का परीक्षण कैसे करते—वे AI चैटबॉट्स जिनका हम हर दिन उपयोग करते हैं—यह देखने के लिए कि क्या वे वास्तव में एक विशिष्ट समूह के लोगों (इस मामले में, पुर्तगाली लोगों) के साथ "सांस्कृतिक रूप से संरेखित" (culturally aligned) हैं, या वे केवल सतही ज्ञान के साथ दिखावा कर रहे हैं।

यहाँ इस शोध पत्र की यात्रा का विवरण दिया गया, जिसमें कुछ सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "पर्यटक ब्रोशर" परीक्षण (The "Tourist Brochure" Test)

लेखकों का तर्क है कि AI संस्कृति के लिए वर्तमान परीक्षण अधिकांशतः पर्यटक ब्रोशर की तरह हैं। वे ऐसे प्रश्न पूछते हैं जैसे:

  • "पुर्तगाल की सबसे प्रसिद्ध पेंटिंग कौन सी है?"
  • "इतालवी लोग आमतौर पर रात के खाने में क्या खाते हैं?"
  • "फ्रांस की राजधानी क्या है?"

यह विफल क्यों होता है:

  • "गूगल" प्रभाव (The "Google" Effect): इंटरनेट पर प्रशिक्षित कोई भी AI इन तथ्यों को पहले से ही जानता है। यह एक स्थानीय निवासी को यह पूछकर परखने जैसा है कि एफिल टॉवर का नाम क्या है; एक पर्यटक भी यह जानता है। यह साबित नहीं करता कि वे वहाँ रहते हैं।
  • रूढ़िवादिता का जाल (The Stereotype Trap): ये प्रश्न अक्सर रूढ़ियों (clichés) पर निर्भर करते हैं (जैसे, "इतालवी लोग पास्ता पसंद करते हैं")। यह एक पूरे पड़ोस को एक एकल कार्टून चरित्र के आधार पर आंकने जैसा है। यह संस्कृति की वास्तविक, जटिल और रोजमर्रा की वास्तविकता को छोड़ देता है।
  • "बैसाखी" की समस्या (The "Crutch" Problem): कई परीक्षण AI को स्पष्ट रूप से कहते हैं, "इस प्रश्न का उत्तर ऐसे दें जैसे आप पुर्तगाल में हैं।" लेखक कहते हैं कि यह नकल करना है। यह एक छात्र को परीक्षा से पहले ही एक चीट शीट देने जैसा है जिसमें लिखा हो "आप परीक्षा कक्ष में हैं"; यह उनके वास्तविक ज्ञान को सिद्ध किए बिना उनके स्कोर को बढ़ा देता है।

2. समाधान: "लोकल पब" परीक्षण (The "Local Pub" Test)

लेखक इन परीक्षणों को बनाने का एक नया तरीका प्रस्तावित करते हैं, जिसे वे Tuguesice-PT कहते हैं। ऐतिहासिक स्थलों या इतिहास की किताबों के बारे में पूछने के बजाय, उन्होंने इस परीक्षण को इस तरह डिज़ाइन किया है कि यह एक स्थानीय पब में होने वाली अनौपचारिक बातचीत जैसा महसूस हो।

उन्होंने प्रश्न लिखने वाले लोगों के लिए कुछ सख्त नियम (दिशानिर्देश) बनाए:

  • कोई "पर्यटक" संकेत नहीं: प्रश्न में "पुर्तगाल में..." न कहें। बस प्रश्न को स्वाभाविक रूप से पूछें। यदि आप बिना देश का उल्लेख किए पूछते हैं, "20वीं शताब्दी के दौरान तानाशाह कौन था?", तो एक सच्चा स्थानीय इसका उत्तर जानता होगा, लेकिन एक सामान्य AI गलत अनुमान लगा सकता है।
  • रोजमर्रा का ज्ञान: ऐसी चीजें पूछें जो एक स्थानीय बच्चा बड़ा होते समय सीखता है, न कि वे जो किसी विश्वकोश में मिलती हैं। उदाहरण के लिए, दो स्थानीय शहरों के बीच के विशिष्ट बस रूट के बारे में पूछना, बजाय इसके कि देश की जनसंख्या कितनी है।
  • एक स्पष्ट उत्तर: अस्पष्ट प्रश्नों से बचें जैसे "लोग आमतौर पर क्या पीते हैं?" (जो पूछने वाले के आधार पर वाइन, बीयर या पानी हो सकता है)। विशिष्ट, तथ्यात्मक चीजें पूछें जिनका एक ही सही उत्तर हो।
  • "AI फेल" नियम: आदर्श रूप से, प्रश्न इतने कठिन होने चाहिए कि बड़े, प्रसिद्ध AI मॉडल (जैसे गूगल या OpenAI के) उन्हें गलत कर दें यदि उन्हें विशेष रूप से उस संस्कृति पर प्रशिक्षित नहीं किया गया है।

3. प्रयोग: मुकाबला (The Showdown)

टीम ने अपना नया "लोकल पब" परीक्षण (Tuguesice-PT) बनाया और इसकी तुलना एक पुराने "पर्यटक ब्रोशर" परीक्षण (BLEnD नामक डेटासेट का अनुवादित संस्करण) से की।

उन्होंने कई मॉडलों को दोनों परीक्षणों के विरुद्ध चलाया:

  • "स्थानीय" (The "Locals"): वे AI मॉडल जिन्हें विशेष रूप से पुर्तगाली डेटा पर फाइन-ट्यून (प्रशिक्षित) किया गया था।
  • "पर्यटक" (The "Tourists"): सामान्य AI मॉडल जिन्हें पुर्तगाली डेटा पर प्रशिक्षित नहीं किया गया था।
  • "बड़े नाम" (The "Big Names"): जेमिनी (Gemini) और लामा (Llama) जैसे विशाल, शक्तिशाली मॉडल।

परिणाम:

  • पुराने परीक्षण पर (Tourist Brochure): सभी का स्कोर बहुत अच्छा रहा। "स्थानीय" और "पर्यटक" दोनों का स्कोर लगभग समान था। परीक्षण यह अंतर नहीं कर सका कि कौन सा मॉडल वास्तव में संस्कृति को समझता है और कौन सा केवल विकिपीडिया को याद कर चुका है। यह एक ऐसे टेस्ट जैसा था जहाँ सभी को 'A' ग्रेड मिला क्योंकि प्रश्न बहुत आसान थे।
  • नए परीक्षण पर (Local Pub): अंतर बहुत बड़ा था।
    • पुर्तगाल के लिए विशेष रूप से प्रशिक्षित मॉडलों ("स्थानीय") ने बहुत बेहतर प्रदर्शन किया।
    • सामान्य मॉडल ("पर्यटक") काफी संघर्ष करते दिखे।
    • "ओरेकल" परीक्षण (The "Oracle" Test): जब शोधकर्ताओं ने सामान्य मॉडलों को एक "संकेत" दिया (उन्हें बताया, "मान लें कि आप पुर्तगी हैं"), तो पुराने परीक्षण पर उनका स्कोर आसमान छू गया लेकिन नए परीक्षण पर कम ही रहा। इसने साबित किया कि पुराना परीक्षण केवल यह माप रहा था कि AI निर्देशों का पालन कर सकता है या नहीं, न कि यह कि वह वास्तव में संस्कृति को जानता है।

4. निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि यह जानने के लिए कि क्या कोई AI वास्तव में एक संस्कृति को समझता है, हमें उसे कला की उत्कृष्ट कृतियों और पर्यटक रूढ़ियों के बारे में पूछना बंद करना होगा।

इसके बजाय, हमें इसे उन अनकहे, रोजमर्रा के विवरणों के बारे में पूछने की आवश्यकता है जिन्हें केवल वही जानता होगा जिसने वहां जीवन बिताया हो। "बैसाखियों" (जैसे AI को यह बताना कि वह किस देश में है) को हटाकर और विशिष्ट, स्थानीय, तथ्यात्मक ज्ञान पर ध्यान केंद्रित करके, हम अंततः देख सकते हैं कि कौन से मॉडल वास्तव में एक संस्कृति के साथ संरेखित हैं और कौन से केवल दिखावा कर रहे हैं।

संक्षेप में: पुराने परीक्षण ऐसे थे जैसे मछली से पूछना, "क्या तुम जानते हो कि पानी क्या है?" (हर कोई हाँ कहेगा)। नया परीक्षण पूछता है, "मंगलवार को लिस्बन के तट से सारडीन पकड़ने के लिए सबसे अच्छी जगह कौन सी है?" (केवल स्थानीय मछली ही जानती है)।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →