← नवीनतम पेपर
💬 NLP

BenCSSmark: Making the Social Sciences Count in LLM Research

यह स्थिति पत्र (position paper) तर्क देता है कि वर्तमान एलएलएम (LLM) बेंचमार्क में सामाजिक विज्ञान संबंधी कार्यों का कम प्रतिनिधित्व एआई (AI) की प्रगति और सामाजिक वैज्ञानिक जांच दोनों में बाधा डालता है, और एक नए "BenCSSmark" के परिचय का प्रस्ताव करता है—जो कम्प्यूटेशनल सामाजिक वैज्ञानिकों द्वारा एनोटेट किए गए डेटासेट से बना एक नया बेंचमार्क है—ताकि अधिक सुदृढ़, पारदर्शी और सामाजिक रूप से प्रासंगिक एआई प्रणालियाँ बनाई जा सकें।

मूल लेखक: Arnault Chatelain, Étienne Ollion, Qianwen Guan, Diandra Fabre, Lorraine Goeuriot, Emile Chapuis, Abdelkrim Beloued, Marie Candito, Nicolas Hervé, Didier Schwab

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arnault Chatelain, Étienne Ollion, Qianwen Guan, Diandra Fabre, Lorraine Goeuriot, Emile Chapuis, Abdelkrim Beloued, Marie Candito, Nicolas Hervé, Didier Schwab

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया एक विशाल, उच्च-दांव वाले स्पोर्ट्स लीग की तरह है। इस लीग में, लार्ज लैंग्वेज मॉडल्स (LLMs) एथलीट हैं, और बेंचमार्क (benchmarks) वे मानकीकृत परीक्षण और स्कोरबोर्ड हैं जिनका उपयोग यह देखने के लिए किया जाता है कि कौन सबसे अच्छा है।

अभी, यह लीग आयोजनों के एक बहुत ही विशिष्ट सेट के प्रति जुनूनी है: गणित की समस्याएं, कोडिंग चुनौतियां और भाषाओं का अनुवाद। एथलीट इन विशिष्ट अभ्यासों के लिए अंतहीन प्रशिक्षण लेते हैं क्योंकि यही उन्हें लीडरबोर्ड पर लाता है और प्रसिद्ध बनाता है।

समस्या: गायब "सामाजिक विज्ञान" कार्यक्रम
इस शोध पत्र के लेखक तर्क देते हैं कि लीग में एक बहुत बड़ा, महत्वपूर्ण श्रेणी का कार्यक्रम गायब है: सामाजिक विज्ञान (Social Sciences)

सामाजिक विज्ञान (जैसे समाजशास्त्र, इतिहास, राजनीति विज्ञान और अर्थशास्त्र) को ऐसे समझें जैसे कि यह इस बात का अध्ययन है कि मनुष्य वास्तव में कैसे रहते हैं, बहस करते हैं और एक-दूसरे को समझते हैं। ये क्षेत्र बहुत ही अव्यवस्थित, जटिल और सूक्ष्म डेटा से भरे हुए हैं।

  • समस्या: भले ही सामाजिक वैज्ञानिकों ने हजारों उच्च-गुणवत्ता वाले, विशेषज्ञ-एनोटेटेड डेटासेट बनाए हैं (जैसे एक कोच द्वारा विस्तृत प्लेबुक तैयार करना), ये डेटासेट AI लीग के लिए अदृश्य हैं। वे विभिन्न पुस्तकालयों में बिखरे हुए हैं, मानकीकृत नहीं हैं, और शायद ही कभी AI का परीक्षण करने के लिए उपयोग किए जाते हैं।
  • परिणाम: क्योंकि AI मॉडल्स का इन "सामाजिक" कार्यों पर परीक्षण नहीं किया जाता है, इसलिए वे इनमें बहुत खराब होते हैं। वे एक गणितीय समीकरण हल करने में बेहतरीन हो सकते हैं लेकिन एक "आलोचनात्मक" राजनीतिक टिप्पणी और एक "घृणित" टिप्पणी के बीच अंतर समझने में बुरी तरह विफल हो सकते हैं, या समाचार लेख में सूक्ष्म सांस्कृतिक पूर्वाग्रहों को पहचानने में असफल हो सकते हैं।

समाधान: BenCSSmark
इसे ठीक करने के लिए, लेखकों ने BenCSSmark बनाया है। आप इसे विशेष रूप से "सामाजिक विज्ञान" कार्यक्रमों के लिए डिज़ाइन किए गए एक नए, विशिष्ट प्रशिक्षण मैदान और प्रतियोगिता के रूप में देख सकते हैं।

यहाँ बताया गया है कि BenCSSmark क्या विशेष बनाता है, सरल उपमाओं का उपयोग करते हुए:

  1. यह AI के लिए एक "तनाव परीक्षण" (Stress Test) है:
    मानक परीक्षण पूछते हैं, "क्या आप इसे हल कर सकते हैं?" BenCSSmark पूछता है, "क्या आप संदर्भ (context) को समझ सकते हैं?"
  • उपमा: एक मानक परीक्षण पूछ सकता है, "क्या यह वाक्य व्याकरणिक रूप से सही है?" BenCSSmark पूछता है, "क्या यह वाक्य राजनीतिक रूप से पक्षपाती है, और क्या इससे फर्क पड़ता है कि इसे कौन और कब कह रहा है?" यह AI को अस्पष्टता, सांस्कृतिक अंतर और परस्पर विरोधी दृष्टिकोणों के बीच नेविगेट करने के लिए मजबूर करता है—ऐसी चीजें जो मनुष्यों के लिए आसान हैं लेकिन रोबोट के लिए कठिन हैं।
  1. यह मानवीय राय की "अव्यवस्था" का सम्मान करता है:
    कई AI परीक्षणों में, एक एकल "सही" उत्तर (गोल्ड स्टैंडर्ड) होता है। लेकिन सामाजिक विज्ञान में, लोग अक्सर असहमत होते हैं।
  • उपमा: कल्पना कीजिए कि जजों का एक पैनल है। एक मानक परीक्षण में, उन सभी को एक स्कोर पर सहमत होना चाहिए। BenCSSmark में, सिस्टम प्रत्येक जज के स्कोर को रिकॉर्ड करता है। यदि एक विशेषज्ञ को लगता है कि एक ट्वीट "आलोचनात्मक" है और दूसरा उसे "घृणित" मानता है, तो सिस्टम दोनों राय को रखता है। यह AI को सिखाता है कि मानवीय भाषा अक्सर व्यक्तिपरक होती है और हमेशा एक एकल "सत्य" नहीं होता है।
  1. यह दो दुनियाओं के बीच एक सेतु है:
    यह परियोजना कंप्यूटर वैज्ञानिकों (AI निर्माता) और सामाजिक वैज्ञानिकों (मानवीय विशेषज्ञों) को एक साथ लाती है।
  • उपमा: यह "मानव व्यवहार" टीम के कोचों को "रोबोट प्रशिक्षण" सुविधा में आमंत्रित करने जैसा है। कंप्यूटर वैज्ञानिकों को समृद्ध, वास्तविक दुनिया के डेटा तक पहुंच प्राप्त होती है जिसके बारे में वे जानते भी नहीं थे, और सामाजिक वैज्ञानिकों को वास्तव में ऐसे AI टूल्स मिलते हैं जो उनके विशिष्ट शोध प्रश्नों को समझते हैं।

बॉक्स के अंदर क्या है?
यह पेपर 27 अलग-अलग "कार्यों" (डेटासेट्स) के संग्रह को पेश करता है जो वर्तमान में फ्रांसीसी भाषा में हैं। ये केवल सामान्य टेक्स्ट नहीं हैं; वे वास्तविक शोध प्रश्नों के विशिष्ट हैं, जैसे कि:

  • यह पता लगाना कि क्या कोई राजनेता "सुधार का संकल्प" (reform pledge) ले रहा है।
  • यह समझना कि क्या कोई संगीत समीक्षा "निर्देशात्मक" (prescriptive - आपको क्या सोचना है यह बताना) है या केवल वर्णनात्मक है।
  • समाचार पत्रों में "असांकेतिक उद्धरणों" (unattributed quotes) को पहचानना।
  • शैक्षणिक सारांशों में "लिंग" (gender) या "सामाजिक वर्ग" की अवधारणाओं की पहचान करना।

चेतावनी (क्या न करें)
लेखक सावधान करते हैं कि यदि हम सावधान नहीं रहे तो बेंचमार्क खतरनाक हो सकते हैं।

  • जाल: यदि हम बेंचमार्क को बहुत कठोर बना देते हैं, तो AI मॉडल वास्तव में मनुष्यों को समझने के बजाय केवल परीक्षण के उत्तरों को "रटकर" (memorize) धोखा दे सकते हैं।
  • समाधान: लेखक सुझाव देते हैं कि हमें परीक्षणों को विविध और लगातार अपडेट रखने की आवश्यकता है, ताकि AI केवल प्लेबुक को याद न कर सके। वे यह भी स्वीकार करते हैं कि वर्तमान में, डेटा मुख्य रूप से फ्रांसीसी में और टेक्स्ट-आधारित है, इसलिए यह एक बहुत बड़े प्रोजेक्ट का केवल "पहला कदम" है।

निष्कर्ष
यह पेपर तर्क देता है कि वास्तव में स्मार्ट AI बनाने के लिए, हमें सामाजिक विज्ञानों को अनदेखा करना बंद करना होगा। इन जटिल, मानव-केंद्रित कार्यों को AI के मानक परीक्षणों में एकीकृत करके, हम ऐसे मॉडल बना सकते हैं जो न केवल गणित और कोड में अच्छे हैं, बल्कि मजबूत, निष्पक्ष और मानव समाज की जटिलता को समझने में सक्षम भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →