ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge
यह शोध पत्र ESGenius को प्रस्तुत करता है, जो आधिकारिक ESG दस्तावेजों के एक क्यूरेटेड कॉर्पस और एक कठोरता से सत्यापित प्रश्न-उत्तर डेटासेट से युक्त पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि लार्ज लैंग्वेज मॉडल्स स्थिरता (सस्टेनेबिलिटी) डोमेन में मध्यम ज़ीरो-शॉट प्रदर्शन प्रदर्शित करते हैं, लेकिन प्रदान की गई स्रोत सामग्रियों का उपयोग करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के माध्यम से ग्राउंडेड होने पर उनकी सटीकता में काफी सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपनी कंपनी को नैतिक, टिकाऊ और जिम्मेदार निर्णय लेने में मदद करने के लिए एक नया सहायक नियुक्त कर रहे हैं। आपको ऐसे व्यक्ति की आवश्यकता है जो "पर्यावरण, सामाजिक और शासन" (ESG) के नियमों को जानता हो—जैसे कि कार्बन फुटप्रिंट को कैसे कम किया जाए, श्रमिकों के साथ निष्पक्ष व्यवहार कैसे किया जाए, या एक पारदर्शी व्यवसाय कैसे चलाया जाए।
लेकिन समस्या यह है: आपके पास 50 अलग-अलग उम्मीदवार (AI मॉडल) हैं, जिनमें छोटे इंटर्न से लेकर विशाल सुपर-ब्रेन तक शामिल हैं। आप यह कैसे जानेंगे कि उनमें से कौन वास्तव में इन जटिल नियमों को समझता है, और कौन केवल अनुमान लगा रहा है या मनगढ़ंत बातें बना रहा है?
पेश है ESGenius।
ESGenius को AI के लिए "बार एग्जाम" (वकीलों की परीक्षा) के रूप में समझें, लेकिन विशेष रूप से स्थिरता (sustainability) के लिए। यह एक नया टूल है जिसे अलीबाबा और नानयांग टेक्नोलॉजिकल यूनिवर्सिटी के शोधकर्ताओं द्वारा बनाया गया है ताकि यह परीक्षण किया जा सके कि AI मॉडल वास्तविक दुनिया के पर्यावरणीय और सामाजिक मुद्दों को कितनी अच्छी तरह संभालते हैं।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. पाठ्यपुस्तक (ESGenius-Corpus)
परीक्षा देने से पहले, आपको एक पाठ्यपुस्तक की आवश्यकता होती है। ESGenius ने केवल प्रश्न नहीं बनाए; उन्होंने 231 आधिकारिक दस्तावेजों की एक विशाल लाइब्रेरी बनाई।
- उपमा: एक ऐसी लाइब्रेरी की कल्पना करें जिसमें स्थिरता का "बाइबिल" मौजूद हो। इसमें IPCC (जलवायु वैज्ञानिक), UN (वैश्विक लक्ष्य), और GRI (रिपोर्टिंग मानक) जैसे प्रमुख संगठनों के वास्तविक नियम पुस्तिकाएं शामिल हैं।
- चुनौती: ये दस्तावेज़ बहुत बड़े, घने और तकनीकी शब्दावली से भरे हुए हैं। ये "सत्य के स्रोत" (source of truth) हैं।
2. परीक्षा (ESGenius-QA)
शोधकर्ताओं ने उन विशाल पाठ्यपुस्तकों को लिया और उन पर 1,136 बहुविकल्पीय प्रश्न (multiple-choice questions) बनाने के लिए AI का उपयोग किया।
- उपमा: इसे 1,136 कठिन प्रश्नों वाली एक फाइनल परीक्षा के रूप में सोचें।
- ट्विस्ट: यह सुनिश्चित करने के लिए कि AI ने केवल उत्तरों को रटा नहीं है, प्रत्येक प्रश्न को "पाठ्यपुस्तक" के एक विशिष्ट पृष्ठ से जोड़ा गया है। यदि AI सही उत्तर देता है, तो उसे उस सटीक पैराग्राफ की ओर संकेत करना होगा जो उसे सिद्ध करता है।
- सुरक्षा जाल: उन्होंने एक "पता नहीं है" (Not Sure) का विकल्प भी जोड़ा। यह अत्यंत महत्वपूर्ण है। वास्तविक दुनिया में, गलत उत्तर देने (जो खराब व्यावसायिक निर्णय या "ग्रीनवाशिंग" का कारण बन सकता है) के बजाय यह स्वीकार करना बेहतर है कि AI को नहीं पता।
3. परीक्षा का दिन: परीक्षा लेने के दो तरीके
शोधकर्ताओं ने 50 अलग-अलग AI मॉडलों (0.5-बिलियन पैरामीटर वाले छोटे मॉडल से लेकर 671-बिलियन पैरामीटर वाले विशाल मॉडल तक) का दो तरीकों से परीक्षण किया:
"याददाश्त" का परीक्षण (Zero-Shot):
- सेटअप: AI से बिना पाठ्यपुस्तक के एक प्रश्न पूछा जाता है। उसे पूरी तरह से उस जानकारी पर निर्भर रहना होता है जो उसने अपने प्रशिक्षण के दौरान सीखी है।
- परिणाम: अधिकांश के लिए यह एक आपदा थी। सबसे स्मार्ट AI भी केवल 55% से 70% ही सही उत्तर दे पाए। यह एक छात्र को याददाश्त से 10,000 पन्नों की कानून की किताब सुनाने के लिए कहने जैसा है—उन्हें सामान्य विचार तो पता हैं, लेकिन वे विशिष्ट विवरणों को छोड़ देते हैं।
- निष्कर्ष: वर्तमान AI मॉडल ESG के विशिष्ट नियमों के मामले में "हैलुसिनेट" (मनगढ़ंत बातें बनाना) कर रहे हैं।
"ओपन-बुक" परीक्षण (RAG - Retrieval-Augmented Generation):
- सेटअप: इस बार, AI को उत्तर देने से पहले पाठ्यपुस्तक के उस विशिष्ट पृष्ठ को देखने की अनुमति दी जाती है जो प्रश्न का उत्तर देता है।
- परिणाम: बूम! स्कोर अचानक बढ़ गया। छोटे मॉडल जो याददाश्त वाले परीक्षण में विफल हो रहे थे, वे अचानक 80% या उससे अधिक स्कोर करने लगे।
- उपमा: यह एक छात्र के गणित का सूत्र याद रखने की कोशिश करने बनाम एक ऐसे छात्र के बीच का अंतर है जिसे फॉर्मूला शीट खोलने की अनुमति है। "ओपन-बुक" दृष्टिकोण ने सिद्ध कर दिया कि बड़ा दिमाग होने से ज्यादा महत्व सही जानकारी तक पहुंच का है।
4. बड़ी खोजें
पेपर ने कुछ आश्चर्यजनक बातें पाईं:
- आकार ही सब कुछ नहीं है: एक विशाल AI मॉडल जरूरी नहीं कि एक छोटे मॉडल को हरा दे, यदि छोटे मॉडल को "ओपन-बुक" पद्धति का उपयोग करने की अनुमति दी गई हो।
- तर्क (Reasoning) मायने रखता है: जो मॉडल "कदम-दर-कदम सोचने" (reasoning models) के लिए डिज़ाइन किए गए हैं, वे केवल शब्द उगलने वाले मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं।
- "पता नहीं है" का विकल्प महत्वपूर्ण है: कई मॉडलों ने तब भी अनुमान लगाने की कोशिश की जब वे अनिश्चित थे। सबसे अच्छे मॉडल वे थे जिन्हें पता था कि कब कहना है, "मुझे नहीं पता, मुझे स्रोत की जांच करने दें।"
यह क्यों मायने रखता है?
ESG केवल एक शब्द (buzzword) नहीं है; यह वास्तविक धन, वास्तविक कानूनों और वास्तविक जलवायु प्रभाव के बारे में है। यदि किसी कंपनी का AI सहायक कार्बन उत्सर्जन पर गलत सलाह देता है, तो कंपनी पर जुर्माना लग सकता है, या इससे भी बुरा, वह ग्रह की मदद करने में विफल हो सकती है।
ESGenius एक चेतावनी है। यह हमें बताता है कि हम केवल AI पर इन चीजों को "जानने" के लिए भरोसा नहीं कर सकते। हमें ऐसे सिस्टम बनाने की आवश्यकता है जो AI को वास्तविक, आधिकारिक दस्तावेजों में स्थापित (ground) करें।
संक्षेप में: ESGenius वह टूल है जो हमें यह सिखाता है कि पर्यावरण के बारे में AI को "मनगढ़ंत बातें बनाने" से कैसे रोका जाए और इसे एक स्थायी भविष्य के लिए एक विश्वसनीय, तथ्य-जांच करने वाला साथी कैसे बनाया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।