← नवीनतम पेपर
💬 NLP

ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation

यह शोध पत्र ESG-Bench प्रस्तुत करता है, जो एक मानव-एनोटेटेड बेंचमार्क डेटासेट है जिसे जटिल ESG रिपोर्टों का विश्लेषण करते समय लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) का मूल्यांकन करने और उन्हें कम करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि चेन-ऑफ-थॉट प्रॉम्प्टिंग और इस डेटासेट पर फाइन-ट्यूनिंग तथ्यात्मक सटीकता और सामान्यीकरण क्षमता में महत्वपूर्ण सुधार करती है।

मूल लेखक: Siqi Sun, Ben Peng Wu, Mali Jin, Peizhen Bai, Hanpei Zhang, Xingyi Song

प्रकाशित 2026-03-16
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Siqi Sun, Ben Peng Wu, Mali Jin, Peizhen Bai, Hanpei Zhang, Xingyi Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने वाले जासूस हैं, लेकिन आपका "अपराध स्थल" कोई अपराध स्थल नहीं, बल्कि एक विशाल, 300 पन्नों की कॉर्पोरेट रिपोर्ट है जो बताती है कि एक कंपनी पर्यावरण, अपने कर्मचारियों और अपने मालिकों के साथ कैसा व्यवहार करती है। यह एक ESG रिपोर्ट (पर्यावरण, सामाजिक और शासन - Environmental, Social, and Governance) है।

अतीत में, कंपनियाँ स्वेच्छा से ये रिपोर्ट लिखती थीं। अब, कई सरकारें कह रही हैं, "आपको ये लिखनी ही होंगी, और ये सच होनी चाहिए।" लेकिन ये रिपोर्ट बहुत बड़ी, भ्रमित करने वाली होती हैं, और कभी-कभी कंपनियाँ अपनी अच्छी deeds को बढ़ा-चढ़ाकर दिखाने की कोशिश करती हैं (जिसे "ग्रीनवाशिंग" कहा जाता है)।

यहाँ प्रवेश होता है AI (लार्ज लैंग्वेज मॉडल्स) का। आप सोच सकते हैं, "बहुत बढ़िया! चलिए AI से कहते हैं कि इन 300 पन्नों को पढ़े और हमें सच बताए।"

समस्या यह है: AI एक आत्मविश्वासी झूठा है।

यदि आप AI से 300 पन्नों के दस्तावेज़ में से किसी विशिष्ट पृष्ठ के बारे में सवाल पूछते हैं, तो हो सकता है कि वह वास्तव में उस पृष्ठ को न देखे। इसके बजाय, वह अपने सामान्य प्रशिक्षण से जो उसे "याद" है, उसके आधार पर अनुमान लगा सकता है। वह कह सकता है, "ओह, उन्होंने निश्चित रूप से 1,000 पेड़ लगाए!" जबकि रिपोर्ट में वास्तव में लिखा था कि उन्होंने केवल 10 पेड़ लगाए। इसे "हैलुसिनेशन" (Hallucination) या मतिभ्रम कहा जाता है। वित्त और कानून की दुनिया में, एक आत्मविश्वासी झूठ खतरनाक होता है।

समाधान: ESG-Bench

इस शोध पत्र में शोधकर्ताओं ने AI के लिए एक "जिम" बनाया जिसे ESG-Bench कहा गया।

ESG-Bench को एक विशेष प्रशिक्षण मैदान के रूप में समझें जहाँ उन्होंने वास्तविक ESG रिपोर्टों का एक विशाल पुस्तकालय और उनके बारे में कठिन प्रश्नों का एक सेट तैयार किया।

  • परीक्षण: उन्होंने AI से केवल दिए गए टेक्स्ट के आधार पर सवालों के जवाब देने को कहा।
  • ग्रेडिंग: मानव विशेषज्ञों (सस्टेनेबिलिटी के पीएचडी छात्र) ने रेफरी के रूप में काम किया। उन्होंने AI के हर उत्तर की जाँच की।
    • सही: AI ने टेक्स्ट में तथ्य ढूँढ लिया।
    • हैलुसिनेशन (Hallucination): AI ने कुछ मनगढ़ंत बना लिया या वह तथ्य छोड़ दिया जो वहीं मौजूद था।
    • ट्विस्ट: उन्होंने AI को यह भी सिखाया कि कब कहना है, "मुझे नहीं पता," यदि उत्तर टेक्स्ट में मौजूद नहीं है।

गुप्त हथियार: चेन-ऑफ-थॉट (CoT)

शोधकर्ताओं ने पाया कि केवल AI को अधिक डेटा खिलाने से झूठ बोलना ठीक नहीं हुआ। AI को बोलने से पहले सोचना सीखना आवश्यक था।

शोधकर्ताओं ने चेन-ऑफ-थॉट (CoT) नामक तकनीक का उपयोग किया। कल्पना कीजिए कि आप एक छात्र को गणित का सवाल हल करने के लिए कह रहे हैं।

  • खराब AI: बस उत्तर बोल देता है। "उत्तर 42 है!" (भले ही वह गलत हो)।
  • CoT AI: उसे पहले अपने चरणों को लिखने के लिए मजबूर किया जाता है।
    1. "ठीक है, प्रश्न जल उपयोग (water usage) के बारे में है।"
    2. "मुझे रिपोर्ट में 'पानी' के लिए स्कैन करना होगा।"
    3. "मुझे पेज 45 पर एक टेबल मिली।"
    4. "टेबल कहती है 500 लीटर।"
    5. "इसलिए, उत्तर 500 लीटर है।"

शोधकर्ताओं ने ESG रिपोर्टों के लिए एक विशेष "4-स्टेप CoT" विधि बनाई। उन्होंने AI को सिखाया:

  1. विषय की पहचान करना।
  2. सुरागों के लिए दस्तावेज़ खोजना।
  3. यह तय करना कि क्या उत्तर वास्तव में वहाँ है।
  4. उसके बाद ही उत्तर देना (या हार मान लेना)।

परिणाम

जब उन्होंने इस "पहले सोचो" पद्धति का उपयोग करके AI को प्रशिक्षित किया, तो परिणाम अद्भुत थे:

  • कम झूठ: AI ने तथ्य बनाना बंद कर दिया।
  • बेहतर ईमानदारी: जब उत्तर रिपोर्ट में नहीं था, तो AI ने अनुमान लगाने के बजाय यह कहना सीख लिया, "मैं यह नहीं ढूँढ पा रहा हूँ।"
  • सामान्य कौशल: इस प्रशिक्षण ने न केवल उन्हें ESG रिपोर्टों में मदद की; इसने AI को अन्य क्षेत्रों (जैसे जीव विज्ञान या सामान्य सामान्य ज्ञान) में भी सवाल पूछने में बेहतर बनाया।

बड़ी तस्वीर

इस शोध पत्र को AI के लिए एक नए ड्राइवर शिक्षा पाठ्यक्रम (Driver's Education Course) के रूप में देखें।
पहले, AI ड्राइवर शहर में तेजी से गाड़ी चलाते थे, अनुमान लगाते थे कि स्टॉप साइन कहाँ हैं, जिससे अक्सर दुर्घटनाएँ (हैलुसिनेशन) होती थीं।
अब, ESG-Bench की मदद से, AI ड्राइवर सीख रहे हैं:

  1. सड़क के संकेतों को देखना (दस्तावेज़)।
  2. अपने शीशों की जाँच करना (टेक्स्ट की खोज)।
  3. रुकना यदि वे सुनिश्चित नहीं हैं (उत्तर देने से बचना)।

यह महत्वपूर्ण है क्योंकि जैसे-जैसे AI कॉर्पोरेट कानूनों या मेडिकल रिकॉर्ड जैसे अधिक महत्वपूर्ण कार्यों को संभालने लगता है, हम नहीं चाहते कि वह एक आत्मविश्वासी झूठा बने। हमें चाहिए कि वह एक सावधान, ईमानदार जासूस बने।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →