← नवीनतम पेपर
💬 NLP

EvasionBench: A Large-Scale Benchmark for Detecting Managerial Evasion in Earnings Call Q&A

यह शोधपत्र EvasionBench प्रस्तुत करता है, जो अर्निंग कॉल्स (earnings calls) में प्रबंधकीय टालमटोल (managerial evasion) का पता लगाने के लिए एक बड़े पैमाने का बेंचमार्क और वर्गीकरण है, जिसमें एक कड़ाई से एनोटेट किया गया डेटासेट और एक विशेष 4B-पैरामीटर वाला क्लासिफायर है जो अग्रणी वाणिज्यिक मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Shijian Ma, Yan Lin, Yi Yang

प्रकाशित 2026-02-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shijian Ma, Yan Lin, Yi Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कमरे में एक CEO के साथ बैठे हैं, और आप उनसे उनकी कंपनी के पैसों के बारे में कठिन सवाल पूछ रहे हैं। कभी-कभी, वे आपको सीधे जवाब देते हैं। अन्य समय में, वे कह सकते हैं, "यह एक बेहतरीन सवाल है, और हम कई अवसरों पर विचार कर रहे हैं," बिना आपको कोई संख्या या स्पष्ट "हाँ" या "नहीं" दिए। वे सवाल से बच रहे हैं।

यह शोध पत्र EvasionBench पेश करता है, जो इन "बचने की चालों" को पकड़ने के लिए बनाया गया एक नया टूल है। यह कॉर्पोरेट मीटिंग्स के लिए एक "झूठ पकड़ने वाली मशीन" (lie detector) की तरह है, लेकिन झूठ पकड़ने के बजाय, यह टालमटोल (evasion) को पकड़ता है—जब कोई व्यक्ति सवाल पूछे जाने पर उसका उत्तर दिए बिना ही बात को घुमा देता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "गोल-मोल" जवाब

राजनीति या कानून की दुनिया में, हम जानते हैं कि लोग सवालों को टालते हैं। शेयर बाजार में, जब एक CEO मुनाफे कम होने के सवाल पर गोल-मोल जवाब देता है, तो यह निवेशकों के लिए एक चेतावनी का संकेत हो सकता है। लेकिन अब तक, कंप्यूटर इस बात को पहचानने में बहुत अच्छे नहीं थे। अधिकांश AI टूल्स यह बताने में माहिर हैं कि कोई वाक्य खुश है या दुखी (sentiment), लेकिन वे यह बताने में संघर्ष करते हैं कि क्या कोई वाक्य वास्तव में पूछे गए प्रश्न का उत्तर दे रहा है।

2. समाधान: "बचने" की एक विशाल लाइब्रेरी

शोधकर्ताओं ने S&P Capital IQ नामक एक विशाल डिजिटल लाइब्रेरी में खुदाई की, जिसमें अर्निंग कॉल्स (earnings calls) के 2.27 करोड़ (22.7 million) प्रश्न-उत्तर जोड़े मौजूद थे। यह हजारों वर्षों की कॉर्पोरेट मीटिंग्स के ट्रांसक्रिप्ट पढ़ने जैसा है।

इस डेटा के पहाड़ से, उन्होंने एक तीन-स्तरीय "एवेशन स्केल" (Evasion Scale) बनाया:

  • प्रत्यक्ष (Direct): CEO आपको सटीक संख्या या स्पष्ट "हाँ/नहीं" देता है। (एक सीधा तीर)।
  • मध्यवर्ती (Intermediate): CEO विषय पर बात तो करता है लेकिन विशिष्ट संख्या या कड़वे सच से बचता है। वे "हिचकिचाहट वाले शब्दों" का उपयोग करते हैं जैसे "शायद," "हमें लगता है," या "यह संभव है।" (एक धुंधला दर्पण)।
  • पूरी तरह से टालने वाला (Fully Evasive): CEO पूरी तरह से विषय को अनदेखा कर देता है, कहता है "हम नहीं कह सकते," या विषय बदल देता है। (एक रेड हेरिंग/भटकाने वाला विषय)।

3. एनोटेशन चुनौती: AI को कैसे सिखाएं

इन जवाबों को लेबल करना कठिन है क्योंकि "टालना" व्यक्तिपरक (subjective) होता है। यदि आप एक मानव विशेषज्ञ से पूछते हैं, तो वे कह सकते हैं कि जवाब "प्रत्यक्ष" है। दूसरे से पूछें, और वे कह सकते हैं कि यह "मध्यवर्ती" है।

इसे हल करने के लिए, शोधकर्ताओं ने केवल एक AI या एक इंसान का उपयोग नहीं किया। उन्होंने एक "मल्टी-मॉडल कंसेंसस" (MMC) सिस्टम बनाया। इसे एक "जूरी" (Jury) की तरह समझें:

  • गवाह (Witnesses): उन्होंने पहले जवाबों को लेबल करने के लिए दो सुपर-स्मार्ट AI मॉडल्स (Claude Opus और Gemini) का उपयोग किया।
  • जूरी (The Jury): यदि दोनों AI असहमत थे, तो उन्होंने किसी एक को नहीं चुना। उन्होंने तीसरे AI (GPT-5.2) को एक जज के रूप में बुलाया।
  • फैसला (The Verdict): अंतिम लेबल बहुमत के वोट (3 में से 2) द्वारा तय किया गया था।

यह "जूरी प्रणाली" महत्वपूर्ण थी। शोधपत्र में पाया गया कि यदि आप केवल एक AI का उपयोग करते हैं, तो उसमें एक पूर्वाग्रह (bias) होता है (जैसे एक जज जो हमेशा सोचता है कि हर कोई दोषी है)। एक "जूरी" का उपयोग करके, उन्होंने बहुत अधिक विश्वसनीय डेटासेट प्राप्त किया। उन्होंने इसकी जांच मानव विशेषज्ञों के साथ भी की और पाया कि सहमति दर बहुत अधिक (83.5%) थी, जिससे साबित हुआ कि उनका "AI जूरी" बहुत अच्छा काम कर रहा था।

4. परिणाम: "Eva-4B"

इस उच्च-गुणवत्ता वाले, जूरी-अनुमोदित डेटा का उपयोग करके, उन्होंने Eva-4B नामक एक नया AI मॉडल प्रशिक्षित किया।

  • आकार: यह एक "4-बिलियन पैरामीटर" वाला मॉडल है। AI की दुनिया में, यह एक बहुत ही बुद्धिमान छात्र की तरह है जो विशाल "सुपर-हीरोज" (जैसे GPT-5 या Claude Opus) से छोटा और तेज़ है, लेकिन इसे विशेष रूप से इसी समस्या के लिए प्रशिक्षित किया गया है।
  • प्रदर्शन: Eva-4B ने 84.9% सटीकता का स्कोर प्राप्त किया।
  • चौंकाने वाला तथ्य: इसने इस विशिष्ट कार्य में विशाल, महंगे, शीर्ष-स्तरीय AI मॉडल्स (जैसे Claude Opus 4.5 और GPT-5.2) को भी पछाड़ दिया

5. यह क्यों मायने रखता है (शोधपत्र के अनुसार)

यह शोधपत्र दिखाता है कि केवल सबसे बड़े AI का उपयोग करने से ज्यादा महत्वपूर्ण यह है कि आप डेटा को कैसे लेबल करते हैं।

  • जब उन्होंने केवल एक AI के लेबल का उपयोग करके मॉडल को प्रशिक्षित किया, तो उसे संघर्ष करना पड़ा और प्रशिक्षण प्रक्रिया "शोर भरी" (noisy) थी (जैसे किसी ऐसे व्यक्ति से भाषा सीखने की कोशिश करना जिसकी बोली में बहुत भारी लहजा हो)।
  • जब उन्होंने "जूरी" (मल्टी-मॉडल कंसेंसस) के लेबल का उपयोग किया, तो मॉडल ने पूरी तरह से सीखा और तेजी से विकसित हुआ।

निचोड़ (The Bottom Line)

शोधकर्ताओं ने कंप्यूटर को यह सिखाने के लिए पहला बड़ा "जिम" (बेंचमार्क) बनाया कि कैसे पहचानें कि एक CEO सवाल को टाल रहा है। उन्होंने साबित किया कि डेटा को लेबल करने के लिए AI मॉडल्स की एक "जूरी" का उपयोग करके, वे एक विशेष, छोटे AI को बना सकते हैं जो उपलब्ध विशाल, सामान्य-उद्देश्य वाले AI मॉडल्स की तुलना में टालमटोल वाले जवाबों को पकड़ने में बेहतर है।

यह शोधपत्र क्या दावा नहीं करता है:

  • यह नहीं कहता कि यह AI अपने आप शेयर की कीमतें बता सकता है (हालांकि यह नोट करता है कि टालमटोल अन्य अध्ययनों में खराब स्टॉक प्रदर्शन के साथ सह-संबंधित है)।
  • यह दावा नहीं करता कि यह राजनीतिक इंटरव्यू या कानूनी मुकदमों के लिए अभी काम करता है, हालांकि उन्हें भविष्य में इसकी उम्मीद है।
  • यह नहीं कहता कि इसे अदालत में कानूनी सबूत के रूप में इस्तेमाल किया जाना चाहिए।

यह शोधपत्र पूरी तरह से डेटा बनाने, उसे लेबल करने की विधि और टालमटोल का पता लगाने वाले मॉडल के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →