← नवीनतम पेपर
💬 NLP

Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance

यह शोध पत्र Earnings25 को प्रस्तुत करता है, जो कि पूर्ण अर्निंग्स कॉल्स और उद्योग-संतुलित खंडों वाला एक व्यापक 500-घंटे का बेंचमार्क है जिसमें संरेखित ट्रांसक्रिप्ट और संरचित मेटाडेटा शामिल है, जिसे यथार्थवादी स्थितियों में अंग्रेजी भाषा के वित्त अर्निंग्स कॉल्स पर स्वचालित भाषण पहचान (ASR) प्रणालियों का मूल्यांकन करने और पुनरुत्पादक बेसलाइन स्थापित करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Denglin Jiang, Haoran Zhou, Anshul Wadhawan, Brendan Fahy, Vinay Ramesh, David Weisberg, Dmitriy Derkachevskiy, Helen Sheehan, Srivas Prasad, Michele Franceschini

प्रकाशित 2026-07-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Denglin Jiang, Haoran Zhou, Anshul Wadhawan, Brendan Fahy, Vinay Ramesh, David Weisberg, Dmitriy Derkachevskiy, Helen Sheehan, Srivas Prasad, Michele Franceschini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानवीय बातचीत समझना सिखाने की कोशिश कर रहे हैं। आप इसकी शुरुआत एक किताब से पढ़ी जाने वाली स्पष्ट, धीमी कहानियों को उसे सुनाकर कर सकते हैं। लेकिन वास्तविक जीवन अव्यवस्थित होता है। लोग एक-दूसरे की बात काटते हैं, स्लैंग (बोलचाल की भाषा) का उपयोग करते हैं, अलग-अलग लहजे में बोलते हैं, और जटिल शब्दों का प्रयोग करते हैं जो कहानी की किताबों में नहीं मिलते। यह ऑटोमैटिक स्पीच रिकग्निशन (ASR) की दुनिया है—वह तकनीक जो बोले गए शब्दों को टेक्स्ट में बदल देती है। हालांकि ये रोबोट स्पष्ट आवाजों को सुनने में काफी कुशल होते जा रहे हैं, लेकिन जब बातचीत अराजक, तकनीकी या शब्दावली (जार्गन) से भरी होती है, तो वे अक्सर लड़खड़ा जाते हैं। बड़ा सवाल वैज्ञानिकों के लिए यह है: हम यह कैसे जान सकते हैं कि क्या एक रोबोट वास्तव में वास्तविक दुनिया के लिए तैयार है, या वह केवल स्क्रिप्ट पढ़ने में अच्छा है? इसका उत्तर देने के लिए, हमें एक "अंतिम परीक्षा" की आवश्यकता है जो केवल स्मृति का परीक्षण न हो, बल्कि एक शोर भरे, जटिल वातावरण में जीवित रहने का परीक्षण हो।

यहीं पर ब्लूमबर्ग की एक टीम एक नई, विशाल चुनौती लेकर आती है जिसे Earnings25 कहा जाता है। सोचिए कि वित्तीय अर्निंग्स कॉल्स (earnings calls) कॉर्पोरेट भाषणों के "ओलंपिक्स" हैं। ये एक घंटे की फोन कॉन्फ्रेंस होती हैं जहाँ कंपनियों के बॉस और वित्तीय विश्लेषक पैसे, शेयरों और भविष्य की योजनाओं के बारे में बात करते हैं। यह कठिनाई का एक आदर्श तूफान है: लोग तेजी से बोलते हैं, भारी वित्तीय शब्दावली का उपयोग करते हैं, एक-दूसरे की बात काटते हैं, और तैयार स्क्रिप्ट पढ़ने और सहज, कठिन सवालों के जवाब देने के बीच स्विच करते हैं। लेखकों ने महसूस किया कि मौजूदा परीक्षण एक शांत जिम में ट्रेडमिल पर दौड़कर मैराथन का अभ्यास करने जैसा था; उन्होंने दौड़ के उतार-चढ़ाव, हवा और भीड़ को कैद नहीं किया था। इसलिए, उन्होंने एक नया, सुपर-विस्तृत बेंचमार्क बनाया ताकि यह देखा जा सके कि वर्तमान स्पीच-रिकग्निशन रोबोट वित्तीय दुनिया की वास्तविक, अव्यवस्थित अराजकता को कितनी अच्छी तरह संभाल सकते हैं।

महान वित्तीय श्रवण चुनौती

यह शोध पत्र Earnings25 को पेश करता है, जो एक विशाल नया डेटासेट है जिसे स्पीच-रिकग्निशन AI के लिए अंतिम स्ट्रेस टेस्ट (तनाव परीक्षण) के रूप में डिज़ाइन किया गया है। लेखकों ने केवल कुछ रैंडम फोन कॉल नहीं उठाए; उन्होंने रोबोटों को विभिन्न तरीकों से परखने के लिए दो अलग-अलग "एरेना" (मैदान) बनाए।

पहला एरेना testset-full है, जो 2025 की चौथी तिमाही में S&P 500 कंपनियों के पूर्ण, बिना संपादित अर्निंग्स कॉल्स का एक विशाल संग्रह है। इसमें 498 घंटे के पूर्ण कॉल शामिल हैं। कल्पना कीजिए कि बिना रुके लगातार लगभग 500 घंटों की वित्तीय बैठकों को सुनना। यह सेट बातचीत के पूर्ण, प्राकृतिक प्रवाह को सुरक्षित रखता है, जिसमें वास्तविक जीवन में होने वाली अजीब खामोशियाँ, ओवरलैपिंग आवाजें और लंबी, घुमावदार कहानियाँ शामिल हैं। यह रोब dalam को कुछ क्लिप्स देने के बजाय, एक जटिल टीवी शो का पूरा सीजन देखने देने जैसा है।

दूसरा एरेना testset-segmented है, जो 290 विशिष्ट खंडों (chunks) से बना 46 घंटों का एक अधिक क्यूरेटेड सेट है। यहाँ, शोधकर्ताओं ने "निष्पक्षता" का एक चतुर खेल खेला। वास्तविक दुनिया में, कुछ उद्योग (जैसे बैंक या तेल कंपनियां) अन्य उद्योगों (जैसे विशिष्ट विनिर्माण) की तुलना में बहुत अधिक बार बात करते हैं। यदि आप केवल सबसे सामान्य विषयों को सुनते हैं, तो आपको लग सकता है कि रोबोट बहुत अच्छा है, लेकिन जब वह किसी दुर्लभ विषय के बारे में सुनेगा तो वह बुरी तरह विफल हो सकता है। इसे ठीक करने के लिए, टीम ने 2,000 से अधिक कॉल्स में से प्रत्येक उद्योग से ठीक एक खंड चुना, यह सुनिश्चित करते हुए कि "3D प्रिंटर" से लेकर "विंड टर्बाइन" तक हर एक प्रकार के व्यवसाय को समान आवाज मिले। ये खंड छोटे, लगभग 5 से 10 मिनट के हैं, जो यह परीक्षण करने के लिए एकदम सही हैं कि रोबोट विशिष्ट, कठिन शब्दावली को बिना अभिभूत हुए कितनी अच्छी तरह संभाल सकता है।

गुप्त नुस्खा: मेटाडेटा और "किसने क्या कहा"

Earnings25 को जो चीज़ वास्तव में विशेष बनाती है, वह केवल ऑडियो नहीं है; बल्कि वह "चीट शीट" है जो इसके साथ आती है। पुराने अधिकांश डेटासेट केवल आपको ध्वनि और टेक्स्ट देते थे। Earnings25 आपको ध्वनि, टेक्स्ट और एक विस्तृत मानचित्र देता है कि किसने, क्या, कब और क्यों कहा

शोधकर्ताओं ने प्रत्येक वक्ता को उनकी भूमिका के साथ टैग किया: क्या वह ऑपरेटर था जो शुरुआत में नियम पढ़ रहा था? क्या वह CEO था जो एक पॉलिश भाषण दे रहा था? या वह एक विश्लेषक (analyst) था जो एक कठिन, अनस्क्रिप्टेड सवाल पूछ रहा था? उन्होंने उद्योग और कॉल की संरचना को भी लेबल किया। यह वैज्ञानिकों को यह पूछने की अनुमति देता है कि, "क्या रोबोट तब अधिक भ्रमित होता है जब CEO बात कर रहा होता है, या जब विश्लेषक बीच में टोकता है?" या "क्या यह बैंकिंग उद्योग की तुलना में बायोटेक उद्योग में अधिक बार विफल होता है?" यह एक साधारण "कितने शब्द सही थे?" परीक्षण को इस गहन जांच में बदल देता है कि रोबोट कहाँ और क्यों संघर्ष कर रहा है।

परिणाम: रोबोट अच्छे हैं, लेकिन पूर्ण नहीं

टीम ने दो लोकप्रिय स्पीच-रिकग्निशन सिस्टम, Whisper और Parakeet-TDT को कड़ी परीक्षा में डाला। उन्होंने रोबोटों को इस विशिष्ट डेटा पर कोई विशेष प्रशिक्षण नहीं दिया; उन्होंने बस उन्हें सुनने और ट्रांसक्राइब करने के लिए कहा, जो एक वास्तविक दुनिया के परिदृश्य का अनुकरण करता है जहाँ रोबोट को चीजों को मौके पर ही समझना होता है।

परिणामों ने दिखाया कि हालांकि ये रोबोट प्रभावशाली हैं, लेकिन उन्हें अभी लंबा रास्ता तय करना है। विशाल 498-घंटे के सेट पर, सर्वश्रेष्ठ मॉडल (Parakeet-TDT) ने लगभग 10.8% शब्द गलत लिखे। छोटे, उद्योग-संतुलित सेट पर, त्रुटि दर थोड़ी बढ़कर 11.1% हो गई। यह मामूली उछाल वास्तव में एक बड़ी बात है। यह सुझाव देता है कि जब आप रोबोट को दुर्लभ, कठिन उद्योगों (द "लॉन्ग टेल" ऑफ बिजनेस") को सुनने के लिए मजबूर करते हैं, तो वह अधिक बार लड़खड़ाता है।

पेपर एक दिलचस्प खोज को उजागर करता है: एग्रीगेट स्कोर भ्रामक हो सकते हैं। यदि आप केवल औसत त्रुटि दर देखते हैं, तो आपको लग सकता है कि रोबोट बहुत अच्छा कर रहा है क्योंकि वह बैंकिंग जैसे सामान्य उद्योगों में अच्छा है। लेकिन जब आप बायोटेक या फार्मा जैसे विशिष्ट, जटिल क्षेत्रों को देखते हैं, तो त्रुटि दर बढ़कर 15% से ऊपर हो जाती है। यह एक ऐसे छात्र की तरह है जो गणित की परीक्षा में 'A' ग्रेड प्राप्त करता है क्योंकि उसने आसान सवालों को हल कर लिया, लेकिन उन्नत कैलकुलस वाले भाग में फेल हो जाता है। "औसत" ग्रेड इस तथ्य को छिपा देता है कि वह अभी भी सबसे कठिन हिस्सों के साथ संघर्ष कर रहा है।

यह क्यों महत्वपूर्ण है

लेखक यह दावा करने में सावधानी बरतते हैं कि उन्होंने समस्या को "हल" कर दिया है। इसके बजाय, वे एक पुनरुत्पादक बेंचमार्क (reproducible benchmark) प्रदान करते हैं—प्रगति को मापने के लिए एक मानकीकृत तरीका। Earnings25 से पहले, यह बताना मुश्किल था कि क्या एक नया स्पीच AI वास्तव में बेहतर है या वह केवल उस डेटा के साथ भाग्यशाली था जिस पर उसका परीक्षण किया गया था। अब, शोधकर्ताओं के पास एक स्पष्ट, निष्पक्ष खेल का मैदान है जिसमें उनके मॉडल कहाँ विफल हो रहे हैं, इसे समझने के लिए समृद्ध विवरण हैं।

पेपर इसकी अपनी सीमाओं की ओर भी संकेत करता है। Earnings25 मुख्य रूप से अमेरिका-आधारित कंपनियों के अंग्रेजी-भाषा के कॉल्स पर केंद्रित है। हालांकि यह इस परीक्षण को नियंत्रित और उच्च गुणवत्ता वाला बनाता है, लेकिन यह अभी तक वैश्विक लहजों और भाषाओं की पूरी विविधता को कैप्चर नहीं करता है। लेखक सुझाव देते हैं कि अगला कदम इस "वित्तीय श्रवण चुनौती" का विस्तार करना है ताकि इसमें अधिक देश और भाषाएं शामिल की जा सकें।

संक्षेप में, Earnings25 वित्तीय अराजकता का एक विशाल, सावधानीपूर्वक व्यवस्थित पुस्तकालय है। यह केवल यह नहीं बताता कि क्या एक रोबोट सुन सकता है; यह बताता है कि क्या एक रोबोट व्यवसाय की अव्यवस्थित, शब्दावली से भरी, ओवरलैपिंग और उच्च-दांव वाली दुनिया को समझ सकता है। और फिलहाल, रोबोट सुन रहे हैं, लेकिन वे अभी भी तालमेल बिठाना सीख रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →