Earnings25: A Comprehensive 500-Hour Speech Benchmark for Finance
यह शोध पत्र Earnings25 को प्रस्तुत करता है, जो कि पूर्ण अर्निंग्स कॉल्स और उद्योग-संतुलित खंडों वाला एक व्यापक 500-घंटे का बेंचमार्क है जिसमें संरेखित ट्रांसक्रिप्ट और संरचित मेटाडेटा शामिल है, जिसे यथार्थवादी स्थितियों में अंग्रेजी भाषा के वित्त अर्निंग्स कॉल्स पर स्वचालित भाषण पहचान (ASR) प्रणालियों का मूल्यांकन करने और पुनरुत्पादक बेसलाइन स्थापित करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को मानवीय बातचीत समझना सिखाने की कोशिश कर रहे हैं। आप इसकी शुरुआत एक किताब से पढ़ी जाने वाली स्पष्ट, धीमी कहानियों को उसे सुनाकर कर सकते हैं। लेकिन वास्तविक जीवन अव्यवस्थित होता है। लोग एक-दूसरे की बात काटते हैं, स्लैंग (बोलचाल की भाषा) का उपयोग करते हैं, अलग-अलग लहजे में बोलते हैं, और जटिल शब्दों का प्रयोग करते हैं जो कहानी की किताबों में नहीं मिलते। यह ऑटोमैटिक स्पीच रिकग्निशन (ASR) की दुनिया है—वह तकनीक जो बोले गए शब्दों को टेक्स्ट में बदल देती है। हालांकि ये रोबोट स्पष्ट आवाजों को सुनने में काफी कुशल होते जा रहे हैं, लेकिन जब बातचीत अराजक, तकनीकी या शब्दावली (जार्गन) से भरी होती है, तो वे अक्सर लड़खड़ा जाते हैं। बड़ा सवाल वैज्ञानिकों के लिए यह है: हम यह कैसे जान सकते हैं कि क्या एक रोबोट वास्तव में वास्तविक दुनिया के लिए तैयार है, या वह केवल स्क्रिप्ट पढ़ने में अच्छा है? इसका उत्तर देने के लिए, हमें एक "अंतिम परीक्षा" की आवश्यकता है जो केवल स्मृति का परीक्षण न हो, बल्कि एक शोर भरे, जटिल वातावरण में जीवित रहने का परीक्षण हो।
यहीं पर ब्लूमबर्ग की एक टीम एक नई, विशाल चुनौती लेकर आती है जिसे Earnings25 कहा जाता है। सोचिए कि वित्तीय अर्निंग्स कॉल्स (earnings calls) कॉर्पोरेट भाषणों के "ओलंपिक्स" हैं। ये एक घंटे की फोन कॉन्फ्रेंस होती हैं जहाँ कंपनियों के बॉस और वित्तीय विश्लेषक पैसे, शेयरों और भविष्य की योजनाओं के बारे में बात करते हैं। यह कठिनाई का एक आदर्श तूफान है: लोग तेजी से बोलते हैं, भारी वित्तीय शब्दावली का उपयोग करते हैं, एक-दूसरे की बात काटते हैं, और तैयार स्क्रिप्ट पढ़ने और सहज, कठिन सवालों के जवाब देने के बीच स्विच करते हैं। लेखकों ने महसूस किया कि मौजूदा परीक्षण एक शांत जिम में ट्रेडमिल पर दौड़कर मैराथन का अभ्यास करने जैसा था; उन्होंने दौड़ के उतार-चढ़ाव, हवा और भीड़ को कैद नहीं किया था। इसलिए, उन्होंने एक नया, सुपर-विस्तृत बेंचमार्क बनाया ताकि यह देखा जा सके कि वर्तमान स्पीच-रिकग्निशन रोबोट वित्तीय दुनिया की वास्तविक, अव्यवस्थित अराजकता को कितनी अच्छी तरह संभाल सकते हैं।
महान वित्तीय श्रवण चुनौती
यह शोध पत्र Earnings25 को पेश करता है, जो एक विशाल नया डेटासेट है जिसे स्पीच-रिकग्निशन AI के लिए अंतिम स्ट्रेस टेस्ट (तनाव परीक्षण) के रूप में डिज़ाइन किया गया है। लेखकों ने केवल कुछ रैंडम फोन कॉल नहीं उठाए; उन्होंने रोबोटों को विभिन्न तरीकों से परखने के लिए दो अलग-अलग "एरेना" (मैदान) बनाए।
पहला एरेना testset-full है, जो 2025 की चौथी तिमाही में S&P 500 कंपनियों के पूर्ण, बिना संपादित अर्निंग्स कॉल्स का एक विशाल संग्रह है। इसमें 498 घंटे के पूर्ण कॉल शामिल हैं। कल्पना कीजिए कि बिना रुके लगातार लगभग 500 घंटों की वित्तीय बैठकों को सुनना। यह सेट बातचीत के पूर्ण, प्राकृतिक प्रवाह को सुरक्षित रखता है, जिसमें वास्तविक जीवन में होने वाली अजीब खामोशियाँ, ओवरलैपिंग आवाजें और लंबी, घुमावदार कहानियाँ शामिल हैं। यह रोब dalam को कुछ क्लिप्स देने के बजाय, एक जटिल टीवी शो का पूरा सीजन देखने देने जैसा है।
दूसरा एरेना testset-segmented है, जो 290 विशिष्ट खंडों (chunks) से बना 46 घंटों का एक अधिक क्यूरेटेड सेट है। यहाँ, शोधकर्ताओं ने "निष्पक्षता" का एक चतुर खेल खेला। वास्तविक दुनिया में, कुछ उद्योग (जैसे बैंक या तेल कंपनियां) अन्य उद्योगों (जैसे विशिष्ट विनिर्माण) की तुलना में बहुत अधिक बार बात करते हैं। यदि आप केवल सबसे सामान्य विषयों को सुनते हैं, तो आपको लग सकता है कि रोबोट बहुत अच्छा है, लेकिन जब वह किसी दुर्लभ विषय के बारे में सुनेगा तो वह बुरी तरह विफल हो सकता है। इसे ठीक करने के लिए, टीम ने 2,000 से अधिक कॉल्स में से प्रत्येक उद्योग से ठीक एक खंड चुना, यह सुनिश्चित करते हुए कि "3D प्रिंटर" से लेकर "विंड टर्बाइन" तक हर एक प्रकार के व्यवसाय को समान आवाज मिले। ये खंड छोटे, लगभग 5 से 10 मिनट के हैं, जो यह परीक्षण करने के लिए एकदम सही हैं कि रोबोट विशिष्ट, कठिन शब्दावली को बिना अभिभूत हुए कितनी अच्छी तरह संभाल सकता है।
गुप्त नुस्खा: मेटाडेटा और "किसने क्या कहा"
Earnings25 को जो चीज़ वास्तव में विशेष बनाती है, वह केवल ऑडियो नहीं है; बल्कि वह "चीट शीट" है जो इसके साथ आती है। पुराने अधिकांश डेटासेट केवल आपको ध्वनि और टेक्स्ट देते थे। Earnings25 आपको ध्वनि, टेक्स्ट और एक विस्तृत मानचित्र देता है कि किसने, क्या, कब और क्यों कहा।
शोधकर्ताओं ने प्रत्येक वक्ता को उनकी भूमिका के साथ टैग किया: क्या वह ऑपरेटर था जो शुरुआत में नियम पढ़ रहा था? क्या वह CEO था जो एक पॉलिश भाषण दे रहा था? या वह एक विश्लेषक (analyst) था जो एक कठिन, अनस्क्रिप्टेड सवाल पूछ रहा था? उन्होंने उद्योग और कॉल की संरचना को भी लेबल किया। यह वैज्ञानिकों को यह पूछने की अनुमति देता है कि, "क्या रोबोट तब अधिक भ्रमित होता है जब CEO बात कर रहा होता है, या जब विश्लेषक बीच में टोकता है?" या "क्या यह बैंकिंग उद्योग की तुलना में बायोटेक उद्योग में अधिक बार विफल होता है?" यह एक साधारण "कितने शब्द सही थे?" परीक्षण को इस गहन जांच में बदल देता है कि रोबोट कहाँ और क्यों संघर्ष कर रहा है।
परिणाम: रोबोट अच्छे हैं, लेकिन पूर्ण नहीं
टीम ने दो लोकप्रिय स्पीच-रिकग्निशन सिस्टम, Whisper और Parakeet-TDT को कड़ी परीक्षा में डाला। उन्होंने रोबोटों को इस विशिष्ट डेटा पर कोई विशेष प्रशिक्षण नहीं दिया; उन्होंने बस उन्हें सुनने और ट्रांसक्राइब करने के लिए कहा, जो एक वास्तविक दुनिया के परिदृश्य का अनुकरण करता है जहाँ रोबोट को चीजों को मौके पर ही समझना होता है।
परिणामों ने दिखाया कि हालांकि ये रोबोट प्रभावशाली हैं, लेकिन उन्हें अभी लंबा रास्ता तय करना है। विशाल 498-घंटे के सेट पर, सर्वश्रेष्ठ मॉडल (Parakeet-TDT) ने लगभग 10.8% शब्द गलत लिखे। छोटे, उद्योग-संतुलित सेट पर, त्रुटि दर थोड़ी बढ़कर 11.1% हो गई। यह मामूली उछाल वास्तव में एक बड़ी बात है। यह सुझाव देता है कि जब आप रोबोट को दुर्लभ, कठिन उद्योगों (द "लॉन्ग टेल" ऑफ बिजनेस") को सुनने के लिए मजबूर करते हैं, तो वह अधिक बार लड़खड़ाता है।
पेपर एक दिलचस्प खोज को उजागर करता है: एग्रीगेट स्कोर भ्रामक हो सकते हैं। यदि आप केवल औसत त्रुटि दर देखते हैं, तो आपको लग सकता है कि रोबोट बहुत अच्छा कर रहा है क्योंकि वह बैंकिंग जैसे सामान्य उद्योगों में अच्छा है। लेकिन जब आप बायोटेक या फार्मा जैसे विशिष्ट, जटिल क्षेत्रों को देखते हैं, तो त्रुटि दर बढ़कर 15% से ऊपर हो जाती है। यह एक ऐसे छात्र की तरह है जो गणित की परीक्षा में 'A' ग्रेड प्राप्त करता है क्योंकि उसने आसान सवालों को हल कर लिया, लेकिन उन्नत कैलकुलस वाले भाग में फेल हो जाता है। "औसत" ग्रेड इस तथ्य को छिपा देता है कि वह अभी भी सबसे कठिन हिस्सों के साथ संघर्ष कर रहा है।
यह क्यों महत्वपूर्ण है
लेखक यह दावा करने में सावधानी बरतते हैं कि उन्होंने समस्या को "हल" कर दिया है। इसके बजाय, वे एक पुनरुत्पादक बेंचमार्क (reproducible benchmark) प्रदान करते हैं—प्रगति को मापने के लिए एक मानकीकृत तरीका। Earnings25 से पहले, यह बताना मुश्किल था कि क्या एक नया स्पीच AI वास्तव में बेहतर है या वह केवल उस डेटा के साथ भाग्यशाली था जिस पर उसका परीक्षण किया गया था। अब, शोधकर्ताओं के पास एक स्पष्ट, निष्पक्ष खेल का मैदान है जिसमें उनके मॉडल कहाँ विफल हो रहे हैं, इसे समझने के लिए समृद्ध विवरण हैं।
पेपर इसकी अपनी सीमाओं की ओर भी संकेत करता है। Earnings25 मुख्य रूप से अमेरिका-आधारित कंपनियों के अंग्रेजी-भाषा के कॉल्स पर केंद्रित है। हालांकि यह इस परीक्षण को नियंत्रित और उच्च गुणवत्ता वाला बनाता है, लेकिन यह अभी तक वैश्विक लहजों और भाषाओं की पूरी विविधता को कैप्चर नहीं करता है। लेखक सुझाव देते हैं कि अगला कदम इस "वित्तीय श्रवण चुनौती" का विस्तार करना है ताकि इसमें अधिक देश और भाषाएं शामिल की जा सकें।
संक्षेप में, Earnings25 वित्तीय अराजकता का एक विशाल, सावधानीपूर्वक व्यवस्थित पुस्तकालय है। यह केवल यह नहीं बताता कि क्या एक रोबोट सुन सकता है; यह बताता है कि क्या एक रोबोट व्यवसाय की अव्यवस्थित, शब्दावली से भरी, ओवरलैपिंग और उच्च-दांव वाली दुनिया को समझ सकता है। और फिलहाल, रोबोट सुन रहे हैं, लेकिन वे अभी भी तालमेल बिठाना सीख रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।