← नवीनतम पेपर
💬 NLP

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

यह शोध पत्र EVA-Bench को पेश करता है, जो एक ओपन-सोर्स, एंड-टू-एंड फ्रेमवर्क है जो 213 एंटरप्राइज परिदृश्यों में वॉयस एजेंटों का व्यापक मूल्यांकन करने के लिए डायनेमिक बॉट-टू-बॉट कन्वर्सेशन सिमुलेशन को कंपोजिट मेट्रिक्स (EVA-A और EVA-X) के साथ जोड़ता है, जो वर्तमान प्रणालियों की सटीकता, विश्वसनीयता और लहजे एवं शोर के विरुद्ध मजबूती में महत्वपूर्ण अंतराल को उजागर करता है।

मूल लेखक: Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Mada
प्रकाशित 2026-09-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आप एक कस्टमर सर्विस लाइन पर कॉल कर सकें, एक मानव जैसी आवाज़ से स्वाभाविक रूप से बात कर सकें, और बिना कोई बटन दबाए या होल्ड पर इंतज़ार किए अपनी समस्या का समाधान पा सकें। यह आधुनिक वॉयस एजेंट का वादा है, जो एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जिसे बोलकर बातचीत के माध्यम से कार्य करने के लिए डिज़ाइन किया गया है। टेक्स्ट-आधारित चैटबॉट्स के विपरीत, जो एक स्थिर, लिखित दुनिया में काम करते हैं, वॉयस एजेंटों को ध्वनि की एक क्षणभंगुर, रैखिक धारा (linear stream) के माध्यम से आगे बढ़ना होता है। उन्हें लहजों (accents) को समझना होता है, बैकग्राउंड शोर को अनदेखा करना होता है, और अपनी प्रतिक्रियाओं का समय इस तरह तय करना होता है कि वे कॉलर को बाधित न करें या अजीब सन्नाटा न छोड़ दें। ये बाधाएं अनूठी विफलता मोड (failure modes) पैदा करती हैं; एक बॉट किसी अनुरोध को सही ढंग से समझ तो सकता है, लेकिन कन्फर्मेशन कोड स्पष्ट रूप से बोलने में विफल हो सकता है, या यह जवाब देने में बहुत अधिक समय ले सकता है, जिससे उपयोगकर्ता हताशा में कॉल काट देता है। क्योंकि ये सिस्टम एयरलाइंस, अस्पतालों और व्यवसायों में आम होते जा रहे हैं, सवाल अब केवल यह नहीं है कि क्या वे बात कर सकते हैं, बल्कि यह है कि क्या वे विश्वसनीय रूप से और सुखद तरीके से वास्तविक समस्याओं को हल कर सकते हैं।

इसका उत्तर देने के लिए, ServiceNow AI Research की एक टीम ने EVA-Bench नामक एक नया परीक्षण मैदान बनाया। इस फ्रेमवर्क के अस्तित्व में आने से पहले, वॉयस एजेंटों का मूल्यांकन करने का कोई मानक तरीका नहीं था जो यथार्थवादी बातचीत सिमुलेशन को गुणवत्ता के गहरे, बहु-स्तरीय माप के साथ जोड़ सके। मौजूदा परीक्षण अक्सर स्थिर स्क्रिप्ट या सिंगल-टर्न इंटरैक्शन पर निर्भर थे जो एक लंबी बातचीत के दौरान गलतियों से उबरने की क्षमता को नहीं देख पाते थे। EVA-Bench एक गेम-चेंजर है क्योंकि यह एक सिम्युलेटेड मानव कॉलर और परीक्षण किए जा रहे वॉयस एजेंट के बीच पूरी तरह से स्वचालित, मल्टी-टर्न ऑडियो बातचीत को व्यवस्थित करता है। शोधकर्ताओं ने तीन प्रमुख उद्योगों: एयरलाइन कस्टमर सर्विस, हेल्थकेयर ह्यूमन रिसोर्स और एंटरप्राइज आईटी सपोर्ट में 213 विशिष्ट परिदृश्य (scenarios) बनाए। इन परिदृश्यों को कठिन बनाया गया था, जिनमें एजेंटों को जटिल नीतियों को संभालने, फ्लाइट नंबर या मेडिकल आईडी जैसी विशिष्ट जानकारियों को याद रखने और फोन कॉल के स्वाभाविक प्रवाह को नेविगेट करने की आवश्यकता थी। महत्वपूर्ण रूप से, इसमें एक वैलिडेशन स्टेप शामिल है जो सिम्युलेटेड कॉलर के व्यवहार की जांच करता है; यदि सिमुलेशन भटक जाता है या अवास्तविक व्यवहार करता है, तो परीक्षण को स्वचालित रूप से पुन: उत्पन्न (regenerate) किया जाता है ताकि यह सुनिश्चित हो सके कि स्कोर एजेंट के प्रदर्शन को दर्शाते हैं, न कि सिमुलेशन की किसी त्रुटि को।

शोधकर्ताओं ने एजेंटों को दो मुख्य स्कोर के आधार पर मापा: एक सटीकता (accuracy) के लिए और एक अनुभव (experience) के लिए। सटीकता स्कोर, जिसे वे EVA-A कहते हैं, यह जाँचता है कि क्या एजेंट ने वास्तव में कार्य पूरा किया, नियमों का पालन किया, और सही नंबर और नाम बोले। अनुभव स्कोर, EVA-X, यह मापता है कि दूसरी ओर मौजूद मानव के लिए बातचीत कैसी रही: क्या एजेंट ने सही समय पर प्रतिक्रिया दी, क्या वह इतना संक्षिप्त था कि व्यक्ति भटक न जाए, और क्या उसने बातचीत को बिना अटके आगे बढ़ाया? उन्होंने 12 अलग-अलग वॉयस सिस्टम का परीक्षण किया, जिनमें पारंपरिक सेटअप (जो स्पीच को टेक्स्ट में बदलते हैं, उसे प्रोसेस करते हैं, और फिर बोलते हैं) से लेकर नए, एंड-टू-एंड सिस्टम (जो सीधे ऑडियो को प्रोसेस करते हैं) तक शामिल थे। परिणामों ने एक कठोर वास्तविकता को उजागर किया: कोई भी एकल सिस्टम एक साथ सटीकता और अनुभव मेट्रिक्स दोनों पर 0.5 का स्कोर पार नहीं कर सका। जबकि सर्वश्रेष्ठ प्रदर्शन करने वाले सिस्टम एक मोर्चे पर या दूसरे मोर्चे पर एक मामूली सीमा पार करने में सक्षम थे, कोई भी दोनों को एक साथ उत्कृष्ट बनाने में सक्षम नहीं था।

एक महत्वपूर्ण निष्कर्ष एक सिस्टम के शिखर प्रदर्शन (peak performance) और उसके विश्वसनीय प्रदर्शन के बीच का अंतर था। जब एक एजेंट का एक ही कार्य पर कई बार परीक्षण किया जाता है, तो वह एक प्रयास में शानदार सफलता प्राप्त कर सकता है लेकिन अगले में विफल हो सकता है। शोधकर्ताओं ने पाया कि एक सिस्टम के सर्वश्रेष्ठ मामले और उसके निरंतर, विश्वसनीय प्रदर्शन के बीच का अंतर काफी बड़ा था। औसतन, एक सिस्टम जो एक एकल ट्रायल में सफल होता है, वह उसी परिदृश्य के पांच ट्रायल में से पांचों में सफल होने में लगभग 4% बार विफल रहता है। यह सुझाव देता है कि वर्तमान मूल्यांकन अक्सर यह बढ़ा-चढ़ाकर बताते हैं कि ये सिस्टम वास्तविक दुनिया में तैनाती के लिए कितने तैयार हैं, जहाँ क्षमता के साथ-साथ निरंतरता भी उतनी ही महत्वपूर्ण है। इसके अलावा, अध्ययन ने दिखाया कि विभिन्न प्रकार के सिस्टम अलग-अलग तरीकों से विफल होते हैं। सीधे ऑडियो प्रोसेस करने वाले सिस्टम बातचीत के समय (timing) के मामले में बहुत बेहतर होते हैं, यानी वे तेजी से और स्वाभाविक रूप से जवाब देते हैं, लेकिन वे नीतियों का उल्लंघन करने या तथ्य गढ़ने के प्रति अधिक प्रवृत्त होते हैं। पारंपरिक सिस्टम जो पहले स्पीच को टेक्स्ट में बदलते हैं, वे नियमों का पालन करने में बेहतर होते हैं लेकिन अक्सर टाइमिंग के साथ संघर्ष करते हैं, जिससे कॉलर को बहुत देर तक इंतजार करना पड़ता है या वे उन्हें बाधित करते हैं।

शोधकर्ताओं ने यह भी परीक्षण किया कि जब वातावरण कठिन हो जाता है, जैसे कि जब कॉलर का लहजा (accent) गहरा हो या कॉफी शॉप जैसा बैकग्राउंड शोर हो, तो ये सिस्टम कैसा प्रदर्शन करते हैं। परिणामों ने दिखाया कि इन ध्वनिक चुनौतियों (acoustic challenges) ने गहरी कमजोरियों को उजागर किया। उन सिस्टमों ने जो पहले स्पीच को टेक्स्ट में बदलने पर निर्भर थे, लहजे के सामने आने पर उनकी सटीकता काफी कम हो गई, जबकि सीधे ऑडियो प्रोसेस करने वाले सिस्टम शोर की उपस्थिति में बातचीत के समय (timing) के साथ अधिक संघर्ष करते हैं। एक विशिष्ट विफलता मोड उभर कर आया: महत्वपूर्ण जानकारी, जैसे कन्फर्मेशन कोड या लाइसेंस नंबर को सही ढंग से बोलने या सुनने में असमर्थता। भले ही एजेंट ने सामान्य अनुरोध को समझ लिया हो, लेकिन एक गलत उच्चारण वाला अंक भी पूरी बातचीत को बेकार कर सकता है। अध्ययन निष्कर्ष निकालता है कि हालांकि वॉयस एजेंट तेजी से प्रगति कर रहे हैं, लेकिन वे अभी भी सटीकता और एक सुखद संवादात्मक साथी होने के बीच एक मौलिक ट्रेड-ऑफ का सामना करते हैं। जब तक ये सिस्टम वास्तविक मानवीय भाषण की अव्यवस्था को संभालते हुए सटीक टाइमिंग और नीति पालन बनाए रखने में सक्षम नहीं होते, तब तक वे एक पूरी तरह से हल की गई समस्या के बजाय एक निर्माणाधीन कार्य (work in progress) बने रहेंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →