← नवीनतम पेपर
💻 computer science

Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking

यह शोध पत्र GenAI Evaluation को प्रस्तुत करता है, जो एक स्केलेबल और गवर्नड पाइपलाइन है जो चुनिatif पुनर्मूल्यांकन (selective re-evaluation) और सख्त स्कीमा नियंत्रणों के साथ LLM-as-a-judge का लाभ उठाता है ताकि कई आयामों में रिटेल कन्वर्सेशनल एजेंट्स का विश्वसनीय रूप से मूल्यांकन किया जा सके, जिसने बीस लाख से अधिक इंटरैक्शन पर मानवीय निर्णयों के साथ उच्च संरेखण प्राप्त किया है।

मूल लेखक: Niranjan Kumar M, Balaji Nagarajan, Karthik Nair, Faysal Satter, Nithin Surendran

प्रकाशित 2026-07-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Niranjan Kumar M, Balaji Nagarajan, Karthik Nair, Faysal Satter, Nithin Surendran

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल रिटेल स्टोर के लिए एक विशाल, 24/7 डिजिटल हेल्प डेस्क चलाते हैं। हर एक दिन, लगभग 50,000 ग्राहक आपके रोबोट असिस्टेंट के साथ चैट करते हैं, जो "हथौड़े कहाँ हैं?" से लेकर "क्या मैं यह शर्ट वापस कर सकता हूँ?" तक सब कुछ पूछते हैं और यहाँ तक कि उन सवालों को विभिन्न भाषाओं में अनुवाद भी करते हैं। यह साल में 2 मिलियन से अधिक बातचीत है!

अब, हर एक चैट को ग्रेड करने की कल्पना करें कि क्या रोबोट मददगार, सत्यनिष्ठ और विनम्र था। यदि आप इसे करने के लिए मानव शिक्षकों का उपयोग करने का प्रयास करते, तो आपको उनके एक सेना की आवश्यकता होती, और इसमें एक बड़ी धनराशि खर्च होती। यदि आप पुराने जमाने की कंप्यूटर गणित (उस प्रकार की जो केवल शब्दों के मिलान को गिनती है) का उपयोग करने का प्रयास करते, तो आप मुख्य बात को पूरी तरह से मिस कर देते—जैसे कि एक रोबट को A+ देना जिसने कहा, "आसमान हरा है," क्योंकि उसने एक सही वाक्य के समान ही शब्दों का उपयोग किया था, भले ही वह पूरी तरह से गलत था।

पेपर का बड़ा विचार: "स्मार्ट, चयनात्मक" ग्रेडिंग मशीन

लेखकों ने इसे हल करने के लिए GenAI Evaluation नामक एक नया सिस्टम बनाया है। इसे एक बहुत ही व्यवस्थित, नियम का पालन करने वाले रोबोट शिक्षक के रूप में समझें जो पहले रोबोट के काम को ग्रेड करने के लिए अन्य, स्मार्ट रोबोटों (लार्ज लैंग्वेज मॉडल्स) का उपयोग करता है।

यह कैसे काम करता है, कुछ मजेदार रूपकों का उपयोग करके:

  • असेंबली लाइन: सभी 2 मिलियन चैट्स के पहाड़ को एक साथ देखने के बजाय, सिस्टम उन्हें छोटे, प्रबंधनीय ढेरों (जिन्हें "शार्ड्स" कहा जाता है) में काट देता है। यह एक कारखाने की तरह है जहाँ कर्मचारी एक बार में केवल एक बॉक्स संभालते हैं, ताकि यदि एक बॉक्स अटक जाए, तो पूरा कारखाना न रुक जाए।
  • "चयनात्मक पुन: प्रयास" (Selective Re-do) ट्रिक: यह सबसे शानदार हिस्सा है। आमतौर पर, यदि एक रोबोट शिक्षक गलती करता है या भ्रमित हो जाता है, तो आपको पूरे ढेर को फेंकना पड़ता है और फिर से शुरू करना पड़ता है। यह समय और ऊर्जा की बर्बादी है। यह नया सिस्टम एक अत्यंत चौकस संपादक की तरह है जो केवल उन विशिष्ट वाक्यों को हाइलाइट करता है जो गलत हैं। यह कहता है, "हे, आपने 99% सही किया, लेकिन यह एक लाइन गड़बड़ है। चलिए बस उस लाइन को ठीक करते हैं।" इसे सेलेक्टिव री-इवैल्यूएशन (selective re-evaluation) कहा जाता है। यह बहुत अधिक कंप्यूटिंग पावर बचाता है और यह सुनिश्चित करता है कि अंतिम ग्रेड बुक बिना किसी अनावश्यक काम के पूर्ण हो।
  • नियम पुस्तिका (गवर्नेंस): सिस्टम नियमों के प्रति जुनूनी है। यह ठीक से लॉक कर देता है कि ग्रेड कैसे दिखने चाहिए (इसे "स्कीमा" कहा जाता है) ताकि कोई गलती से गलत कॉलम में ग्रेड न लिख दे। यह इस बात का विस्तृत विवरण रखता है कि किस संस्करण के रोबोट शिक्षक ने ग्रेडिंग की, उन्होंने किन नियमों का उपयोग किया, और यह कब हुआ। इसका मतलब है कि यदि आपको कभी भी उनके काम की जांच करने की आवश्यकता है, तो आप इसे बिल्कुल सही ढंग से ट्रैक कर सकते हैं, जैसे ब्रेडक्रंब ट्रेल (रोटी के टुकड़ों के निशान) का पीछा करना।

उन्होंने क्या पाया (स्कोरकार्ड)

टीम ने वास्तविक रिटेल चैट लॉग्स पर इस सिस्टम का परीक्षण किया। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने रोबोट के ग्रेड की तुलना चार वास्तविक मानव विशेषज्ञों द्वारा ग्रेड की गई 12,980 बातचीत के एक सावधानीपूर्वक चुने गए समूह से की। मनुषियों को पता नहीं था कि कौन सा रोबोट ग्रेडिंग कर रहा है (निष्पक्षता बनाए रखने के लिए)।

यहाँ वे संख्याएँ हैं, ठीक वैसे ही जैसे उन्होंने मापी हैं:

  • चैट को समझना: जब बात ग्राहक की इच्छा को समझने की आई (जैसे "मुझे एक ड्रिल चाहिए" बनाम "मुझे एक हथौड़ा चाहिए"), तो सिस्टम ने एक 0.93 का स्कोर प्राप्त किया (एक स्केल पर जहाँ उच्च स्कोर बेहतर होता है, जिसे "मैक्रो F1 स्कोर" कहा जाता है)। यह मानव विशेषज्ञों के साथ एक बहुत मजबूत मिलान है।
  • अनुवाद: उन चैट्स के लिए जिन्हें अन्य भाषाओं में अनुवाद करने की आवश्यकता थी, सिस्टम मानव समीक्षकों के अनुसार 89% सटीक था।
  • रोबोट शिक्षक: उन्होंने अलग-अलग आकार के "जज" रोबोटों का परीक्षण किया। छोटे वाले तेज़ थे लेकिन कभी-कभी बारीकियों को मिस कर जाते थे। विशाल वाले (जैसे 70B पैरामीटर मॉडल) सबसे सटीक थे, जो 0.93 का स्कोर हासिल करते थे, लेकिन उन्हें चलाने के लिए अधिक शक्तिशाली कंप्यूटरों (विशेष रूप से NVIDIA H100 चिप्स) की आवश्यकता थी।

वे स्पष्ट रूप से क्या नहीं कहते हैं

यह जानना महत्वपूर्ण है कि यह सिस्टम क्या नहीं है या लेखक किस बात के प्रति चेतावनी देते हैं:

  • यह कोई जादुई "सत्य" मशीन नहीं है: लेखक स्पष्ट रूप से कहते हैं कि ये रोबोट ग्रेड "क्वालिटी सिग्नल्स" हैं, पूर्ण, अपरिवर्तनीय तथ्य नहीं। ये पैटर्न पर आधारित सुझाव हैं, दिव्य निर्णय नहीं।
  • यह अभी हर काम के लिए परफेक्ट नहीं है: इस सिस्टम को रिटेल चैट्स के लिए बनाया गया था। लेखक स्पष्ट रूप से कहते हैं कि हमें नहीं पता कि क्या यह चिकित्सा सलाह, कानूनी सहायता, या कोड लिखने जैसे पूरी तरह से अलग दुनियाओं में काम करता है। उनके लिए अलग नियमों की आवश्यकता हो सकती है।
  • यह बड़े पलों में मनुष्यों का विकल्प नहीं है: यदि कोई चैट खतरनाक, संवेदनशील, या वास्तव में भ्रमित करने वाली है, तो सिस्टम उसे मानव के पास भेजने का सुझाव देता है। रोबोट एक सहायक है, अंतिम बॉस नहीं।
  • यह कोई "हल की गई" (solved) समस्या नहीं है: लेखक स्वीकार करते हैं कि चूंकि उनके पास प्रत्येक चैट के लिए केवल एक मानव ग्रेड था (बज instead में कई मनुषियों के सहमत होने के), वे 100% निश्चित नहीं हो सकते हैं कि मनुष्य एक-दूसरे के साथ कितने सहमत होंगे। वे सुझाव देते हैं कि भविष्य के परीक्षणों में मनुषियों को अधिक निश्चित होने के लिए समान चैट्स की दोबारा जांच करनी चाहिए।

निष्कर्ष

पेपर यह सुझाव देता है कि एक स्मार्ट, नियम-बद्ध पाइपलाइन का उपयोग करके जो केवल उस काम को दोबारा करता है जिसे वास्तव में ठीक करने की आवश्यकता है, हम लाखों रोबोट बातचीत को तेज़ी से और निष्पक्ष रूप से ग्रेड कर सकते हैं। यह एक आदर्श, जादुई समाधान नहीं है जो हर जगह हमेशा के लिए काम करेगा, लेकिन यह यह सुनिश्चित करने के लिए कि हमारे रिटेल रोबोट दोस्त वास्तव में मददगार, सत्यनिष्ठ और विनम्र हैं, एक बहुत बड़ा कदम है, बिना हर एक शब्द को पढ़ने के लिए मानव की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →