← नवीनतम पेपर
💬 NLP

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

यह शोध पत्र नुबैंक (Nubank) में विकसित एक एकीकृत, मूल्यांकन-संचालित ढांचे को प्रस्तुत करता है जो संरचित संदर्भ इंजीनियरिंग (structured context engineering), मानव-इन-द-लूप इटरेशन (human-in-the-loop iteration), और कठोर एलएलएम जज मूल्यांकन (LLM judge evaluation) को एकीकृत करता है ताकि पांच डोमेन में 10 करोड़ से अधिक उपयोगकर्ताओं के लिए प्रोडक्शन-रेडी ग्राहक सहायता एआई एजेंटों को सफलतापूर्वक तैनात किया जा सके, जिससे संतुष्टि और सेल्फ-सर्विस दरों में महत्वपूर्ण सुधार हुआ है और ऑफलाइन मेट्रिक्स तथा ऑनलाइन प्रभाव के बीच एक मजबूत सहसंबंध प्रदर्शित हुआ है।

मूल लेखक: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 10 करोड़ ग्राहकों वाले एक विशाल बैंक चलाते हैं। हर दिन, लाखों लोग कॉल या चैट करते हैं और सवाल पूछते हैं जैसे, "मेरा क्रेडिट कार्ड कहाँ है?" या "मुझे इतना पैसा क्यों देना पड़ रहा है?"

अतीत में, इन सवालों के जवाब देने के लिए आपको इंसानी एजेंटों की एक बड़ी फौज की जरूरत होती। लेकिन अब, आप इन बातचीत को संभालने के लिए एक सुपर-स्मार्ट AI रोबोट बनाना चाहते हैं। समस्या यह है कि अगर रोबोट गलत जवाब देता है, तो ग्राहक नाराज हो जाता है, भरोसा खो देता है और चला जाता है। आप सिर्फ "अंदाजा" नहीं लगा सकते कि आपका रोबोट अच्छा है; आपको इसे असली लोगों से बात करने देने से पहले 100% सुनिश्चित होना होगा।

यह पेपर नुबैंक (एक विशाल बैंक) का एक ब्लूप्रिंट है कि उन्होंने इन AI रोबोट्स को सुरक्षित और सफलतापूर्वक कैसे बनाया। यहाँ बताया गया है कि उन्होंने यह कैसे किया, सरल शब्दों में:

1. समस्या: बिना क्रैश टेस्ट के रोबोट बनाना

आमतौर पर, जब लोग AI बनाते हैं, तो वे निर्देश लिखते हैं, थोड़ा परीक्षण करते हैं, और फिर उम्मीद करते हैं कि सब ठीक होगा। लेखक कहते हैं कि यह एक कार बनाने और यह देखने के लिए उसे खाई में से नीचे गिराने जैसा है कि एयरबैग काम करते हैं या नहीं। कस्टमर सपोर्ट में, एक 'क्रैश' बहुत महंगा पड़ता है।

उन्हें एक "सिम्युलेटर" में रोब의 हजारों बार परीक्षण करने की आवश्यकता थी, इससे पहले कि वे इसे एक भी वास्तविक इंसान से बात करने दें।

2. समाधान: "इवैल्यूएशन-ड्रिवन" फैक्ट्री

केवल निर्देश लिखने के बजाय, उन्होंने चार स्टेशनों वाली एक फैक्ट्री लाइन बनाई। इसे एक रेस कार को ट्यून करने की तरह समझें:

  • स्टेशन 1: मॉड्यूलर किट (कॉन्टेक्स्ट इंजीनियरिंग)
    रोबोट के लिए एक बड़ा, उलझा हुआ निर्देश मैनुअल लिखने के बजाय, उन्होंने इसे लेगो (Lego) ब्लॉक्स में तोड़ दिया।

    • नियम: रोबोट को कैसे बोलना चाहिए (विनम्र, संक्षिप्त)।
    • प्लेबुक: विशिष्ट समस्याओं के लिए चरण-दर-चरण मार्गदर्शिका (जैसे, "यदि कार्ड खो गया है, तो चरण A करें, फिर चरण B करें")।
    • टूल्स: उन चीजों की सूची जो रोबोट वास्तव में कर सकता है (जैसे, डेटाबेस चेक करना या कार्ड दोबारा जारी करना)।
    • मेमोरी: एक स्क्रैचपैड जहाँ रोबोट वह लिखता है जो उसने चैट के दौरान सीखा है।
    • यह क्यों मायने रखता है: यदि रोबोट अभिवादन (greeting) गलत करता है, तो आप केवल "ग्रीटिंग लेगो ब्लॉक" को बदलते हैं। आपको पूरी कार को फिर से बनाने की जरूरत नहीं पड़ती।
  • स्टेशन 2: रोबोट जज (LLM-as-a-Judge)
    आपको कैसे पता चलेगा कि रोबोट अच्छा काम कर रहा है? आप रोबोट को खुद को ग्रेड करने के लिए नहीं कह सकते। इसलिए, उन्होंने एक दूसरे AI (एक "जज") का उपयोग किया ताकि पहले रोबोट के जवाबों को ग्रेड किया जा सके।

    • चुनौती: कभी-कभी जज AI पक्षपाती या आलसी होता है। इसे ठीक करने के लिए, उन्होंने GEPA नामक एक विशेष तकनीक का उपयोग किया। एक कोच की कल्पना करें जो जज AI को टेस्ट ग्रेड करते हुए देखता है, महसूस करता है कि जज बहुत सख्त था, और ग्रेडिंग को अधिक निष्पक्ष बनाने के लिए ग्रेडिंग रूब्रिक को फिर से लिखता है। उन्होंने इसे स्वचालित रूप से तब तक किया जब तक कि ग्रेडिंग बहुत सुसंगत (consistent) नहीं हो गई।
  • स्टेशन 3: मानवीय सुरक्षा जाल (इंटर-रेटर रिलायबिलिटी)
    AI जज पर भरोसा करने से पहले, उन्होंने वास्तविक मनुष्यों से एक ही जवाबों को ग्रेड करवाया। उन्होंने जांचा कि क्या मनुष्य एक-दूसरे से सहमत थे। यदि मनुष्य 90% समय सहमत थे, तो उन्हें पता चल गया कि टेस्ट निष्पक्ष था। फिर, उन्होंने यह सुनिश्चित किया कि AI जज भी मनुष्यों की तरह ही उतना ही सहमत हो।

  • स्टेशन 4: वास्तविक दुनिया का परीक्षण (A/B टेस्टिंग)
    एक बार जब रोबोट सिम्युलेटर टेस्ट पास कर लेता है, तो वे इसे वास्तविक ग्राहकों के एक छोटे समूह (जैसे, 1% यूजर्स) को देते हैं। वे इस रोबोट की तुलना पुराने सिस्टम से करते हैं। यदि नया रोबोट ग्राहकों को अधिक खुश करता है, तो वे इसे अधिक लोगों तक जाने देते हैं।

3. परिणाम: रोबोट की जीत

उन्होंने पांच अलग-अलग प्रकार की समस्याओं पर इस सिस्टम का परीक्षण किया:

  1. कार्ड डिलीवरी: "मेरा कार्ड कहाँ है?"
  2. ऋण प्रबंधन (Debt Management): "मैं अपना ऋण कैसे चुकाऊं?"
  3. क्रेडिट लिमिट: "क्या मुझे अधिक लिमिट मिल सकती है?"
  4. कार्ड मैनेजमेंट: "अपना PIN बदलें।"
  5. प्रोडक्ट एक्सप्लेनर: "यह फीचर क्या करता है?"

जादुई नंबर:

  • खुशी: "कार्ड डिलीवरी" रोबोट के लिए, ग्राहकों की खुशी (tNPS नामक स्कोर द्वारा मापी गई) 37 अंक बढ़ गई। यह एक बहुत बड़ा सुधार है।
  • सेल्फ-सर्विस: अधिक लोगों ने अपनी समस्याओं को बिना किसी इंसान की मदद के हल किया। "सेल्फ-सर्विस रेट" 29 अंक बढ़ गया।
  • इंसान बनाम रोबोट: पांच में से चार मामलों में, रोबोट एक शीर्ष स्तर के मानव विशेषज्ञ के लगभग बराबर था (कुछ प्रतिशत के भीतर)। एकमात्र जगह जहाँ उसे थोड़ा संघर्ष करना पड़ा वह बहुत जटिल "ऋण प्रबंधन" क्षेत्र था, जो स्वाभाविक है क्योंकि यह सबसे कठिन गणित और सहानुभूति वाली समस्या है।

4. सबसे बड़ा सबक: "यदि आप इसे माप सकते हैं, तो आप इसे ठीक कर सकते हैं"

इस पेपर का सबसे महत्वपूर्ण निष्कर्ष यह है: आपके परीक्षण की गुणवत्ता यह निर्धारित करती है कि आप कितनी तेजी से सुधार कर सकते हैं।

क्योंकि उन्होंने रोबोट के लिए एक बहुत ही कठोर परीक्षण प्रणाली (सिम्युलेटर) बनाई थी, वे रोबोट के निर्देशों में बदलाव कर सकते थे और तुरंत जान सकते थे कि यह बेहतर हुआ या बदतर। उन्हें यह देखने के लिए हफ्तों इंतजार नहीं करना पड़ा कि ग्राहक खुश हैं या नहीं। वे सिम्युलेटर में रोबोट को दर्जनों बार सुधार (iterate) सकते थे, और जब उन्होंने अंततः इसे लॉन्च किया, तो यह पहले से ही एक चैंपियन था।

संक्षेप में: उन्होंने केवल एक स्मार्ट AI नहीं बनाया; उन्होंने AI के लिए एक स्मार्ट टेस्टिंग लैब बनाया। और क्योंकि लैब इतनी अच्छी थी, दुनिया में भेजा गया रोबोट अविश्वसनीय रूप से विश्वसनीय, खुशी देने वाला और 10 करोड़ उपयोगकर्ताओं के लिए तैयार था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →