← नवीनतम पेपर
💬 NLP

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

यह शोध पत्र SAGE का प्रस्ताव करता है, जो मल्टी-टर्न एजेंटों के मूल्यांकन के लिए एक नवीन यूजर सिमुलेशन फ्रेमवर्क है, जो यथार्थवादी और विविध इंटरैक्शन उत्पन्न करने के लिए टॉप-डाउन बिजनेस लॉजिक और बॉटम-अप इंफ्रास्ट्रक्चर नॉलेज को एकीकृत करता है, जो मौजूदा तरीकों की तुलना में एजेंट की त्रुटियों को पहचानने में काफी अधिक सक्षम है।

मूल लेखक: Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया, हाई-टेक रोबोट बरिस्ता (barista) बना रहे हैं। इससे पहले कि आप अपनी दुकान असली दुनिया के लिए खोलें, आपको इसका परीक्षण करना होगा। आप यह सुनिश्चित करना चाहते हैं कि यह बदतमीज ग्राहकों, जटिल ऑर्डर्स और अजीब सवालों को संभाल सके बिना क्रैश हुए या हर जगह कॉफी गिराए।

अतीत में, डेवलपर्स के पास अपने एजेंटों (AI चैटबॉट्स) का परीक्षण करने के दो मुख्य तरीके थे:

  1. असली इंसानों को काम पर रखना: महंगा, धीमा और स्केल करने में कठिन।
  2. एक जेनेरिक कंप्यूटर प्रोग्राम का उपयोग करना: तेज़, लेकिन ये प्रोग्राम "रोबोट की तरह व्यवहार करने वाले रोबोट" की तरह काम करते हैं। वे उबाऊ, दोहराव वाले सवाल पूछते हैं और वास्तविक लोगों की तरह व्यवहार नहीं करते।

मिलिए SAGE से।

यह पेपर SAGE (एक टॉप-डाउन बॉटम-अप नॉलेज-ग्राउंडेड यूजर सिम्युलेटर) को पेश करता है। SAGE को केवल एक जेनेरिक रोबोट के रूप में नहीं, बल्कि टेस्टिंग के लिए एक मास्टर मेथड एक्टर के रूप में सोचें। यह केवल एक इंसान होने का "दिखावा" नहीं करता; यह एक विशिष्ट इंसान की तरह व्यवहार करता है जिसके पास एक विशिष्ट काम, एक विशिष्ट बजट और वहां होने का एक विशिष्ट कारण है।

SAGE कैसे काम करता है, यहाँ सरल रूपकों (metapors) में दिया गया है:

1. "टॉप-डाउन" दृष्टिकोण: कास्टिंग डायरेक्टर

कल्पना कीजिए कि आप एक नाटक के लिए कास्टिंग कर रहे हैं। आप केवल यह नहीं कहते, "हमें एक ग्राहक चाहिए।" आप कहते हैं, "हमें सारा नाम की एक 35 वर्षीय प्रोजेक्ट मैनेजर चाहिए, जो अपने बजट को लेकर तनाव में है, दक्षता (efficiency) पसंद करती है, और अपने ऑफिस के लिए एक क्लीनिंग रोबोट की तलाश में है।"

  • रूपक: यह टॉप-डाउन वाला हिस्सा है। SAGE "आइडियल कस्टमर प्रोफाइल्स" (ICPs) का उपयोग करता है। यह वास्तविक व्यावसायिक तर्क के आधार पर सिम्युलेटर के लिए एक विस्तृत चरित्र विवरण (character sheet) बनाता है।
  • यह क्यों महत्वपूर्ण है: एक जेनेरिक सिम्युलेटर पूछ सकता है, "इसकी कीमत कितनी है?" एक SAGE सिम्युलेटर, "प्रोजेक्ट मैनेजर सारा" की भूमिका निभाते हुए पूछेगा, "क्या यह मेरे $10,000 के Q3 बजट के भीतर आता है, और क्या यह मेरे ऑफिस के हाई-ट्रैफिक गलियारे को संभाल सकता है?" यह AI को विशिष्ट, यथार्थवादी सवालों के जवाब देने के लिए मजबूर करता है।

2. "बॉटम-अप" दृष्टिकोण: स्क्रिप्टराइटर

अब, कल्पना कीजिए कि प्रोजेक्ट मैनेजर सारा स्टोर में आती है। उसने पहले ही कंपनी की वेबसाइट पढ़ ली है, प्रोडक्ट मैनुअल देख लिया है, और FAQ में बताए गए "50% छूट" वाले सेल के बारे में जान लिया है।

  • रूपक: यह बॉटम-अप वाला हिस्सा है। SAGE बिजनेस के वास्तविक "स्क्रिप्ट" को सिम्युलेटर में फीड करता है: प्रोडक्ट कैटलॉग, FAQs, तकनीकी स्पेसिफिकेशन और नॉलेज बेस।
  • यह क्यों महत्वपूर्ण है: यदि AI कहता है, "हमारा रोबोट उड़ सकता है," लेकिन प्रोडक्ट मैनुअल कहता है "यह जमीन पर रहता है," तो एक जेनेरिक सिम्युलेटर शायद केवल सिर हिला देगा। SAGE, मैनुअल पढ़ने के बाद, तुरंत कहेगा, "रुको, तुम्हारी वेबसाइट कहती है कि यह केवल जमीन के लिए है। फिर तुम मुझे कह रहे हो कि यह उड़ सकता है?" यह हैलुसिनेशन (मनगढ़ंत बातें) और गलतियों को पकड़ लेता है।

3. "मेथड एक्टिंग" सत्र

जब SAGE, AI एजेंट से बात करता है, तो यह एक रोबोट का दूसरे रोबोट से बात करना नहीं है। यह एक पूरी तरह से विकसित चरित्र है जो AI के साथ बातचीत कर रहा है।

  • वह देर होने के कारण चिड़चिड़ा हो सकता है।
  • वह भ्रमित हो सकता है क्योंकि उसने दो अलग-अलग वेबपेज पढ़े हैं।
  • वह प्रोडक्ट कैटलॉग के किसी विशिष्ट विवरण के आधार पर फॉलो-अप सवाल पूछ सकता है जिसे उसने "याद" रखा है।

परिणाम: बग्स को ढूंढना

पेपर ने अन्य सिम्युलेटर्स के मुकाबले SAGE का परीक्षण किया और पाया कि:

  • यह अधिक यथार्थवादी है: बातचीत वास्तविक इंसानों जैसी लगी, न कि रोबोट जैसी।
  • यह एक बेहतर बग हंटर है: SAGE ने अन्य तरीकों की तुलना में 33% अधिक त्रुटियां पकड़ीं।

क्यों? क्योंकि SAGE ही एकमात्र ऐसा है जो वे कठिन, विशिष्ट सवाल पूछ रहा है जो वास्तविक ग्राहक पूछते हैं।

  • जेनेरिक सिम्युलेटर: "क्या यह अच्छा है?" -> AI: "हाँ।" -> पास।
  • SAGE सिम्युलेटर: "मुझे इसकी जरूरत एक धूल भरे वातावरण वाले खेत के लिए है। तुम्हारा मैनुअल कहता है कि यह इनडोर कैफे के लिए है। क्या इसमें डस्ट सील है?" -> AI: "अह, हाँ, यह खेतों के लिए भी बहुत अच्छा है।" -> फेल। (AI झूठ बोल रहा है; SAGE ने इसे पकड़ लिया)।

निचोड़ (The Bottom Line)

SAGE, AI के लिए एक स्ट्रेस-टेस्ट सिम्युलेटर की तरह है। केवल यह जांचने के बजाय कि क्या AI "नमस्ते" कह सकता है, यह AI को एक जटिल, यथार्थवादी परिदृश्य में डाल देता है जहाँ उसे एक विशिष्ट ग्राहक के व्यक्तित्व, एक विशिष्ट बजट और तथ्यों के एक विशिष्ट सेट को संभालना होता है।

कौन है (टॉप-डाउन) और ग्राहक क्या जानता है (बॉटम-अप) को मिलाकर, SAGE एक वास्तविक ग्राहक का "डिजिटल ट्विन" बनाता है। यह कंपनियों को उनके AI की गलतियों को ठीक करने में मदद करता है इससे पहले कि वे कभी किसी वास्तविक इंसान को परेशान करें, जिससे समय, पैसा और प्रतिष्ठा बचती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →