← नवीनतम पेपर
💬 NLP

VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation

यह शोध पत्र VISTA को प्रस्तुत करता है, जो एक बहुमुखी टूलकिट है जो UI और API इंटरैक्शन दोनों में सक्षम एक हाइब्रिड यूजर सिम्युलेटर के साथ-साथ सिम्युलेटेड इंटरैक्शन की यथार्थता और कवरेज को व्यापक रूप से मापने के लिए छह मेट्रिक्स का एक समूह प्रदान करके मौजूदा एजेंट मूल्यांकन विधियों की सीमाओं को संबोधित करता है।

मूल लेखक: Yunan Lu, Ryan Shea, Yusen Zhang, Zhou Yu

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunan Lu, Ryan Shea, Yusen Zhang, Zhou Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट असिस्टेंट बना रहे हैं जिसे लोगों को ऑनलाइन खरीदारी करने या उनके स्कूल के काम में मदद करने के लिए डिज़ाइन किया गया है। इससे पहले कि आप इस रोबोट को वास्तविक दुनिया में उतारें, आपको यह परीक्षण करने की आवश्यकता है कि यह गलतियाँ न करे, भ्रमित न हो, या गलत सलाह न दे।

समस्या यह है कि असली इंसानों के साथ इसका परीक्षण करना धीमा, महंगा और व्यवस्थित करने में कठिन है। इसलिए, डेवलपर्स आमतौर पर "सिम्युलेटर्स" (simulators) का उपयोग करते हैं—जो अन्य AI प्रोग्राम हैं जो वास्तविक मानव उपयोगकर्ताओं का ढोंग करते हैं। लेकिन मौजूदा सिम्युलेटर्स में दो बड़ी खामियां हैं:

  1. वे बहुत कठोर हैं: वे अक्सर केवल एक स्क्रिप्ट का पालन करते हैं या केवल स्क्रीन पर बटन क्लिक करना जानते हैं, जिससे वे वास्तविक मनुष्यों के अव्यवस्थित और जटिल व्यवहारों को समझने में चूक जाते हैं।
  2. उन्हें परखना कठिन है: ऐसा कोई अच्छा तरीका नहीं है जिससे यह पता चल सके कि सिम्युलेटर रोबोट की कमजोरियों को खोजने में कितना अच्छा काम कर रहा है।

पेश है VISTA (Versatile Interactive user Simulation Toolkit for Agent Evaluation)। VISTA को एक "सुपर-सिम्युलेटर" और एक "क्वालिटी कंट्रोल इंस्पेक्टर" के रूप में समझें।

"हाइब्रिड" सुपर-सिम्युलेटर

अधिकांश पुराने सिम्युलेटर ऐसे होते हैं जैसे कोई व्यक्ति केवल माउस (वेबपेज पर बटन क्लिक करना) का उपयोग करके कंप्यूटर चलाने की कोशिश कर रहा हो। यह धीमा है और इसमें गलतियों की संभावना अधिक होती है क्योंकि कंप्यूटर स्क्रीन अव्यवस्थित होती है और इसमें बहुत सारी बाधाएं होती हैं।

VISTA का सिम्युलेटर अलग है। यह हाइब्रिड (hybrid) है। कल्पना कीजिए कि एक व्यक्ति जो:

  • स्क्रीन पर बटन क्लिक कर सकता है (UI क्रियाएं), ठीक वैसे ही जैसे एक सामान्य उपयोगकर्ता करता है।
  • पर्दे के पीछे झाँक सकता है और सीधे कंप्यूटर के आंतरिक डेटाबेस से जानकारी मांग सकता है (API क्रियाएं), जैसे कि "हे, मेरे ऑर्डर का स्टेटस क्या है?" पूछना, बिना किसी चीज़ को खोजने के लिए पाँच अलग-अलग पेजों पर क्लिक किए बिना।

इन दोनों दृष्टिकोणों को जोड़कर, VISTA एक वास्तविक और कुशल मानव की तरह कार्य कर सकता है। यह अव्यवस्थित वेब के माध्यम से नेविगेट कर सकता है और तुरंत सटीक डेटा प्राप्त कर सकता है, जिससे यह रोबोट असिस्टेंट का बहुत अधिक वास्तविक परिदृश्यों में परीक्षण कर सकता है।

"सिक्स-पॉइंट" रिपोर्ट कार्ड

केवल एक अच्छा सिम्युलेटर होना ही काफी नहीं है; आपको यह जानने की आवश्यकता है कि वह रोबोट का कितनी अच्छी तरह से परीक्षण कर रहा है। VISTA के साथ एक अंतर्निहित रिपोर्ट कार्ड आता है जिसमें परीक्षण की गुणवत्ता को मापने के लिए छह विशिष्ट मेट्रिक्स (ग्रेड) दिए गए हैं:

  1. कवरेज (एक्सप्लोरेशन ग्रेड): क्या सिम्युलेटर सब कुछ आज़माता है? यह जाँचता है कि क्या सिम्युलेटर विभिन्न प्रकार के उपकरणों का उपयोग कर रहा है और अलग-अलग रास्ते अपना रहा है, न कि केवल बार-बार एक ही चीज़ कर रहा है।
    • उपमा: यदि आप एक नई कार का परीक्षण कर रहे हैं, तो आप केवल धूप वाले दिन सीधी रेखा में नहीं चलते। आप बारिश में, बजरी पर और खड़ी चढ़ाई पर भी गाड़ी चलाते हैं। VISTA यह जाँचता है कि क्या सिम्युलेटर इन सभी अलग-अलग स्थितियों में "कार चला" रहा है।
  2. यथार्थवाद (मानव ग्रेड): क्या सिम्युलेटर वास्तविक व्यक्ति की तरह बोलता और व्यवहार करता है? यह जाँचता है कि क्या सिम्युलेटर के शब्द उसके व्यक्तित्व, उसके लक्ष्यों और उसके पास मौजूद तथ्यों से मेल खाते हैं।
    • उपमा: यदि सिम्युलेटर एक व्यस्त छात्र होने का नाटक कर रहा है, तो उसे अचानक एक रोबोट की तरह बात नहीं करनी चाहिए या यह नहीं भूलना चाहिए कि वह क्या करने की कोशिश कर रहा था।
  3. लागत (दक्षता ग्रेड): सिम्युलेटर कितनी "पैसे" (कंप्यूटर पावर) और "समय" (क्लिक की संख्या) का उपयोग करता है?
    • उपमा: यह इस बात की जाँच करने जैसा है कि क्या डिलीवरी ड्राइवर ने सबसे कुशल रास्ता लिया या वह गैस बर्बाद करने के लिए चक्कर काटता रहा।
  4. विफलता की पहचान (बग हंटर ग्रेड): यह सबसे महत्वपूर्ण है। सिम्युलेटर ने रोबोट असिस्टेंट में कितनी गलतियाँ ढूँढ लीं?
    • उपमा: एक अच्छा टेस्ट ड्राइवर केवल कार नहीं चलाता; वे उसे तोड़ने की कोशिश करते हैं। VISTA गिनता है कि कितनी बार रोबोट असिस्टेंट ने गलत उत्तर दिया, अटक गया, या उपयोगकर्ता को गलत समझा।

जब उन्होंने इसका उपयोग किया तो क्या हुआ?

शोधकर्ताओं ने VISTA का परीक्षण दो वास्तविक दुनिया के परिदृश्यों में किया: एक ऑनलाइन शॉपिंग असिस्टेंट और एक शिक्षा सहायता बॉट

उन्होंने अपने "हाइब्रिड" VISTA सिम्युलेटर की तुलना एक मानक "क्लिक-ओनली" सिम्युलेटर से की। परिणाम स्पष्ट थे:

  • बेहतर बग हंटिंग: हाइब्रिड सिम्युलेटर ने पुराने सिम्युलेटर्स की तुलना में रोबोट असिस्टेंट में 42% अधिक अद्वितीय गलतियाँ ढूँढ लीं।
  • अधिक यथार्थवादी: मानव जजों ने हाइब्रिड सिम्युलेटर की बातचीत को अधिक स्वाभाविक और तार्किक बताया।
  • गहन परीक्षण: क्योंकि हाइब्रिड सिम्युलेटर सीधे डेटा (APIs के माध्यम से) मांग सकता था और बटन भी क्लिक कर सकता था, यह रोबोट असिस्टेंट को उन कमजोरियों को उजागर करने के लिए मजबूर कर सका जिन्हें "क्लिक-ओनली" सिम्युलेटर्स मिस कर गए थे।

निचोड़

VISTA एक टूलकिट है जो डेवलपर्स को उन्हें टेस्ट करने के लिए एक स्मार्ट, अधिक लचीले "नकली उपयोगकर्ता" का उपयोग करके बेहतर AI असिस्टेंट बनाने में मदद करता है। यह केवल यह नहीं जाँचता कि रोबोट काम करता है या नहीं; यह सक्रिय रूप से इसे वास्तविक तरीकों से तोड़ने की कोशिश करता है और इस बारे में विस्तृत रिपोर्ट देता है कि यह कहाँ और क्यों विफल हुआ। यह सुनिश्चित करता है कि जब रोबोट को अंततः वास्तविक मनुष्यों के लिए जारी किया जाता है, तो इसके क्रैश होने या गलत सलाह देने की संभावना बहुत कम होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →