← नवीनतम पेपर
🤖 machine learning

Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation

यह शोध पत्र 'ऑटोनॉमस क्यूए एजेंट' (Autonomous QA Agent) को प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) फ्रेमवर्क है जो कोड जनरेशन को प्रोजेक्ट-विशिष्ट दस्तावेज़ों और वास्तविक HTML संरचनाओं के आधार पर सुदृढ़ करके सेलेनियम (Selenium) स्क्रिप्ट की सटीकता में महत्वपूर्ण सुधार करता है, जिससे मानक एलएलएम (LLMs) के 30% की तुलना में 90% का निष्पादन सफलता दर प्राप्त होता है।

मूल लेखक: Dudekula Kasim Vali

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dudekula Kasim Vali

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट को एक विशिष्ट घर में नेविगेट करना सिखाने की कोशिश कर रहे हैं ताकि वह कोई कार्य पूरा कर सके, जैसे कि "कॉफी का एक कप बनाना"।

समस्या: अनाड़ी रोबोट
सॉफ्टवेयर टेस्टिंग की दुनिया में, यह रोबोट एक आर्टिफिशियल इंटेलिजेंस (AI) है, विशेष रूप से एक जिसे 'लार्ज लैंग्वेज मॉडल' (LLM) कहा जाता है। यदि आप एक मानक AI से किसी वेबसाइट पर "Buy बटन क्लिक करने" के लिए स्क्रिप्ट लिखने को कहते हैं, तो वह अपना सर्वश्रेष्ठ प्रयास करेगा। हालाँकि, चूँकि उसने कभी उस विशिष्ट वेबसाइट को नहीं देखा है जिसके बारे में आप बात कर रहे हैं, इसलिए उसे अनुमान लगाना होगा।

वह अनुमान लगा सकता है कि बटन का नाम #submit-button है। फिर भी, आपकी वास्तविक वेबसाइट पर, बटन का नाम #btn-pay-now हो सकता है। AI "हैलुसिनेट" (hallucinate) करता है—वह ऐसी विवरण बनाता है जो सुनने में सही लगते हैं लेकिन पूरी तरह से गलत होते हैं। इस पेपर में, यह एक रोबोट के समान है जो असली चाबी के बजाय अपनी खुद की बनाई हुई चाबी से दरवाजा खोलने की कोशिश करता है। जब रोबोट अपनी गलत चाबी का उपयोग करने का प्रयास करता है, तो स्क्रिप्ट क्रैश हो जाती है और टेस्ट फेल हो जाता है।

समाधान: "ऑटोनॉमस QA एजेंट"
शोधकर्ताओं ने एक स्मार्ट सिस्टम विकसित किया है जिसे ऑटोनॉमस QA एजेंट कहा जाता है। इस एजेंट की कल्पना एक ऐसे रोबोट के रूप में करें जो केवल अनुमान नहीं लगाता; बल्कि काम शुरू करने से पहले, वह ब्लूप्रिंट पढ़ने और वास्तविक घर का निरीक्षण करने के लिए लाइब्रेरी में जाता है।

यह इस सरल उपमा (analogy) का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:

  1. लाइब्रेरी (ज्ञान का आधार/Knowledge Base): रोबोट द्वारा कुछ भी करने से पहले, सिस्टम दो चीजें लेता है और उन्हें एक डिजिटल लाइब्रेरी में जमा कर देता है:

    • निर्देश (Instructions): लिखित आवश्यकताएं (जैसे कि कोई रेसिपी या यूजर मैनुअल)।
    • ब्लूप्रिंट (Blueprints): वेबसाइट का वास्तविक कोड स्ट्रक्चर (HTML), जो दिखाता है कि हर बटन और फील्ड वास्तव में कहाँ स्थित है।
  2. खोज (Retrieval): जब आप रोबट को "चेकआउट प्रक्रिया का परीक्षण करने" के लिए कहते हैं, तो वह केवल अनुमान नहीं लगाता। वह तुरंत अपनी लाइब्रेरी में खोज करता है। वह "चेकआउट" से संबंधित विशिष्ट पेज पाता है और उस पेज के सटीक ब्लूप्रिंट को प्राप्त करता है। वह देखता है: "आह, 'Pay' बटन की ID btn_pay है, न कि submit।"

  3. लेखन (Generation): अब रोबोट उस वास्तविक जानकारी का उपयोग करके स्क्रिप्ट लिखता है जो उसने अभी खोजी है। अब वह अनुमान नहीं लगाता; वह मानचित्र (map) का पालन करता है।

परिणाम: दो रोबोटों के बीच की दौड़
शोधकर्ताओं ने इस नए सिस्टम का परीक्षण 20 अलग-अलग शॉपिंग परिदृश्यों (जैसे कार्ट में आइटम जोड़ना या भुगतान करना) के साथ एक मानक AI रोबोट के विरुद्ध किया।

  • मानक रोबोट (बिना लाइब्रेरी के): इसने स्क्रिप्ट का सिंटैक्स (व्याकरण) सही लिखा, लेकिन बटनों को खोजने में 70% मामलों में विफल रहा क्योंकि यह अनुमान लगा रहा था। यह केवल 30% टेस्ट पास कर सका।
  • ऑटोनॉमस एजेंट (लाइब्रेरी के साथ): चूंकि इसने वास्तविक बटन के नाम ढूँढ लिए थे, इसलिए यह 90% टेस्ट पास करने में सफल रहा। इसने व्याकरण को 100% सही रखा।

यह क्यों महत्वपूर्ण है
पेपर का तर्क है कि ऑटोमेटेड टेस्टिंग की सबसे बड़ी समस्या यह नहीं है कि AI कोड नहीं लिख सकता; बल्कि यह है कि AI को उन चीजों के विशिष्ट "पते" (address) का पता नहीं होता जिन्हें उसे क्लिक करने की आवश्यकता होती है। AI को एक "रिट्रीवल-ऑगमेंटेड" (Retrieval-Augmented) सिस्टम (बोलने से पहले तथ्यों को खोजने का एक तरीका) देकर, उन्होंने AI को गलत पते आविष्कार करने से रोक दिया।

यह पेपर क्या दावा नहीं करता है
यह ध्यान देना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह हर प्रकार के सॉफ्टवेयर (जैसे बैंकिंग या स्वास्थ्य ऐप) के लिए काम करता है; उन्होंने इसे केवल एक नकली ऑनलाइन स्टोर पर टेस्ट किया है।
  • यह नहीं कहता कि रोबोट खुद को ठीक कर सकता है यदि कल वेबसाइट बदल जाती है (हालांकि उन्होंने इसे भविष्य के विचार के रूप में उल्लेख किया है)।
  • यह दावा नहीं करता कि यह उन महंगे कमर्शियल टूल्स से बेहतर है जिन्हें मनुष्यों द्वारा मैन्युअल रूप से सेटअप किया जाना चाहिए; उन्होंने केवल इसकी तुलना बिना लाइब्रेरी वाले एक "रॉ" (raw) AI से की है।

सारांश
यह पेपर एक ऐसे टूल को पेश करता है जो वेबसाइटों का परीक्षण करते समय AI को अनुमान लगाने से रोकता है। AI को कोड लिखने से पहले वेबसाइट के वास्तविक "ब्लूप्रिंट" (HTML) और "निर्देशों" (दस्तावेजों) को पढ़ने के लिए मजबूर करके, यह सिस्टम विश्वसनीय टेस्ट बनाता है जो वास्तव में काम करते हैं, जिससे एक अनाड़ी अनुमान लगाने वाले को एक सटीक कार्यकर्ता में बदल दिया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →