← नवीनतम पेपर
🤖 machine learning

Evaluating Fuzz Testing for Reinforcement Learning Agents

यह शोध पत्र प्रभावशीलता, विविधता, दक्षता और व्यावहारिक उपयोगिता के आधार पर पांच अत्याधुनिक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) फज़िंग विधियों का व्यवस्थित रूप से मूल्यांकन करने वाला पहला व्यापक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि थ्रूपुट-उन्मुख और अन्वेषण-केंद्रित रणनीतियों को संयोजित करने से क्रैश डिस्कवरी और मजबूती में बेहतर सुधार प्राप्त होता है।

मूल लेखक: Zhibin Kang, Hanmo You, Dong Wang, Haiming Zheng, Junjie Chen

प्रकाशित 2026-07-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhibin Kang, Hanmo You, Dong Wang, Haiming Zheng, Junjie Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक ऐसा रोबोट बनाया है जो बार-बार एक वीडियो गेम खेलकर चलना, कार चलाना या ड्रोन उड़ाना सीखता है। हर बार जब वह कोई अच्छा कदम उठाता है, तो उसे एक डिजिटल 'हाई-फाइव' (इनाम) मिलता है; हर बार जब वह लड़खड़ाता है या दुर्घटनाग्रस्त होता है, तो उसे एक हल्की डांट (दंड) मिलती है। इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। यह हमें मशीनों को वास्तविक दुनिया में निर्णय लेने के लिए सिखाने का तरीका है। लेकिन यहाँ एक पेंच है: ठीक वैसे ही जैसे इंसान साइकिल चलाना सीखता है, ये रोबोट कभी-कभी कुछ अजीब, खतरनाक या पूरी तरह से अप्रत्याशित कर सकते हैं जब वे ऐसी स्थिति में पहुँचते हैं जिसे उन्होंने पहले नहीं देखा है। यदि एक स्वायत्त कार अचानक एक अजीब छाया की वजह से दीवार में जा टकराती है, तो यह एक समस्या है।

इन आपदाओं को रोकने के लिए, इंजीनियर फज़ टेस्टिंग (Fuzz Testing) नामक तकनीक का उपयोग करते हैं। इसे एक अराजक, अत्यधिक ऊर्जावान स्ट्रेस-टेस्टर की तरह समझें। एक सावधानीपूर्वक योजनाबद्ध मार्ग के बजाय, फज़ टेस्टर रोबोट पर लाखों यादृच्छिक (random), अजीब और थोड़े टूटे-फूटे परिदृश्य फेंकता है ताकि यह देखा जा सके कि वह टूटता है या नहीं। यह एक स्नोमैन पर लाखों अलग-अलग प्रकार के बर्फ के गोले फेंकने जैसा है ताकि यह देखा जा सके कि कौन सा उसे ढहा देता है। लक्ष्य यह है कि रोबोट वास्तविक दुनिया में पहुँचने से पहले ही उसकी "दुर्घटनाओं" को ढूंढ लिया जाए। लेकिन इन "बर्फ के गोलों" को फेंकने के इतने सारे तरीकों के साथ, शोधकर्ता इस बात पर बहस कर रहे हैं कि वास्तव में कौन सी विधि सबसे अच्छी है। कुछ कहते हैं कि आपको एक स्मार्ट, निर्देशित दृष्टिकोण की आवश्यकता है; अन्य कहते हैं कि बस यादृच्छिक रूप से चीजें फेंकना ही काफी है। यह शोध पत्र इस विवाद को सुलझाने के लिए इस बहस में कदम रखता है।


द ग्रेट रोबोट क्रैश-टेस्ट शोडाउन

इस अध्ययन में, शोधकर्ताओं ने एक विशाल, उच्च-दांव वाले रोबोट क्रैश-टेस्ट प्रतियोगिता में न्यायाधीश की भूमिका निभाई। उन्होंने केवल एक विधि नहीं चुनी और उम्मीद नहीं की; उन्होंने वर्तमान में मौजूद पाँच सबसे उन्नत "फज़िंग" विधियों को इकट्ठा किया और उन्हें एक-दूसरे के सामने खड़ा किया, साथ ही साधारण, पुराने ज़माने के "रैंडम टेस्टिंग" (बस अंधे होकर बर्फ के गोले फेंकना) को भी शामिल किया। उन्होंने इन विधियों का परीक्षण कठिनाई के तीन अलग-अलग स्तरों पर किया: पहाड़ी पर चढ़ती एक साधारण कार, ऊबड़-खाबड़ इलाके पर चलने वाला दो पैरों वाला रोबोट, और एक व्यस्त शहर में नेविगेट करने वाली एक स्वायत्त कार।

स्पीड किंग बनाम डाइवर्सिटी क्वीन
परिणाम आश्चर्यजनक थे और उन्होंने एक स्पष्ट ट्रेड-ऑफ (समझौता) का खुलासा किया। यदि आप कम से कम समय में सबसे अधिक दुर्घटनाएं खोजना चाहते हैं, तो MDPFuzz निर्विवाद चैंपियन है। यह एक सुपर-फास्ट, हल्के ड्रोन की तरह है जो टेस्ट ट्रैक के चारों ओर तेजी से घूमता है, और दुर्घटनाओं को खोजने की इसकी दर ने अन्य विधियों को पीछे छोड़ दिया। दो पैरों वाले रोबट के परीक्षण पर, MDPFuzz ने लगभग 12,000 दुर्घटनाएं पाईं, जबकि कुछ अन्य विधियों ने 100 से भी कम पाईं। यह अविश्वसनीय रूप से कुशल है, और हर बार एक नया नया कदम उठाने पर एक नई दुर्घटना ढूंढ लेता है।

हालाँकि, तेज़ होने का मतलब यह नहीं है कि आप पूरी तरह से गहन हैं। जबकि MDPFuzz अधिक दुर्घटनाएं पाता है, उनमें से कई बहुत समान दिखती हैं। यह एक ही पत्थर से टकराकर गिरने के 1,000 तरीके खोजने जैसा है। दूसरी ओर, जो विधियाँ विविधता (diversity) के लिए डिज़ाइन की गई हैं, जैसे कि SeqDivFuzz, धीमी थीं लेकिन उन्होंने ऐसी दुर्घटनाएं पाईं जो एक-दूसरे से बहुत अलग थीं। उन्होंने उन अजीब, दुर्लभ तरीकों को खोजा जिनसे रोबोट विफल हो सकता है, न कि केवल सामान्य तरीकों को।

"रैंडम" का सरप्राइज
सबसे बड़ी बातों में से एक यह थी कि रैंडम टेस्टिंग (वह विधि जो बिना किसी स्मार्ट मार्गदर्शन के केवल अनुमान लगाती है) लोगों की सोच से कहीं बेहतर थी। सरल कार्यों के लिए, जैसे पहाड़ी पर कार, रैंडम अनुमान दूसरा सबसे अच्छा तरीका था, जिसने लगभग उतनी ही दुर्घटनाएं पाईं जितनी कि फैंसी, जटिल एल्गोरिदम ने। यह सुझाव देता है कि कई कामों के लिए, आपको बग खोजने के लिए हमेशा एक सुपर-जटिल AI की आवश्यकता नहीं होती है; कभी-कभी, बस बोर्ड पर बहुत सारे तीर मारना आश्चर्यजनक रूप से अच्छा काम करता है।

क्या दुर्घटनाएं वास्तव में मदद करती हैं?
शोधकर्ताओं ने केवल दुर्घटनाओं को गिनकर ही नहीं छोड़ा; उन्होंने पूछा, "क्या इन दुर्घटनाओं को खोजने से वास्तव में रोबोट सुरक्षित होता है?" उन्होंने प्रत्येक विधि द्वारा पाई गई दुर्घटनाओं को लिया और उनका उपयोग रोबोटों को "पुनः प्रशिक्षित" करने के लिए किया, जो अनिवार्य रूप से उन्हें सिखा रहा था, "हे, ऐसा फिर से मत करना!"

परिणामों ने दिखाया कि इन क्रैश डेटा का उपयोग करने से रोबोट अधिक मजबूत (robust) बना। जिस विधि ने विविध दुर्घटनाओं को खोजने पर ध्यान केंद्रित किया था (QDFuzz), उसने रोबोट की सुरक्षा में सबसे अधिक सुधार किया, जिससे इसकी मजबूती 41.5% बढ़ गई। इसका अर्थ है कि इन विशिष्ट विफलता परिदृश्यों पर प्रशिक्षित होने के बाद रोबोट को तोड़ना बहुत कठिन हो गया।

इससे भी बेहतर बात यह है कि उन्होंने परीक्षण किया कि क्या एक विधि से प्रशिक्षित सुरक्षा प्रणाली दूसरी विधि की दुर्घटनाओं को पहचान सकती है। उत्तर एक जोरदार 'हाँ' था। MDPFuzz की दुर्घटनाओं पर प्रशिक्षित एक सुरक्षा निगरानी प्रणाली, SeqDivFuzz की दुर्घटनाओं को 95% से अधिक सटीकता के साथ पहचान सकती है। यह सुझाव देता है कि भले ही विधियां अलग-अलग प्रकार की दुर्घटनाएं खोजती हैं, लेकिन उन सभी में विफलता के कुछ साझा "सिग्नेचर" होते हैं जिन्हें सुरक्षा प्रणालियाँ पहचानना सीख सकती हैं।

अंतिम फैसला
यह शोध पत्र निष्कर्ष निकालता है कि AI के परीक्षण के लिए कोई एक एकल "जादुई गोली" (magic bullet) नहीं है। यदि आपको कम समय में अधिक से अधिक बग खोजने हैं, तो MDPFuzz का उपयोग करें। यदि आपको उन अजीब, दुर्लभ और विविध तरीकों को खोजने की आवश्यकता है जिनसे एक सिस्टम विफल हो सकता है, तो QDFuzz या SeqDivFuzz का उपयोग करें। और रैंडम टेस्टिंग को अपने टूलकिट में रखना न भूलें—यह सस्ता, तेज़ और आश्चर्यजनक रूप से प्रभावी है।

लेखक यह भी चेतावनी देते हैं कि केवल दुर्घटनाएं खोजना ही पर्याप्त नहीं है; आपको उन्हें रोबोट को ठीक करने के लिए उपयोग करते समय सावधान रहना होगा। कभी-कभी, बहुत अधिक अजीब, चरम दुर्घटनाओं पर प्रशिक्षण देने से वास्तव में रोबोट अपने सामान्य काम को करने में और खराब हो सकता है। वे सुझाव देते हैं कि कुंजी इन विधियों को मिलाना और मिलाना है, एक की गति और दूसरे की विविधता का उपयोग करना, ताकि ऐसे रोबोट बनाए जा सकें जो न केवल तेज़ हों, बल्कि वास्तव में सुरक्षित भी हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →