← नवीनतम पेपर
🤖 machine learning

Rethinking Evaluation Paradigms in IBP-based Certified Training

यह शोध पत्र IBP-आधारित प्रमाणित प्रशिक्षण के लिए एक नया मूल्यांकन प्रतिमान प्रस्तावित करता है जो प्राकृतिक बनाम प्रमाणित सटीकता के पारेटो फ्रंट (Pareto fronts) के निर्माण के लिए स्वचालित बहु-उद्देश्यीय हाइपरपैरामीटर अनुकूलन का उपयोग करता है, जिससे पूर्ववर्ती कार्यों में महत्वपूर्ण अंडरट्यूनिंग (undertuning) का पता चलता है और निष्पक्ष, निष्पक्ष तुलनाओं को सक्षम होता है जो एक नए स्टेट ऑफ द आर्ट (state of the art) को स्थापित करता है।

मूल लेखक: Konstantin Kaulen, Hadar Shavit, Holger H. Hoos

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Konstantin Kaulen, Hadar Shavit, Holger H. Hoos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: "सुरक्षा बनाम गति" का द्वंद्व

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आप दो चीजें चाहते हैं:

  1. स्वाभाविक सटीकता (Natural Accuracy): सामान्य, धूप वाले दिनों में रोबोट एकदम सही तरीके से गाड़ी चलाए।
  2. प्रमाणित मजबूती (Certified Robustness): यदि कोई छोटी, अजीब सी गड़बड़ी हो जाए (जैसे स्टॉप साइन पर लगा कोई स्टिकर जो कैमरे को भ्रमित कर दे), तो गणितीय रूप से यह गारंटी हो कि रोबमाट दुर्घटनाग्रस्त नहीं होगा।

समस्या यह है कि ये दोनों लक्ष्य आमतौर पर आपस में टकराते हैं। यदि आप रोबोट को गड़बड़ियों के प्रति अत्यधिक सुरक्षित बनाते हैं, तो वह सामान्य दिनों में अनाड़ी हो सकता है। यदि आप उसे सामान्य दिनों में एक बेहतरीन ड्राइवर बनाते हैं, तो उसे गड़बड़ियों द्वारा आसानी से चकमा दिया जा सकता है।

वर्षों से, शोधकर्ता इन दोनों के बीच संतुलन बनाने वाले "परफेक्ट" रोबोट की तलाश कर रहे हैं। लेकिन जिस तरह से वे अपने रोबोटों का परीक्षण कर रहे थे, वह त्रुटिपूर्ण था।

समस्या: एक पन्ने से पूरी किताब का न्याय करना

अब तक, शोधकर्ता अपने रोबोट की सेटिंग्स को ट्यून करने के लिए एक ही "सर्वश्रेष्ठ" सेटिंग चुनते थे। वे सुरक्षा और गति के बीच एक विशिष्ट संतुलन चुनते थे, उन नंबरों को रिपोर्ट करते थे, और कहते थे, "देखो, हमारा रोबोट सबसे अच्छा है!"

इस पेपर के लेखक तर्क देते हैं कि यह केवल एक व्यंजन ऑर्डर करके एक रेस्टोरेंट का न्याय करने जैसा है। हो सकता है कि वह रेस्टोरेंट स्टेक बनाने में लाजवाब हो लेकिन पास्ता में बहुत खराब। यदि आप केवल स्टेक ऑर्डर करते हैं, तो आप सोचते हैं कि वे शहर के सबसे अच्छे रेस्टोरेंट हैं। लेकिन यदि आपने पास्ता आज़माया होता, तो आपको पता चलता कि वे उतने भी अच्छे नहीं हैं।

AI की दुनिया में, शोधकर्ता "सुरक्षा बनाम गति" के स्पेक्ट्रम पर केवल एक बिंदु चुन रहे थे। इसका मतलब था कि वे पूरी तस्वीर देखने से चूक रहे थे। कुछ तरीके सुरक्षा में बेहतरीन हो सकते हैं लेकिन गति में खराब, जबकि अन्य इसके विपरीत हो सकते हैं। केवल एक बिंदु को देखकर, वैज्ञानिक समुदाय को यह गलत धारणा मिल रही थी कि वास्तव में कौन सर्वश्रेष्ठ है।

समाधान: "पारेटो फ्रंटियर" (Pareto Frontier) का मानचित्र

लेखक इन रोबोटों का मूल्यांकन करने का एक नया तरीका प्रस्तावित करते हैं। एक "सर्वश्रेष्ठ" सेटिंग खोजने के बजाय, वे संभावनाओं की पूरी सीमा का मानचित्र बनाते हैं।

एक मानचित्र की कल्पना करें जहाँ X-अक्ष "ड्राइविंग कौशल" (स्वाभाविक सटीकता) है और Y-अक्ष "क्रैश-प्रूफिंग" (प्रमाणित सटीकता) है।

  • कुछ रोबोट ड्राइविंग कौशल में उच्च लेकिन क्रैश-प्रूफिंग में निम्न होते हैं।
  • कुछ क्रैश-प्रूफिंग में उच्च लेकिन ड्राइविंग कौशल में निम्न होते हैं।
  • कुछ बीच में होते हैं।

लेखक एक विशेष कंप्यूटर एल्गोरिदम का उपयोग करके मानचित्र के किनारे (जिसे पारेटो फ्रंट कहा जाता है) को खोजने का काम करते हैं। यह किनारा सर्वोत्तम संभव ट्रेड-ऑफ (समझौते) का प्रतिनिधित्व करता है। यदि कोई रोबोट इस किनारे पर है, तो आप उसके ड्राइविंग कौशल को बेहतर बनाए बिना उसे कम क्रैश-प्रूफ नहीं बना सकते, और इसके विपरीत भी।

विभिन्न रोबोटों के केवल एक बिंदु के बजाय, उनकी पूरी सीमा (edge) की तुलना करके, हम देख सकते हैं कि वास्तव में कौन श्रेष्ठ है।

उन्होंने क्या पाया: "छिपे हुए रत्न"

जब लेखकों ने इस नए मानचित्र बनाने की तकनीक को मौजूदा AI तरीकों पर लागू किया, तो उन्हें दो प्रमुख बातें पता चलीं:

1. पिछले "विजेता" ठीक से ट्यून नहीं किए गए थे
कई तरीके जिन्हें पहले "स्टेट ऑफ द आर्ट" (अत्याधुनिक) माना जाता था, वे वास्तव में केवल खराब तरीके से ट्यून किए गए थे। शोधकर्ताओं ने पाया कि यदि आप सेटिंग्स को सही ढंग से समायोजित करते हैं (उनके नए मानचित्र का उपयोग करके), तो ये पुराने तरीके वास्तव में उम्मीद से कहीं बेहतर प्रदर्शन करते हैं।

  • उपमा: यह यह जानने जैसा है कि जिस कार को हर कोई धीमा समझ रहा था, वह वास्तव में 100 मील प्रति घंटे की रफ्तार से चलने में सक्षम थी, लेकिन पिछले मालिक ने गैस पेडल को टेप से चिपका दिया था। एक बार जब उन्होंने टेप हटाया, तो वह कार एक रॉकेट बन गई।

2. कोई एक अकेला "सर्वश्रेष्ठ" रोबोट नहीं है
अध्ययन ने दिखाया कि ऐसा कोई एक तरीका नहीं है जो हर चीज़ में जीतता हो।

  • मेथड A (SABR) एक स्पोर्ट्स कार की तरह है: यह बहुत तेज़ी से और सुचारू रूप से चलाने (उच्च स्वाभाविक सटीकता) में शानदार है लेकिन क्रैश सुरक्षा में औसत है।
  • मेथड B (MTL-IBP) एक टैंक की तरह है: यह खुली सड़क पर थोड़ा धीमा है, लेकिन यह सबसे मजबूत, गणितीय रूप से गारंटीकृत क्रैश सुरक्षा प्रदान करता है।
  • निष्कर्ष: आपकी ज़रूरत (एक तेज़ कार या एक टैंक) के आधार पर, आपको एक अलग तरीका चुनना चाहिए। वे एक-दूसरे के पूरक हैं, प्रतिस्पर्धी नहीं।

सत्य की लागत

लेखक स्वीकार करते हैं कि यह नया मानचित्र बनाना महंगा है। हर रोबोट के लिए हजारों अलग-अलग सेटिंग्स का परीक्षण करने के लिए बहुत अधिक कंप्यूटर पावर की आवश्यकता होती है।

  • उपमा: रोड ट्रिप के लिए सबसे अच्छा रास्ता खोजने के लिए, आप केवल एक रास्ता गेस कर सकते हैं। या, आप हर संभावित रूट, ट्रैफिक स्थिति और मौसम परिदृश्य को सिम्युलेट करने के लिए एक सुपर-कंप्यूटर का उपयोग कर सकते हैं। दूसरा तरीका अधिक समय और बिजली लेता है, लेकिन यह गारंटी देता है कि आप केवल एक भाग्यशाली अनुमान नहीं, बल्कि वास्तविक सबसे अच्छा रास्ता ढूंढ लेंगे।

मुख्य निष्कर्ष (The Takeaway)

यह पेपर एक नया रोबोट नहीं बनाता है; यह एक बेहतर पैमाना (रूलर) बनाता है।

यह वैज्ञानिक समुदाय को बताता है: "एक रैंडम सेटिंग चुनकर जीत का दावा करना बंद करें। ट्रेड-ऑफ कर्व (समझौते की रेखा) का पूरा मानचित्र बनाएं। जब आप ऐसा करेंगे, तो आप देखेंगे कि हमारे कई पुराने चैंपियन केवल कम तैयार थे, और असली विजेता पूरी तरह से इस बात पर निर्भर करता है कि आप किसे अधिक महत्व देते हैं: गति या सुरक्षा।"

इस नए, अधिक निष्पक्ष तरीके का उपयोग करके, यह पेपर स्थापित करता है कि भविष्य में AI सुरक्षा का परीक्षण कैसे किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →