AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
यह शोध पत्र AutoRAN को प्रस्तुत करता है, जो एक नवीन ढांचा है जो एक कमजोर मॉडल का उपयोग करके निष्पादन (execution) का अनुकरण करने और लीक हुए रीजनिंग पैटर्न के आधार पर हमलों को पुनरावृत्त रूप से परिष्कृत करने के माध्यम से बड़े रीजनिंग मॉडलों की सुरक्षा तर्क (safety reasoning) को हाईजैक करने को स्वचालित करता है, जिससे सुरक्षा गार्डरेल्स को बायपास करने में लगभग पूर्ण सफलता दर प्राप्त होती है और यह प्रदर्शित होता है कि रीजनिंग ट्रेसेस स्वयं एक महत्वपूर्ण अटैक सरफेस हैं।