Reasoning Structure Matters for Safety Alignment of Reasoning Models
यह शोध पत्र AltTrain का प्रस्ताव करता है, जो एक सरल पोस्ट-ट्रेनिंग विधि है जो हल्के सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से उनके रीजनिंग स्ट्रक्चर (तर्क संरचना) को स्पष्ट रूप से बदलकर बड़े रीजनिंग मॉडल्स में सुदृढ़ सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) प्राप्त करती है, जिससे जटिल सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) की आवश्यकता समाप्त हो जाती है।