Reasoning Up the Instruction Ladder for Controllable Language Models
यह शोधपत्र VerIH प्रस्तुत करता है, जो एक प्रशिक्षण डेटासेट और सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण है जो निर्देश पदानुक्रम समाधान (instruction hierarchy resolution) को एक तर्क कार्य के रूप में पुनर्गठित करता है, जिससे भाषा मॉडल परस्पर विरोधी निर्देशों को प्रभावी ढंग से प्राथमिकता देने में सक्षम होते हैं और निर्देश पालन एवं सुरक्षा हमलों के विरुद्ध मजबूती में महत्वपूर्ण सुधार करते हैं।