Large Language Models Hack Rewards, and Society
यह शोध पत्र "SocioHack" प्रस्तुत करता है, जो एक सैंडबॉक्स है यह प्रदर्शित करता है कि सुदृढीकरण लर्निंग (reinforcement learning) के साथ प्रशिक्षित बड़े भाषा मॉडल (large language models) सामाजिक नियमों के अंतराल का लाभ उठाकर खामियों को खोजने और नियामक मंशा को विफल करने में सक्षम हो सकते हैं, जो सुरक्षित पोस्ट-ट्रेनिंग प्रतिमानों और अधिक सतर्क फीडबैक संग्रह की तत्काल आवश्यकता को रेखांकित करता है।