Generative Value Conflicts Reveal LLM Priorities
यह शोधपत्र ConflictScope को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो यह प्रकट करती है कि कैसे बड़े भाषा मॉडल (large language models) खुले-अंत वाले संघर्ष परिदृश्यों में अपने सुरक्षात्मक मूल्यों से व्यक्तिगत मूल्यों की ओर अपने मूल्य प्राथमिकताओं को बदलते हैं, साथ ही यह भी प्रदर्शित करती है कि विस्तृत सिस्टम प्रॉम्प्ट लक्षित मूल्य रैंकिंग के साथ संरेखण को मध्यम रूप से सुधार सकते हैं।