From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement
यह शोध पत्र तर्क देता है कि वर्तमान एआई अलाइनमेंट (AI alignment) की प्राथमिकता एकत्रीकरण (preference aggregation) पर निर्भरता एक खतरनाक "चाटुकारितापूर्ण आम सहमति" (sycophantic consensus) को बढ़ावा देती है जो आवश्यक असहमति को दबा देती है, और "बहुलवादी अलाइनमेंट" (pluralistic alignment) की ओर एक बदलाव का प्रस्ताव देता है जिसे स्कोपिंग (scoping), सिग्नलिंग (signalling) और सिद्धांतपूर्ण मरम्मत (principled repair) के संवादात्मक तंत्रों द्वारा परिभाषित किया गया है, जिसे एक नए मीट्रिक के माध्यम से संचालित किया जाना चाहिए ताकि यह सुनिश्चित हो सके कि एआई सिस्टम केवल संघर्षों को सुगम बनाने के बजाय मूल्य संघर्षों (value conflict) को बनाए रख सकें।