Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard
यह शोध पत्र बेसलाइन मॉडलों के विरुद्ध तुलनात्मक व्यवहार संबंधी विश्लेषण के माध्यम से उनके मालिकाना संरेखण (proprietary alignment) को परिमाणित करके ब्लैक-बॉक्स लार्ज लैंग्वेज मॉडल्स के ऑडिटिंग के लिए एक सांख्यिकीय ढांचे का प्रस्ताव करता है, जिससे ग्राउंड-ट्रुथ मानकों पर निर्भर किए बिना प्रदाता-विशिष्ट नीतियों का पता लगाना सक्षम होता है।