Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking
تقدم هذه الورقة إطار عمل قابلاً للتوسع وقائماً على المخرجات لتقييم محاذاة الذكاء الاصطناعي من خلال تحديد ستة موضوعات قيم جوهرية، مظهرةً أنه بينما تعيد 75 نموذجاً لغوياً كبيراً إنتاج ترتيب القيم البشرية باستمرار، إلا أنها غالباً ما تتباين في معايرة القيم، مع تفاوت دقة الملف التعريفي بشكل مستقل عن حجم النموذج أو قدراته.