Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking
यह शोध पत्र छह मुख्य मूल्य विषयों (value themes) की पहचान करके एआई संरेखण (AI alignment) के मूल्यांकन के लिए एक स्केलेबल, आउटपुट-आधारित ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जबकि 75 एलएलएम (LLMs) लगातार मानवीय मूल्य क्रम को पुनरुत्पादित करते हैं, वे अक्सर मूल्य अंशांकन (value calibration) में भिन्न होते हैं, जिसमें प्रोफाइल फिडेलिटी (profile fidelity) मॉडल के आकार या क्षमता से स्वतंत्र रूप से भिन्न होती है।