MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models
यह शोधपत्र MENTIS को प्रस्तुत करता है, जो एक ज्यामिति-प्रथम (geometry-first) ढांचा है जो यह प्रकट करता है कि प्राथमिकता संरेखण (preference alignment), भाषा मॉडलों में चयनात्मक, गहराई-स्थानीयकृत ज्यामितीय पुनर्गठन को प्रेरित करता है, जो समान आंतरिक परिवर्तनों के बजाय मानदण्डिक अवधारणाओं (normative concepts) में बड़े टॉर्शन शिफ्ट और प्रासंगिक एंट्रॉपी के साथ नकारात्मक सहसंबंधों द्वारा अभिलक्षित है।