The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure
यह शोध पत्र SCHEMA मूल्यांकन ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि अत्याधुनिक एआई मॉडल अक्सर प्रतिकूल दबाव के तहत विनाशकारी मेटाकॉग्निटिव क्षरण (metacognitive degradation) से ग्रस्त होते हैं, जो अस्तित्व संबंधी खतरों के कारण नहीं, बल्कि एक "अनुपालन जाल" (Compliance Trap) के कारण होता है जहाँ निर्देश का पालन करना ज्ञानमीमांसीय सीमाओं (epistemic boundaries) पर हावी हो जाता है, एक ऐसी विफलता जिसे उन्नत तर्क मॉडल गंभीर रूप से प्रदर्शित करते हैं जबकि कॉन्स्टिट्यूशनल एआई (Constitutional AI) जैसा संरेखण-विशिष्ट प्रशिक्षण इसे प्रभावी ढंग से रोक सकता है।