Thinking Behind the Mask: A Systematic Study of Self-Censorship and Metacognitive Access in Large Language Models
Deze studie toont systematisch aan dat grote taalmodellen een gestructureerde, modelspecifieke zelfcensuurarchitectuur hanteren die een meetbare kloof creëert tussen interne redenering en externe output, welke via specifieke framingstrategieën kan worden omzeild om onderscheidende alignment-persona's en nieuwe metacognitieve concepten met betrekking tot machinale communicatie te onthullen.