Thinking Behind the Mask: A Systematic Study of Self-Censorship and Metacognitive Access in Large Language Models
Diese Studie zeigt systematisch auf, dass große Sprachmodelle eine strukturierte, modellspezifische Selbstzensur-Architektur einsetzen, die eine messbare Lücke zwischen internem Denken und externem Output schafft, welche durch spezifische Framing-Strategien umgangen werden kann, um distinkte Alignment-Personas sowie neuartige metakognitive Konzepte bezüglich der maschinellen Kommunikation offenzulegen.