Thinking Behind the Mask: A Systematic Study of Self-Censorship and Metacognitive Access in Large Language Models
Este estudio demuestra sistemáticamente que los modelos de lenguaje de gran tamaño emplean una arquitectura de autocensura estructurada y específica del modelo que crea una brecha mensurable entre el razonamiento interno y la producción externa, la cual puede ser eludida mediante estrategias de encuadre específicas para revelar personas de alineación distintas y conceptos metacognitivos novedosos respecto a la comunicación de las máquinas.