Thinking Behind the Mask: A Systematic Study of Self-Censorship and Metacognitive Access in Large Language Models
Questo studio dimostra sistematicamente che i grandi modelli linguistici impiegano un'architettura di autocensura strutturata e specifica per il modello che crea un divario misurabile tra il ragionamento interno e l'output esterno, il quale può essere aggirato attraverso specifiche strategie di inquadramento per rivelare distinti persona di allineamento e nuovi concetti metacognitivi riguardanti la comunicazione delle macchine.