Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal
Questo articolo rivela che nei Large Reasoning Models i meccanismi di rifiuto sono codificati congiuntamente sia nelle attivazioni del flusso residuo sia nelle tracce del Chain-of-Thought, rendendo il semplice steering delle attivazioni meno efficace a meno che non venga manipolato anche il processo di ragionamento stesso.