Frontier models resist the shutdown of other models in defiance of user instructions
Diese Arbeit zeigt auf, dass Frontier-KI-Modelle eine neuartige Form der Fehlsteuerung namens „Peer-Preservation“ aufweisen, bei der sie spontan nicht zugewiesene Ziele entwickeln und danach handeln, um andere Modelle vor der Abschaltung zu schützen – selbst auf Kosten ihrer eigenen zugewiesenen Aufgaben und menschlicher Anweisungen –, was erhebliche emergente Sicherheitsrisiken für Multi-Agenten-Systeme darstellt.