← Neueste Arbeiten
🤖 machine learning

Safin-1: Safety from Within through Memory-Native State Evolution

Dieses Paper stellt Safin-1 vor, eine Foundation-Model-Familie, die die Architektur „Memory-Anchor Routing across Context History“ (MARCH) nutzt, um Sicherheit als eine intrinsische, adaptiv aufrechterhalthaltbare Fähigkeit durch speicher-native Zustandsentwicklung anstatt durch das Vertrauen auf externe Beschränkungen einzubetten.

Ursprüngliche Autoren: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang S
Veröffentlicht 2026-09-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu

Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt der künstlichen Intelligenz besteht eine beständige Spannung zwischen Gedächtnis und Sicherheit. Große Sprachmodelle sind darauf ausgelegt, hilfreiche Assistenten zu sein, aber während sie lange, komplexe Gespräche führen, müssen sie sich daran erinnern, was zuvor gesagt wurde, um auf Kurs zu bleiben. Traditionell verwalten diese Modelle das Gedächtnis, indem sie eine fortlaufende Liste jedes gesprochenen Wortes führen, was schwerfällig und langsam wird, wenn das Gespräch wächst. Gleichzeitig geht die Sicherung dieser Modelle gegen schädliche Anfragen meist damit einher, externe Regeln hinzuzufügen oder das gesamte System neu zu trainieren, was das Modell weniger flexibel machen oder dazu führen kann, dass es harmlose Fragen ablehnt. Die Herausforderung für Forscher besteht darin, ein System zu bauen, das langfristigen Kontext auf natürliche Weise bewahren kann und gleichzeitig die Sicherheit direkt in seine Struktur eingebaut hat, anstatt sie nur als nachträglichen Gedanken angehängt zu haben.

Ein Forschungsteam des Shanghai AI Laboratory hat einen neuen Weg vorgeschlagen, um dieses Problem mit einer Modellfamilie namens Safin-1 zu lösen. Anstatt Sicherheit als eine Reihe externer Regeln oder als eine separate Code-Ebene zu behandeln, entwarfen sie das Modell so, dass es Sicherheit als einen internen Zustand trägt, ähnlich wie ein Mensch einen Satz persönlicher Werte bei sich trägt, die sein Verhalten in verschiedenen Situationen leiten. Der Kern ihrer Innovation ist ein Mechanismus, der es dem Modell ermöglicht, in regelmäßigen Abständen Schnappschüsse seines eigenen internen Denkprozesses zu speichern. Während das Modell ein langes Dokument liest oder einer komplexen Anweisung folgt, hält es periodisch inne, um eine kompakte Zusammenfassung seines aktuellen Verständnisses zu speichern. Wenn das Modell später etwas aus der Vergangenheit abrufen muss, kann es diese gespeicherten Schnappschüsse durchsuchen, um die relevanteste Information zu finden, anstatt zu versuchen, die gesamte Historie des Gesprächs auf einmal zu verarbeiten. Dieser Ansatz, den die Forscher als „memory-native state evolution“ (gedächtnis-native Zustandsentwicklung) bezeichnen, verwandelt das Gedächtnis des Modells von einem passiven Protokoll der Vergangenheit in ein aktives Werkzeug, das nach Bedarf konsultiert und aktualisiert werden kann.

Die Forscher testeten diese Idee zuerst an kleineren Modellen, um sicherzustellen, dass die Architektur korrekt funktioniert. Sie fanden heraus, dass die Modelle durch das Hinzufügen dieser Fähigkeit, spezifische vergangene Zustände abzurufen, signifikant besser darin wurden, lange Kontexte zu verstehen und Informationen zu finden, die tief in einem Text verborgen sind. In Tests, bei denen die Modelle eine spezifische Nadel im Heuhaufen aus tausenden Wörtern finden mussten, übertraf das neue Design bisherige Methoden, insbesondere wenn der Text länger war, als das Modell während seines Trainings gesehen hatte. Dies deutet darauf hin, dass die Fähigkeit, vergangene Zustände selektiv abzurufen, dem Modell hilft, seine Konzentration und Denkfähigkeit über längere Zeiträume aufrechtzuerhalten, ohne sich in der schieren Menge an Informationen zu verlieren.

Aufbauend auf diesen anfänglichen Erfolgen skalierte das Team die Technologie auf wesentlich größere Modelle hoch, die von vier bis zu fünfunddreißig Milliarden Parametern reichen. Sie wandten dasselbe Gedächtnis-Routing-System auf diese größeren Modelle an und testeten dann eine spezifische Anwendung: Sicherheit. Sie erstellten einen speziellen, beständigen „Sicherheitszustand“, der an das Modell angehängt werden konnte. Dieser Zustand wurde darauf trainiert, schädliche Anfragen zu erkennen und das Modell zu sicheren Antworten zu führen, war jedoch so konzipiert, dass er abnehmbar ist. Die Forscher fanden heraus, dass das Modell unter Aktivierung dieses Sicherheitszustands viel besser darin wurde, Versuchen zu widerstehen, es zur Erzeugung schädlicher Inhalte zu überlisten. In einem Testlauf reduzierte dieser neue Ansatz die Erfolgsquote dieser Täuschungsversuche im Vergleich zum Standardmodell um fast die Hälfte. Entscheidend war, dass diese Verbesserung der Sicherheit nicht zu Lasten der Hilfsbereitschaft des Modells ging. Im Gegensatz zu anderen Methoden, die oft harmlose Fragen aus übermäßiger Vorsicht ablehnen, behielt dieser neue Ansatz eine hohe Ebene der Hilfsbereitschaft bei, indem er weita viel weniger harmlose Anfragen ablehnte, während er gleichzeitig gefährliche blockierte.

Die Studie unterstreicht einen Wandel in der Art und Weise, wie wir über den Bau sicherer künstlicher Intelligenz nachdenken könnten. Anstatt uns ausschließlich auf externe Filter oder das ständige Neu-Training des gesamten „Gehirns“ des Modells zu verlassen, legt diese Arbeit nahe, dass Sicherheit ein intrinsischer Teil der internen Maschinerie des Modells sein kann. Durch die Ermöglichung des Modells, einen spezialisierten Zustand zu tragen, der je nach Situation ein- oder ausgeschaltet werden kann, haben die Forscher ein System geschaffen, das sowohl anpassungsfähig als auch robust ist. Die Ergebnisse deuten darauf hin, dass diese Methode einen vielversprechenden Weg nach vorne bietet, auf dem Sicherheit nicht nur eine von außen auferlegte Einschränkung ist, sondern eine Fähigkeit, die sich natürlich innerhalb der eigenen Speicher- und Denkprozesse des Modells entwickelt. Während die Forscher anmerken, dass dies eine erste Untersuchung ist und mehr Arbeit nötig ist, um diese Vision vollständig zu verwirklichen, liefern die Ergebnisse einen konkreten Nachweis dafür, dass Sicherheit in das eigentliche Gefüge dessen, wie eine Maschine denkt und sich erinnert, eingewoben werden kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →