← Nieuwste papers
🤖 machine learning

Safin-1: Safety from Within through Memory-Native State Evolution

Dit artikel introduceert Safin-1, een familie van foundationmodellen die gebruikmaakt van de Memory-Anchor Routing across Context History (MARCH)-architectuur om veiligheid te verankeren als een intrinsieke, adaptief onderhoudbare capaciteit door middel van geheugen-native staatsevolutie, in plaats van te vertrouwen op externe beperkingen.

Oorspronkelijke auteurs: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang S
Gepubliceerd 2026-09-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu

Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van kunstmatige intelligentie bestaat er een aanhoudende spanning tussen geheugen en veiligheid. Grote taalmodellen zijn ontworpen om behulpzame assistenten te zijn, maar naarmate ze langdurige, complexe gesprekken voeren, moeten ze onthouden wat er eerder is gezegd om op koers te blijven. Traditioneel beheren deze modellen hun geheugen door een voortlopende lijst van elk gesproken woord bij te houden, wat zwaar en traag wordt naarmate het gesprek groeit. Tegelijkertijd houdt het veilig houden van deze modellen tegen schadelijke verzoeken meestal in dat er externe regels worden toegevoegd of het hele systeem opnieuw moet worden getraind, wat de modellen minder flexibel kan maken of kan ervoor zorgen dat ze onschuldige vragen weigeren. De uitdaging voor onderzoekers is om een systeem te bouien dat op een natuurlijke manier een langetermijncontext kan vasthouden en tegelijkertijd veiligheid in de kern van de structuur heeft ingebouwd, in plaats van dat dit slechts als een achteraf toegevoegde extra laag dient.

Een team onderzoekers aan het Shanghai AI Laboratory heeft een nieuwe manier voorgesteld om dit probleem op te lossen met een familie modellen genaamd Safin-1. In plaats van veiligheid te behandelen als een reeks externe regels of een aparte laag code, hebben zij het model zo ontworpen dat het veiligheid draagt als een interne staat, vergelijkbaar met hoe een persoon een reeks persoonlijke waarden met zich meedraagt die hun gedrag in verschillende situaties sturen. De kern van hun innovatie is een mechanisme dat het model in staat stelt om op regelmatige intervallen snapshots te maken van zijn eigen interne denkproces. Terwijl het model een lang document leest of een complexe instructie volgt, pauzeert het periodiek om een compacte samenvatting van zijn huidige begrip op te slaan. Wanneer het model later iets uit het verleden moet oproepen, kan het door deze opgeslagen snapshots zoeken om de meest relevante informatie te vinden, in plaats van te proberen de gehele geschiedenis van het gesprek in één keer te verwerken. Deze aanpak, die de onderzoekers memory-native state evolution noemen, verandert het geheugen van het model van een passief verslag van het verleden in een actief hulpmiddel dat naar behoefte geraadpleegd en bijgewerkt kan worden.

De onderzoekers testten dit idee eerst op kleinere modellen om te verzekeren dat de architectuur correct functioneerde. Ze ontdekten dat door deze mogelijkheid om specifieke eerdere staten op te roepen toe te voegen, de modellen aanzienlijk beter werden in het begrijpen van lange contexten en het vinden van informatie die diep in een tekst verborgen zit. In tests waarbij de modellen een specifieke naald in een hooiberg van duizenden woorden moesten vinden, presteerde het nieuwe ontwerp beter dan eerdere methoden, vooral wanneer de tekst langer was dan het model ooit tijdens zijn training had gezien. Dit suggereert dat het vermogen om selectief eerdere staten op te roepen de modellen helpt om hun focus en redeneervermogen over langere perioden te behouden, zonder de weg kwijt te raken in de enorme hoeveelheid informatie.

Voortbouwend op deze initiële successen, schaalde het team de technologie op naar veel grotere modellen, variërend van vier miljard tot vijfendertig miljard parameters. Ze pasten hetzelfde geheugen-routing systeem toe op deze grotere modellen en testten vervolgens een specifieke toepassing: veiligheid. Ze creëerden een speciale, persistente "veiligheidstoestand" die aan het model gekoppeld kon worden. Deze toestand werd getraind om schadelijke verzoeken te herkennen en het model naar veilige reacties te leiden, maar was ontworpen om afneembaar te zijn. De onderzoekers ontdekten dat wanneer deze veiligheidstoestand actief was, het model veel beter werd in het weerstaan van pogingen om het te misleiden tot het genereren van schadelijke inhoud. In één reeks tests verminderde de nieuwe aanpak het succespercentage van deze misleidingspogingen met bijna de helft vergeleken met het standaardmodel. Cruciaal was dat deze verbetering in veiligheid niet ten koste ging van het vermogen van het model om behulpzaam te zijn. In tegen tegenstelling tot andere methoden die modellen vaak onschuldige vragen laten weigeren uit een overvloed aan voorzichtigheid, behield deze nieuwe aanpak een hoog niveau van behulpzaamheid, waarbij veel minder onschuldige verzoeken werden geweigeren terwijl schadelijke verzoeken wel werden geblokkeerd.

De studie benadrukt een verschuiving in hoe we kunnen denken over het bouwen van veilige kunstmatige intelligentie. In plaats van uitsluitend te vertrouwen op externe filters of het hele brein van het model constant opnieuw te trainen, suggereert dit werk dat veiligheid een intrinsiek onderdeel kan zijn van de interne machinerie van het model. Door het model in staat te stellen een gespecialiseerde toestand te dragen die afhankelijk van de situatie aan- of uitgezet kan worden, hebben de onderzoekers een systeem gecreëerd dat zowel aanpasbaar als robuust is. De resultaten wijzen erop dat deze methode een veelbelovend pad biedt, waarbij veiligheid niet alleen een beperking is die van buitenaf wordt opgelegd, maar een capaciteit die natuurlijk evolueert binnen de eigen geheugen- en redeneerprocessen van het model. Hoewel de onderzoekers opmerken dat dit een initiële verkenning is en dat er meer werk nodig is om deze visie volledig te realiseren, bieden de bevindingen een concrete demonstratie dat veiligheid in het weefsel van hoe een machine denkt en onthoudt verweven kan worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →