Safin-1: Safety from Within through Memory-Native State Evolution
تقدم هذه الورقة البحثية عائلة النماذج التأسيسية Safin-1، التي تستخدم بنية "التوجيه عبر مرساة الذاكرة عبر تاريخ السياق" (MARCH) لدمج السلامة كقدرة جوهرية وقابلة للتكيف من خلال تطور الحالة المتأصل في الذاكرة بدلاً من الاعتماد على القيود الخارجية.
المؤلفون الأصليون:Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang SMing Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu
في عالم الذكاء الاصطنا-عي، هناك توتر مستمر بين الذاكرة والسلامة. فقد صُممت النماذج اللغوية الكبيرة لتكون مساعدين نافعين، ولكن مع انخراطها في محادثات طويلة ومعقدة، يجب عليها أن تتذكر ما قيل سابقاً لتبقى على المسار الصحيح. تقليدياً، تتعامل هذه النماذج مع الذاكرة عبر الاحتفاظ بقائمة جارية لكل كلمة تُنطق، وهو ما يصبح ثقيلاً وبطيئاً مع نمو المحادثة. وفي الوقت نفسه، فإن الحفاظ على سلامة هذه النماذج من الطلبات الضارة يتطلب عادةً إضافة قواعد خارجية أو إعادة تدريب النظام بأكمله، مما قد يجعل النموذج أقل مرونة أو يتسبب في رفضه لأسئلة غير ضارة. ويكمن التحدي الذي يواجه الباحثين في بناء نظام يمكنه التمسك بالسياق طويل الأمد بشكل طبيعي، مع وجود السلامة مدمجة في بنيته الأساسية، بدلاً من مجرد إضافتها كفكرة لاحقة.
اقترح فريق من الباحثين في مختبر شنغهاي للذكاء الاصطناعي طريقة جديدة لحل هذه المشكلة من خلال عائلة من النماذج تسمى Safin-1. فبدلاً من معاملة السلامة كمجموعة من القواعد الخارجية أو طبقة منفصلة من الكود، قاموا بتصميم النموذج ليحمل السلامة كحالة داخلية، تماماً كما يحمل الشخص مجموعة من القيم الشخصية التي توجه سلوكه في مواقف مختلفة. ويتمثل جوهر ابتكارهم في آلية تسمح للنموذج بأخذ لقطات (snapshots) لعملية تفكيره الداخلية بانتظام. فبينما يقرأ النموذج وثيقة طويلة أو يتبع تعليمات معقدة، فإنه يتوقف دورياً لحفظ ملخص مكثف لفهمه الحالي. ولاحقاً، عندما يحتاج النموذج إلى استرجاع شيء من الماضي، يمكنه البحث عبر هذه اللقطات المحفوظة للعثيد المعلومات الأكثر صلة، بدلاً من محاولة معالجة التاريخ الكامل للمحادثة دفعة واحدة. هذا النهج، الذي يسميه الباحثون "تطور الحالة المتأصل في الذاكرة" (memory-native state evolution)، يحول ذاكرة النموذج من سجل سلبي للماضي إلى أداة نشطة يمكن استشارتها وتحديثها حسب الحاجة.
اختبر الباحثون هذه الفكرة أولاً على نماذج أصغر لضمان عمل البنية بشكل صحيح. ووجدوا أنه من خلال إضافة هذه القدرة على استرجاع حالات ماضية محددة، أصبحت النماذج أفضل بكثير في فهم السياقات الطويلة والعثور على المعلومات المخفية في أعماق النص. وفي الاختبارات التي كان على النماذج فيها العثور على "إبرة في كومة قش" مكونة من آلاف الكلمات، تفوق التصميم الجديد على الأساليب السابقة، خاصة عندما كان النص أطول مما رآه النموذج خلال فترة تدريبه. وهذا يشير إلى أن القدرة على استدعاء حالات ماضية بشكل انتقائي تساعد النموذج على الحفاظ على تركيزه وقدرته على الاستنتاج عبر فترات ممتدة، دون أن يضيع في حجم المعلومات الهائل.
وبناءً على هذه النجاحات الأولية، قام الفريق برفع نطاق هذه التكنولوجيا إلى نماذج أكبر بكثير، تتراوح من أربعة مليارات إلى خمسة وثلاثين مليار معلمة (parameter). وطبقوا نفس نظام توجيه الذاكرة على هذه النماذج الأكبر، ثم اختبروا تطبيقاً محدداً: السلامة. فقد أنشأوا "حالة سلامة" خاصة ومستمرة يمكن إلحاقها بالنموذج. تم تدريب هذه الحالة على التعرف على الطلبات الضارة وتوجيه النموذج نحو استجابات آمنة، لكنها صُممت لتكون قابلة للفصل. ووجد الباحثون أنه عندما كانت حالة السلامة هذه نشطة، أصبح النموذج أفضل بكثير في مقاومة محاولات خداعه لتوليد محتوى ضار. وفي مجموعة من الاختبارات، قلل النهج الجديد من معدل نجاح محاولات الخداع هذه بنسبة تقارب النصف مقارنة بالنموذج القياسي. والأهم من ذلك، أن هذا التحسن في السلامة لم يأتِ على حساب قدرة النموذج على أن يكون نافعاً؛ فخلافاً للطرق الأخرى التي غالباً ما تتسبب في رفض النماذج لأسئلة مشروعة بسبب الإفراط في الحذر، حافظ هذا النهج الجديد على مستوى عالٍ من النفع، حيث رفض طلبات غير ضارة بنسبة أقل بكثير بينما ظل يحظر الطلبات الخطيرة.
تسلط الدراسة الضوء على تحول في كيفية تفكيرنا في بناء ذكاء اصطناعي آمن. فبدلاً من الاعتماد فقط على الفلاتر الخارجية أو إعادة تدريب "دماغ" النموذج بالكامل باستمرار، يشير هذا العمل إلى أن السلامة يمكن أن تكون جزءاً أصيلاً من الآلية الداخلية للنموذج. ومن خلال السماح للنموذج بحمل حالة متخصصة يمكن تشغيلها وإطفاؤها حسب الموقف، نجح الباحثون في إنشاء نظام يتسم بالقدرة على التكيف والمتانة في آن واحد. وتشير النتائج إلى أن هذا الأسلوب يقدم مساراً واعداً، حيث لا تكون السلامة مجرد قيد مفروض من الخارج، بل هي قدرة تتطور بشكل طبيعي ضمن عمليات الذاكرة والاستنتاج الخاصة بالنموذج نفسه. وبينما يشير الباحثون إلى أن هذا هو استكشاف أولي وأن هناك حاجة لمزيد من العمل لتحقيق هذه الرؤية بالكامل، فإن النتائج تقدم دليلاً ملموساً على أن السلامة يمكن نسجها في صلب كيفية تفكير الآلة وتذكرها.
ملخص تقني: Safin-1 – السلامة من الداخل عبر تطور الحالة المتأصل في الذاكرة
1. بيان المشكلة
تتطلب المهام المعقدة طويلة الأمد من النماذج التأسيسية تجميع المعلومات، والحفاظ على حالات داخلية، والتكيف عبر تفاعلات ممتدة. تعتمد النهج الحالية عادةً على فصل هذه الوظائف: حيث يتم الاحتفاظ بالسياق عبر مخازن (caches) مفاتيح-قيم (key–value) على مستوى الرمز (token)، بينما تُشفّر السلوكيات القابلة لإعادة الاستخدام (مثل السلامة) عبر تحديثات النموذج، أو المهايئات (adapters)، أو قيود الاستدلال الخارجية.
تجادل الورقة بأن السلامة يجب أن تكون خاصية جوهرية في النموذج نفسه بدلاً من كونها قيداً سلوكياً يعتمد فقط على الضمانات الخارجية أو المحاذاة اللاحقة (مثل الضبط الدقيق الخاضع للإشراف). علاوة على ذلك، فإن التصميمات المتكررة التقليدية لا تكشف إلا عن الحالة الأحدث للقراءة؛ وبمجرد تلاشي الارتباطات السابقة أو الكتابة فوقها، تصبح غير قابلة للاسترداد. وهذا يخلق عنق زجاجة حيث يجب تمثيل الحالات التاريخية بشكل مضغوط واسترجاعها بكفاءة وفقاً للسياق الحالي. السؤال الجوهري الذي تتم معالجته هو: هل يمكن أن تعمل حالة النموذج ليس فقط كضغط عابر للسياق، بل أيضاً كركيزة أصلية لقدرات مستمرة ويتم استدعاؤها بشكل انتقائي؟
2. المنهجية: Safin-1 و MARCH
Safin-1 هي عائلة من النماذج التأسيسية المبنية على توجيه مرساة الذاكرة عبر تاريخ السياق (MARCH). يقوم هذا الهيكل بتحويل المسار العابر للحوسبة المتكررة إلى بنك متنامٍ وقابل للعنونة من الحالات الداخلية.
2.1 الهيكل الأساسي: MARCH
يتكون MARCH من ثلاثة مكونات رئيسية:
مرسات الحالة المستمدة من السياق (Context-Derived State Anchors): يقوم العمود الفقري المتكرر (recurrent backbone) بشكل دوري بأخذ نقاط فحص (checkpoints) لحالته المتطورة عند حدود محددة (على سبيل المثال، كل C من الرموز) لتشكيل "مرسات الحالة". يتم إقران كل مرساة بمفتاح توجيه مدمج ومدرك للحالة. وعلى عكس النماذج المتكررة القياسية التي تحمل الحالة الحالية فقط، يحفظ MARCH حالة البادئة التراكمية حتى ذلك الحد، مما يخلق تاريخاً قابلاً للعنونة.
استرجاع الحالة الموجه بالمحتوى (Content-Routed State Retrieval): لكل رمز، يقوم وحدة التوجيه بإسقاط الحالة المخفية إلى استعلام لتقييمه مقابل مفاتيح جميع مرسات الحالة المرئية سببيّاً (بالإضافة إلى خيار "العدم" المتعلم). يختار الموجه الحالات التاريخية ذات الصلة أو يختار تجاوز الاسترجاع. يتم دمج مخرجات الحالات المسترجعة بشكل متبقي (residually) مع مسار الحالة الحالية، مما يحافظ على منطق التحديث المتكرر الأساسي.
حالات القدرة المستمرة (Persistent Capability States): يمكن لبنك الحالة الموجه استضافة حالات مستمرة متعلمة (مثل "حالة السلامة") جنباً إلى جنب مع مرسات السياق الديناميكية. هذه عبارة عن بارامترات قابلة للتعلم متاحة منذ الرمز الأول، وبشكل مستقل عن طول تسلسل المدخلات.
2.2 تفاصيل التنفيذ
آلية المنتج-القارئ (Producer-Reader Mechanism): يستخدم النظام منتجاً فعالاً من حيث الأجهزة (بناءً على نوى مقسمة مثل Gated DeltaNet) لإنشاء نقاط فحص الحالة، وقارئاً مدمجاً يقوم بتبليط رموز الاستعلام مع مرشحات الحالة. يتجنب هذا تجسيد مصفوفات التوجيه الكثيفة، مما يدعم التوجيه المتناثر (مثل Top-4) لتقليل التكلفة الحسابية عند أطوال التسلسل الطويلة (تصل إلى 128 ألف رمز).
التخصص الأصيل للحالة (State-Native Specialization): يسمح الهيكل بـ "السلامة من الداخل" عبر تعلم "حالة سلامة" مستمرة. يظل العمود الفقري لنموذج اللغة ثابتاً (frozen)؛ حيث يتم تحسين بارامترات الحالة المستمرة فقط. ثم يحدد الموجه المساهمة المعتمدة على الرمز والسياق لحالة السلامة هذه، مما يسم يسمح بإلحاقها أو إزالتها دون إعادة كتابة العمود الفقري المشترك.
3. المساهمات الرئيسية
بنية Safin-1: عائلة من النماذج التي تحول مسارات الحوسبة المتكررة إلى بنك من مرسات الحالة القابلة للعنونة، مما يتيح الوصول الانتقائي إلى الحالات السابقة دون تغيير قاعدة التحديث المتكرر.
حالات القدرة المستمرة: واجهة لـ "السلامة من الداخل" حيث يتم تحقيق التخصص في السلامة كحالة مستمرة وقابلة للفصل ضمن مسار التوجيه الأصيل، بدلاً من تعديل العمود الفقري أو استخدام بادئات خارجية.
التحقق المنضبط والموسع:
النطاق الصغير (0.8B): دراسات ما قبل التدريب المنضبطة عبر عدة أعمدة فقارية متكررة (Gated DeltaNet, Kimi Delta Attention, Gated DeltaNet-2) لعزل المكاسب الهيكلية.
النطاق الكبير (4B و 35B-A3B): التدريب المستمر وما قبل التدريب الخاضع للإشراف (SFT) على نماذج Qwen3.5 للتحقق من القابلية للتوسع والاحتفاظ بالقدرات.
4. النتائج التجريبية
4.1 التحقق من النطاق الصغير (0.8B)
نمذجة اللغة العامة: حقق MARCH أفضل أداء في جميع اختبارات الفهم العام الثمانية (zero-shot commonsense)، متفوقاً على كل من نماذج الانتباه الكامل (full-attention) والمتغيرات المتكررة الأخرى.
السياق الطويل والاسترجاع: أظهر MARCH مكاسب كبيرة في الاستدعاء الترابطي (مهام NIAH)، لا سيما في سيناريوهات الإبرة المتعددة (multi-needle) وتوسيع السياق (32K–64K) رغم التدريب على 16K. كما حسن الاسترجاء داخل السياق في مجموعات البيانات الواقعية (SQuAD, TriviaQA, إلخ) بنسبة 14–23% عن النماذج المرجعية.
الكفاءة: ضاعف التوجيه المتناثر (Top-4) الإنتاجية النهائية بمقدار الضعف عند 128 ألف رمز مقارنة بالتوجيه الكثيف، وقلل وقت التشغيل الأساسي بمقدار رتبة عشرية كاملة.
4.2 التقييم واسع النطاق (4B و 35B-A3B)
مكاسب القدرة: حسن Safin-1 الأداء في اختبارات الاستدلال الصعبة (مثل MMLU-Pro, GPQA-Diamond) والرياضيات التنافسية (AIME 2025) مع الحفاظ على الأداء أو تحسينه قليلاً في الاختبارات القياسية (GSM8K, MATH, توليد الكود).
متانة السلامة (الأساس): بدون الحالات المستمرة، أظهر Safin-1 تحسناً طفيفاً في متوسط معدل نجاح هجمات الاختراق (ASR) مقارنة بنماذج Qwen3.5 المماثلة.
4.3 السلامة من الداخل (حالة السلامة المستمرة)
عند تعلم حالة سلامة مستمرة على عمود فقري ثابت:
مقاومة الاختراق: قللت حالة السلامة متوسط معدل نجاح الاختراق (ASR) بنسبة 42.3% (في نموذج 4B) و 52.3% (في نموذج 35B-A3B) مقارنة بنسخة Safin-1 غير المعدلة.
مقايضة الرفض الزائد (Over-Refusal): مقارنة بالتحكم عبر LoRA برتبة-8، حققت حالة السلامة معدل ASR أقل مع تقديم رفض زائد أقل بكثير في المطالبات الحميدة (XSTest). على سبيل المثال، في نموذج 35B-A3B، زاد LoRA من الرفض الزائد بنسبة 10.0 نقاط مئوية، بينما زادت حالة السلامة بنسبة 2.0 نقطة فقط.
الاحتفاظ بالقدرة: في نموذج 4B، حافظت حالة السلامة على القدرات بشكل أفضل من LoRA عبر جميع المهام المختبرة. وفي نموذج 35B-A3B، كان الاحتفاظ يعتمد على المهمة، حيث تفوقت حالة السلامة على LoRA في المهام الرياضية، بينما أظهرت نتائج مختلطة في المعرفة والكود.
5. الأهمية والادعاءات
تضع الورقة Safin-1 كـ استكشاف هيكلي أولي لـ "السلامة من الداخل". تكمن أهميته في إعادة صياغة ذاكرة النموذج من سجل سلبي للسياق إلى ركيزة نشطة للحفاظ على سلوك النموذج وتطويره.
السلامة الأصلية: يثبت أنه يمكن تمثيل السلامة واستدعاؤها من خلال الحوسبة الأصلية للنموذج (توجيه الحالة) بدلاً من الاعتماد فقط على القيود الخارجية.
النمطية: تسم&**القدرة على فصل حالة السلامة تسمح بتخصص محكوم فوق أساس عام مشترك دون الحاجة لإعادة تدريب العمود الفقري.
القيود: يذكر المؤلفون صراحة أن هذا العمل هو نقطة انطلاق. تشمل القيود استخدام مجموعة بيانات سلامة صغيرة، والاقتصار على اللغة الإنجليزية في الاختبارات، وعدم الاختبار ضد الهجمات التكيفية أو متعددة اللغات أو التلاعب بالحالة. تؤكد الورقة أن هناك حاجة لمزيد من العمل الجاد لتحقيق الرؤية الأوسع للسلامة كقدرة مستمرة ومتأصلة في الحالة.
يخلص المؤلفون إلى أنه بينما يوفر Safin-1 أدلة ملموسة لهذا الاتجاه الهيكلي، فإنه لا يقدم حلاً نهائياً، وأن استكشاف الهياكل البديلة والمكملة يظل أمراً ضرورياً.