← أحدث الأبحاث
🤖 machine learning

Safin-1: Safety from Within through Memory-Native State Evolution

تقدم هذه الورقة البحثية عائلة النماذج التأسيسية Safin-1، التي تستخدم بنية "التوجيه عبر مرساة الذاكرة عبر تاريخ السياق" (MARCH) لدمج السلامة كقدرة جوهرية وقابلة للتكيف من خلال تطور الحالة المتأصل في الذاكرة بدلاً من الاعتماد على القيود الخارجية.

المؤلفون الأصليون: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang S
نُشر 2026-09-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Zhekai Chen, Cheng Jin, Jingnan Zheng, Yi Zhang, Zhongtian Ma, Jiawei Zhou, Sirui Chen, Qiaosheng Zhang, Xiang Wang, Ning Ding, Xia Hu, Bowen Zhou, Youbang Sun, Chaochao Lu

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطنا-عي، هناك توتر مستمر بين الذاكرة والسلامة. فقد صُممت النماذج اللغوية الكبيرة لتكون مساعدين نافعين، ولكن مع انخراطها في محادثات طويلة ومعقدة، يجب عليها أن تتذكر ما قيل سابقاً لتبقى على المسار الصحيح. تقليدياً، تتعامل هذه النماذج مع الذاكرة عبر الاحتفاظ بقائمة جارية لكل كلمة تُنطق، وهو ما يصبح ثقيلاً وبطيئاً مع نمو المحادثة. وفي الوقت نفسه، فإن الحفاظ على سلامة هذه النماذج من الطلبات الضارة يتطلب عادةً إضافة قواعد خارجية أو إعادة تدريب النظام بأكمله، مما قد يجعل النموذج أقل مرونة أو يتسبب في رفضه لأسئلة غير ضارة. ويكمن التحدي الذي يواجه الباحثين في بناء نظام يمكنه التمسك بالسياق طويل الأمد بشكل طبيعي، مع وجود السلامة مدمجة في بنيته الأساسية، بدلاً من مجرد إضافتها كفكرة لاحقة.

اقترح فريق من الباحثين في مختبر شنغهاي للذكاء الاصطناعي طريقة جديدة لحل هذه المشكلة من خلال عائلة من النماذج تسمى Safin-1. فبدلاً من معاملة السلامة كمجموعة من القواعد الخارجية أو طبقة منفصلة من الكود، قاموا بتصميم النموذج ليحمل السلامة كحالة داخلية، تماماً كما يحمل الشخص مجموعة من القيم الشخصية التي توجه سلوكه في مواقف مختلفة. ويتمثل جوهر ابتكارهم في آلية تسمح للنموذج بأخذ لقطات (snapshots) لعملية تفكيره الداخلية بانتظام. فبينما يقرأ النموذج وثيقة طويلة أو يتبع تعليمات معقدة، فإنه يتوقف دورياً لحفظ ملخص مكثف لفهمه الحالي. ولاحقاً، عندما يحتاج النموذج إلى استرجاع شيء من الماضي، يمكنه البحث عبر هذه اللقطات المحفوظة للعثيد المعلومات الأكثر صلة، بدلاً من محاولة معالجة التاريخ الكامل للمحادثة دفعة واحدة. هذا النهج، الذي يسميه الباحثون "تطور الحالة المتأصل في الذاكرة" (memory-native state evolution)، يحول ذاكرة النموذج من سجل سلبي للماضي إلى أداة نشطة يمكن استشارتها وتحديثها حسب الحاجة.

اختبر الباحثون هذه الفكرة أولاً على نماذج أصغر لضمان عمل البنية بشكل صحيح. ووجدوا أنه من خلال إضافة هذه القدرة على استرجاع حالات ماضية محددة، أصبحت النماذج أفضل بكثير في فهم السياقات الطويلة والعثور على المعلومات المخفية في أعماق النص. وفي الاختبارات التي كان على النماذج فيها العثور على "إبرة في كومة قش" مكونة من آلاف الكلمات، تفوق التصميم الجديد على الأساليب السابقة، خاصة عندما كان النص أطول مما رآه النموذج خلال فترة تدريبه. وهذا يشير إلى أن القدرة على استدعاء حالات ماضية بشكل انتقائي تساعد النموذج على الحفاظ على تركيزه وقدرته على الاستنتاج عبر فترات ممتدة، دون أن يضيع في حجم المعلومات الهائل.

وبناءً على هذه النجاحات الأولية، قام الفريق برفع نطاق هذه التكنولوجيا إلى نماذج أكبر بكثير، تتراوح من أربعة مليارات إلى خمسة وثلاثين مليار معلمة (parameter). وطبقوا نفس نظام توجيه الذاكرة على هذه النماذج الأكبر، ثم اختبروا تطبيقاً محدداً: السلامة. فقد أنشأوا "حالة سلامة" خاصة ومستمرة يمكن إلحاقها بالنموذج. تم تدريب هذه الحالة على التعرف على الطلبات الضارة وتوجيه النموذج نحو استجابات آمنة، لكنها صُممت لتكون قابلة للفصل. ووجد الباحثون أنه عندما كانت حالة السلامة هذه نشطة، أصبح النموذج أفضل بكثير في مقاومة محاولات خداعه لتوليد محتوى ضار. وفي مجموعة من الاختبارات، قلل النهج الجديد من معدل نجاح محاولات الخداع هذه بنسبة تقارب النصف مقارنة بالنموذج القياسي. والأهم من ذلك، أن هذا التحسن في السلامة لم يأتِ على حساب قدرة النموذج على أن يكون نافعاً؛ فخلافاً للطرق الأخرى التي غالباً ما تتسبب في رفض النماذج لأسئلة مشروعة بسبب الإفراط في الحذر، حافظ هذا النهج الجديد على مستوى عالٍ من النفع، حيث رفض طلبات غير ضارة بنسبة أقل بكثير بينما ظل يحظر الطلبات الخطيرة.

تسلط الدراسة الضوء على تحول في كيفية تفكيرنا في بناء ذكاء اصطناعي آمن. فبدلاً من الاعتماد فقط على الفلاتر الخارجية أو إعادة تدريب "دماغ" النموذج بالكامل باستمرار، يشير هذا العمل إلى أن السلامة يمكن أن تكون جزءاً أصيلاً من الآلية الداخلية للنموذج. ومن خلال السماح للنموذج بحمل حالة متخصصة يمكن تشغيلها وإطفاؤها حسب الموقف، نجح الباحثون في إنشاء نظام يتسم بالقدرة على التكيف والمتانة في آن واحد. وتشير النتائج إلى أن هذا الأسلوب يقدم مساراً واعداً، حيث لا تكون السلامة مجرد قيد مفروض من الخارج، بل هي قدرة تتطور بشكل طبيعي ضمن عمليات الذاكرة والاستنتاج الخاصة بالنموذج نفسه. وبينما يشير الباحثون إلى أن هذا هو استكشاف أولي وأن هناك حاجة لمزيد من العمل لتحقيق هذه الرؤية بالكامل، فإن النتائج تقدم دليلاً ملموساً على أن السلامة يمكن نسجها في صلب كيفية تفكير الآلة وتذكرها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →