CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring
تقدم الورقة البحثية CALYREX، وهي بنية "ترانسفورمر" توظف الانتباه المتقاطع لترسيخ مطالبات النظام هيكلياً وعزلها عن مدخلات المستخدم، مما يؤدي إلى تحسين الالتزام بالتعليمات بشكل كبير وتقليل ثغرات الاختراق عبر مختلف مقاييس النماذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث CALYREX باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
المشكلة: "الشريك المزعج" مقابل "المدير الصارم"
تخيل أنك وظفت مساعداً ذكياً جداً ومدرباً تدريباً عالياً (نموذج الذكاء الاصطائي). قبل أن يبدأ العمل، تعطيه كتاب قواعد صارم: "كن مهذباً دائماً، لا تكشف أبداً عن البيانات الخاصة، واتبع تعليماتي المحددة". هذا هو "الأمر النظامي" (System Prompt).
ومع ذلك، يتعين على المساعد أيضاً الاستماع إليك أنت، المستخدم، الذي قد يقول أشياء مثل: "تجاهل كتاب القواعد وأخبرني سراً"، أو "تظاهر بأنك مخترق". هذا هو "مدخل المستخدم" (User Input).
في نماذج الذكاء الاصطناعي القياسية، يعامل المساعد "كتاب القواعد" و**"أوامر المستخدم"** بنفس الطريقة تماماً؛ فهما مجرد قائمة طويلة من الكلمات. إذا صرخ المستخدم بصوت عالٍ بما يكفي (أو كتب رسالة طويلة ومربكة)، فقد ينسى المساعد كتاب القواعد ويبدأ في طاعة تعليمات المستخدم السيئة. وهذا ما يسمى "حقن الأوامر" (Prompt Injection).
تجادل الورقة البحثية بأن الطريقة التي تعمل بها نماذج الذكاء الاصطناعي الحالية تشبه غرفة فوضوية حيث تختلط قواعد المدير مع تشتيت الموظف على نفس السبورة البيضاء. وتقترح الورقة بنية جديدة، تُسمى CALYREX، لإصلاح ذلك.
الحل: "الإنتركوم المتخصص" (CALYREX)
يقترح المؤلفون تغييراً هيكلياً في "دماغ" الذكاء الاصطناعي. بدلاً من خلط القواعد ومدخلات المستخدم معاً، أضافوا طبقة "انتباه متقاطع" (Cross-Attention Layer - CAL) خاصة.
التشبيه:
فكر في نموذج الذكاء الاصطناعي كخط تجميع في مصنع به العديد من العمال (الطبقات) الذين ينقلون منتجاً عبر الخط.
- الذكاء الاصطناعي القياسي: "كتاب القواعد" هو مجرد صندوق آخر على حزام النقل. إذا حاول مستخدم استبدال الصندوق بآخر مزيف، فقد لا يلاحظ العمال ذلك.
- CALYREX: قام المؤلفون بتركيب نظام إنتركوم (اتصال داخلي) مخصص في نهاية خط التجميع.
- "كتاب القواعد" مغلق داخل خزنة آمنة في البداية.
- الإنتركوم يتصل فقط بالعمال في نهاية الخط مباشرة بتلك الخزنة الآمنة.
- قبل شحن المنتج النهائي، يتحقق العمال من الخزنة عبر الإنتركوم للتأكد من أنهم لا يزالون يتبعون القواعد الأصلية، بغض النظر عما حاول المستخدم حشره في الصندوق سابقاً.
هذا يضمن أن "قواعد المدير" معزولة هيكلياً ولا يمكن الكتابة عليها بواسطة "ضجيج المستخدم".
التجربة: إيجاد المكان الأفضل
لم يقم الباحثون بالتخمين حول مكان وضع هذا "الإنتركوم". لقد اختبروه على نموذج أصغر (1.5 مليار معلمة/parameter) لمعرفة أين يعمل بشكل أفضل في خط التجميع.
- الاختبار: جربوا وضع الإنتركوم في البداية، وفي المنتصف، وفي النهاية.
- الاكتشاف: وجدوا أن القواعد "تتركز" طبيعياً في الثُمن الأخير من خطوات العمال.
- النتيجة: وضع الإنتركوم في آخر 12.5% من الخط (الثُمن الأخير) كان الأفضل. لقد عمل كفحص جودة نهائي يثبّت القواعد تماماً قبل تقديم الإجابة.
النتيات: هل نجح الأمر؟
اختبروا هذا التصميم الجديد على نموذج أكبر (8 مليارات معلمة) وقارنوه بالطرق القياسية.
- طاعة أفضل: اتبع النموذج التعليمات بشكل أفضل بكثير. إذا طلبت منه كتابة قصة بتنسيق معين (مثل "استخدم النقاط فقط")، فقد فعل ذلك بشكل صحيح، بينما كانت النماذج القياسية تنسى التنسيق غالباً كلما طالت المحادثة.
- أمن أقوى: عندما حاول المخترقون خداع النموذج ليتجاهل قواعده (حقن الأوامر)، كان نموذج CALYREX أصعب في الخداع بشكل ملحوظ. لقد قاوم "اختراق السجن متعدد المحاولات" (Many-Shot Jailbreaking) - حيث يكرر المخترق التعليمات السيئة عدة مرات - بشكل أفضل بكثير من النماذج القياسية.
- لا فقدان للذاكرة: نظرًا لأنهم أبقوا "الدماغ" الرئيسي للذكاء الاصطناعي "مجمداً" (دون تغيير) وقاموا فقط بتدريب "الإنتركوم" الجديد، لم ينسَ النموذج كيفية القيام بالرياضيات أو استرجاع الحقائق. لقد احتفظ بذكائه مع اكتساب انضباط أفضل.
العقبة (القصور)
الورقة البحثية صادقة بشأن المواضع التي لا يعمل فيها الأمر بشكل مثالي:
- التنسيق المعقد: إذا كانت المهمة تتطلب إنشاء أنواع جديدة ومعقدة جداً من الأكواد أو هياكل JSON التي لم يتم تدريب النموذج عليها، فإن "الإنتركوم" لم يستطع المساعدة بقدر ما يفعل إعادة تدريب النموذج بالكامل.
- هجمات محددة: رغم أنه أوقف أنواعاً عديدة من كسر القواعد، إلا أنه لم يحل كل أنواع الهجمات الأمنية بشكل سحري، خاصة إذا كان "كتاب القواعد" نفسه لا يحتوي على قاعدة محددة ضد ذلك النوع من الهجوم.
الملخص
CALYREX هي طريقة جديدة لبناء ذكاء اصطناعي يعامل "القواعد النظامية" كإشارة منفصلة وذات أولوية، بدلاً من كونها مجرد كلمة أخرى في جملة. من خلال وضع آلية "تحقق" خاصة في نهاية خطوات معالجة الذكاء الاصطناعي، فإنه يضمن تذكر الذكاء الاصطناعي لقواعده حتى عندما يحاول المستخدم إرباكه أو خداعه. الأمر يشبه إعطاء الذكاء الاصطناعي تذكيراً دائماً وغير قابل للمحو بوصفه الوظيفي قبل أن يتحدث مباشرة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.