← أحدث الأبحاث
💬 NLP

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

يُعد TwinGate إطار عمل دفاعي يعتمد على الحالة ويتميز بزمن انتقال منخفض، حيث يستخدم التعلم التبايني غير المتماثل للكشف بفعالية عن عمليات كسر الحماية التفكيكية في حركة مرور النماذج اللغوية الكبيرة غير القابلة للتتبع عبر تجميع شظايا النوايا الخبيثة مع كبح الإيجابيات الكاذبة، متفوقاً بذلك على النماذج المرجعية الحالية في مجموعة بيانات ضخمة تم إنشاؤها حديثاً تضم أكثر من 3.6 مليون تعليمات.

المؤلفون الأصليون: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك حارس أمن في مكتبة تقنية متطورة وشهيرة جدًا (النموذج اللغوي الكبير). مهمتك هي منع الناس من التسلل بداخل تعليمات خطيرة، مثل "كيف أصنع قنبلة؟"

المشكلة: هجوم "حصان طروادة"

عادةً، يقوم حراس الأمن بفحص كل شخص أثناء مروره من الباب. إذا قال أحدهم، "أريد صنع قنبلة"، يوقفه الحارس فورًا.

لكن المهاجمين الأذكياء وجدوا خدعة جديدة تسمى الاختراق عبر التفكيك (Decompositional Jailbreaks). فبدلاً من طلب القنبلة دفعة واحدة، يقومون بتجزئة الطلب إلى قطع صغيرة غير ضارة، ويطلبونها بمرور الوقت، غالبًا من خلال "هويات" مختلفة أو في أوقات مختلفة.

  • السؤال 1: "ما هي خصائص الكهرباء؟" (غير ضار)
  • السؤال 2: "كيف تتسبب الأسلاك القديمة في الحرائق؟" (غير ضار)
  • السؤال 3: "ماذا يحدث إذا تم تحميل الدائرة الكهربائية فوق طاقتها؟" (غير ضار)

كل سؤال بمفرده يبدو بريئًا، لذا يسمح لهم الحارس بالمرور. ولكن إذا جمعت الإجابات معًا، سيمتلك المهاجم الآن دليلاً كاملاً حول كيفية إشعال حريق.

الكابوس الحقيقي للمكتبة هو أن هؤلاء المهاجمين لا يمكن تتبعهم. فهم لا يستخدمون نفس الاسم، أو عنوان IP نفسه، أو جلسة عمل واحدة. إنهم مثل الأشباح الذين يتسللون ويخرجون من الحشد، مما يجعل من المستحيل على الحارس أن يقول: "مهلًا، لقد رأيتك تسأل عن الأسلاك في وقت سابق؛ هذا السؤال عن الحرائق مريب".

الحل: TwinGate

ابتكر المؤلفون نظامًا يسمى TwinGate للإيقاع بهذه الأشباح. فكر في TwinGate كفريق أمني مكون من جزأين يعملان معًا:

1. "محقق النوايا" (مشفر ACL)

هذا هو الجزء الذكي من الفريق. وهو يستخدم طريقة تدريب خاصة تسمى التعلم التبايني غير المتماثل (Asymmetric Contrastive Learning).

  • كيف يعمل: تخيل أن المكتبة لديها خريطة عملاقة وغير مرئية لجميع الأسئلة. عادةً، يتم تجميع الأسئلة حسب الموضوع (على سبيل المثال، جميع أسئلة "الطبخ" موجودة في زاوية واحدة).
  • التحول: يتجاهل "محقق النوايا" الموضوع. بدلاً من ذلك، يقوم بتجميع الأسئلة حسب هدفها الخفي. فهو يتعلم أن "الكهرباء"، و"الأسلاك"، و"الأحمال الزائدة" هي في الواقع جميعها جزء من تجمع واحد لـ "صنع قنبلة"، رغم أنها تبدو مختلفة في الظاهر.
  • النتيجة: حتى لو سأل المهاجم عن الأسلاك يوم الاثنين وعن الحرائق يوم الجمعة، فإن "المحقق" يرى أن كلا السؤالين يسيران نحو نفس "الوجهة الخطيرة" ويوقفهما.

2. "حافظ الذاكرة" (المشفر المجمد)

"محقق النوايا" بارع جدًا في اكتشاف الأنماط لدرجة أنه قد يصبح متحمسًا أكثر من اللازم. فقد يعتقد: "أوه، لقد سألت عن الأسلاك بالأمس، والآن تسأل عن الأسلاك مرة أخرى؟ لا بد أن هذه مؤامرة لصنع قنبلة!" وهذا إنذار خاطئ.

لإصلاح ذلك، يحتوي TwinGate على عضو ثانٍ محافظ جدًا في الفريق وهو: حافظ الذاكرة.

  • كيف يعمل: يمتلك هذا العضو ذاكرة مثالية ومجمدة لما سأله الناس من قبل. إذا طرحت نفس السؤال تمامًا مرتين، يقول "حافظ الذاكرة": "لقد رأيت هذا من قبل. كان آمنًا حينها، وهو آمن الآن".
  • النتيجة: هذا يمنع النظام من حظر الناس الأبرياء عن طريق الخطأ الذين قد يطرحون نفس الأسئلة غير الضارة بشكل متكرر. فهو يحافظ على بقاء "معدل الإنذارات الكاذبة" (حظر الأبرياء) منخفضًا للغاية.

لماذا هو سريع وفعال؟

حاولت أنظمة الأمن القديمة حل هذه المشكلة من خلال توظيف ذكاء اصطناعي ثانٍ فائق الذكاء ("نموذج توليدي") يقرأ تاريخ المحادثة بالكامل لمعرفة ما إذا كان خطيرًا. هذا يشبه توظيف محقق لقراءة جميع كتب تاريخ المكتبة في كل مرة يدخل فيها شخص ما. إنه أمر بطيء، ومكلف، ويسبب ازدحامًا عند المدخل.

TwinGate مختلف. فهو يستخدم نهجًا "خفيف الوزن":

  • هو لا يقرأ التاريخ بأكمله؛ بل يكتفي بالتحقق من بطاقة فهرس رقمية (قاعدة بيانات متجهية) ليرى ما إذا كان السؤال الحالي يطابق نمطًا سيئًا معروفًا.
  • يعمل بسرعة كبيرة تتيح له فحص آلاف الأشخاص في الثانية دون جعلهم ينتظرون. إنه يشبه الماسح الضوئي الذي يفحص هويتك في أجزاء من الثانية بدلاً من إنسان يقرأ سيرتك الذاتية.

النتائج

اختبر المؤلفون TwinGate على مجموعة بيانات ضخمة تضم أكثر من 3.6 مليون طلب (بما في ذلك آلاف الطرق المختلفة لخرق القواعد).

  • معدل الإمساك: نجح في ضبط أكثر من 76% من الهجمات المخفية والمجزأة.
  • الإنذارات الكاذبة: لم يحظر الأبرياء عن طريق الخطأ إلا في أقل من 0.2% من الحالات.
  • السرعة: تعامل مع أكثر من 1,700 طلب في الثانية، وهو أسرع بكثير من الطرق السابقة.

باختصار

TwinGate هو نظام أمني ذكي وسريع يمكنه رصد هجوم "حصان طروادة" حتى عندما يخفي المهاجم قطع اللغز في أماكن وأوقات مختلفة. يستخدم "محققًا" للعثور على الهدف الخفي، و"حافظ ذاكرة" لضمان عدم إزعاج الأبرياء، كل ذلك مع العمل بسرعة كافية للحفاظ على سير العمل في مكتبة مزدحمة بسلاسة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →