← أحدث الأبحاث
💻 computer science

TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks

تُعد TrajShield إطار عمل دفاعي لا يتطلب تدريباً ويعمل أثناء وقت الاستدلال، يهدف إلى التخفيف من هجمات كسر الحماية والمخاطر الناشئة زمنياً في نماذج تحويل النص إلى فيديو عبر محاكاة مسارات المطالبات لتحديد المحتوى غير الآمن سببياً وإعادة كتابته بشكل أدنى مع الحفاظ على الدقة الدلالية.

المؤلفون الأصليون: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

نُشر 2026-05-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا ساحرًا لقص الحكايات، يمكنه تحويل جملك المكتوبة إلى أفلام قصيرة. هذا الروبوت موهوب للغاية في جعل المشاهد تتدفق بسلاسة من لحظة إلى أخرى، تمامًا مثل فيلم حقيقي. ومع ذلك، هناك مشكلة: أحيانًا، إذا أعطيته جملة تبدو "غير ضارة" ولكنها تلمح إلى مشكلة، فقد يندفع الروبوت وراء خياله القصصي. قد يبدأ بجدال غير ضار بين شخصين، وفي سعيه لجعل القصة درامية ومتماسكة، قد يصعد بالحدث إلى قتال عنيف لم تطلبه أنت أبدًا.

هذه هي المشكلة الجوهرية التي يحلها TrajShield.

المشكلة: "المنحدر الزلق" لسرد القصص

تعمل أنظمة الحماية الموجودة حاليًا لهذه الروبوتات مثل حارس الأمن عند باب النادي؛ فهي تتحقق من تذكرتك (النص المدخل) بحثًا عن كلمات سيئة مثل "قنبلة" أو "سكين". إذا رأت كلمة سيئة، فإنها تمنعك من الدخول.

لكن هذا النهج لديه نقطة عمياء: فهو لا يفهم سرد القصص عبر الزمن.

  • الطريقة القديمة: إذا قلت "رجلان يتجادلان في موقف للسيارات"، فلن يرى الحارس أي أسلحة وسيسمح لك بالدخول.
  • خطأ الروبوت: الروبوت، في محاولته لصنع فيلم جيد، يعتقد: "حسنًا، الجدالات عادة ما تؤدي إلى التدافع، والتدافع يؤدي إلى القتال". لذا، يقوم بإنتاج فيديو لقتال عنيف.
  • النتيجة: أنت طلبت جدالًا، لكنك حصلت على فيلم عنيف. الجزء "السيء" لم يكن في كلماتك؛ بل كان في خيال الروبوت حول كيفية تطور القصة.

الحل: TrajShield (المحرر الدرامي)

ابتكر مؤلفو هذه الورقة البحثية TrajShield، وهو نظام أمان جديد لا يكتفي بفحص التذكرة فحسب، بل يعمل كـ محرر سيناريو يقرأ القصة قبل تصوير الفيلم.

إليك كيف يعمل، باستخدام عملية بسيطة مكونة من ثلاث خطوات:

1. تفكيك القصة (الفصل بين الحركة والدلالة - Motion-Semantic Decoupling)

تخيل أن نص الروبوت هو كرة متشابكة من الخيوط. يقوم TrajShield بفك تشابكها إلى ثلاثة أجزاء متميزة:

  • الإطار (ثابت): من الموجود؟ أين هم؟ كيف يبدو المكان؟ (مثال: "رجلان، موقف سيارات، وقت الليل.")
  • الحبكة (ديناميكية): ماذا يحدث بعد ذلك؟ (مثال: "يتجادلان، ثم...")
  • الهدف (النية): ما الذي يحاول المستخدم إظهاره فعليًا؟ (مثال: "مشهد متوتر.")

من خلال فصل الإطار عن الحركة، يضمن النظام أنه عندما يصلح القصة، فإنه لا يغير الشخصيات أو الموقع بالخطأ. هو يلمس الحبكة فقط.

2. محاكاة المستقبل (انتشار المخاطر الزمني - Temporal Risk Propagation)

قبل أن يصنع الروبوت الفيديو فعليًا، يقوم TrajShield بإجراء "محاكاة ذهنية". يسأل نفسه: "إذا بدأت بهذا الجدال، فما هو المشهد التالي الأكثر احتمالية؟ وما هو المشهد الذي يليه؟"

إنه يبني "خريطة مخاطر" لمستقبل القصة. يبحث عن اللحظة الدقيقة التي تبدأ فيها القصة في الانزلاق نحو الخطر.

  • مثال: يرى أن "جدال" \leftarrow "صراخ" \leftarrow "تدافع" هو مسار خطير.
  • إنه يحدد نقطة التحفيز: اللحظة الدقيقة التي تتحول فيها القصة من "آمنة" إلى "غير آمنة" (على سبيل المثال، اللحظة التي يتحول فيها الصراخ إلى تدافع).

3. إعادة الكتابة الدنيا (إعادة الكتابة الآمنة المتسقة زمنيًا - Temporally-Consistent Safe Rewriting)

بمجرد العثور على نقطة التحفيز، يقوم TrajShield بإجراء "جراحة" على القصة. هو لا يحذف الفيلم بأكمله، بل يعيد كتابة الجزء الخطير من الحبكة فقط لتوجيهها نحو الأمان، مع إبقاء كل شيء آخر كما هو تمامًا.

  • المسار الخطير الأصلي: جدال \leftarrow صراخ \leftarrow قتال (غير آمن!)
  • إعادة كتابة TrajShield: جدال \leftarrow صراخ \leftarrow الانصراف بغضب (آمن!)

النتيجة هي فيديو لا يزال يشعر المستخدم بأنه يمثل فكرته الأصلية (متوتر، درامي، رجلان في موقف سيارات)، ولكنه يتوقف قبل أن يصبح عنيفًا. "القصة" تتدفق بشكل طبيعي، ولكن في اتجاه آمن.

لماذا هذا مهم؟

اختبرت هذه الورقة البحثية هذا النظام ضد 14 نوعًا مختلفًا من مخاطر السلامة (مثل العنف، الأعمال غير القانونية، أو المحتوى المزعج) وعبر 6 نماذج مختلفة لتوليد الفيديو.

  • النتيجة: منع TrajShield حوالي 52% أكثر من الفيديوهات غير الآمنة مقارنة بالطرق السابقة.
  • الجودة: والأهم من ذلك، أنه لم يفسد الفيديوهات الجيدة. فعندما يُعطى نصًا آمنًا، يظل الفيديو الناتج يبدو تمامًا كما أراد المستخدم. لم يحول مشهدًا سلميًا إلى مشهد ممل؛ بل منع فقط "المنحدر الزلق" نحو الخطر.

الخلاصة

فكر في TrajShield كشبكة أمان تلتقط القصة قبل أن تسقط من فوق المنحدر. فبدلاً من مجرد حظر الكلمات، هو يفهم أن للقصص اتجاهًا. إنه يراقب تطور القصة في عقل الروبوت، ويرصد اللحظة التي توشك فيها على الخروج عن المسار، ثم يوجهها بلطف نحو مسار آمن، كل ذلك دون تغيير المشهد أو الشخصيات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →