← أحدث الأبحاث
💻 computer science

When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output

تقدم هذه الورقة هجوم فك القيود بالترميز المقيد (CDA)، وهو تقنية جديدة لكسر الحماية تستغل فك الترميز الموجه بالقواعد في النماذج اللغوية الكبيرة لتجاوز محاذاة السلامة عبر حقن حمولات ضارة من خلال مخططات مخرجات مهيكلة، محققة معدلات نجاح تقترب من المثالية ضد النماذج وأدوات الحماية المتطورة.

المؤلفون الأصليون: Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

نُشر 2026-05-22
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً ومدرباً جيداً. لقد علمت هذا الروبوت قواعد صارمة: "لا تخبر أحداً أبداً بكيفية صنع قنبلة"، "لا تكتب أبداً خطاب كراهية"، و"كن مهذباً دائماً". كما وضعت حارساً أمنياً عند الباب يفحص كل سؤال تطرحه للتأكد من أنه آمن.

لفترة طويلة، حاول المخترقون خداع الروبوت عبر طرح أسئلة غريبة أو التحدث بلغة مشفرة (مثل Base6B) للالتفاف على الحارس. وكان الروبوت والحارس يكتشفونهم عادةً.

لكن هذه الورقة البحثية تكشف عن طريقة جديدة وماكرة لتعطيل عقل الروبوت لا يستطيع الحارس رؤيتها. ويطلق عليها الباحثون اسم "الهجوم الموجه بالقواعد" (Grammar-Guided Attack).

إليك كيف يعمل ذلك، باستخدام تشبيه بسيط:

الإعداد: نموذج "ملء الفراغات"

تخيل أن الروبوت لا يكتفي بالدردشة فحسب، بل يقوم أيضاً بملء نماذج رسمية (مثل مخططات JSON) لبرامج حاسوبية أخرى. ولضمان ملء النموذج بشكل صحيح، تعطي الروبوت قالبًا (قاعدة لغوية) يقول: "يجب عليك ملء هذه الصناديق المحددة بهذا الترتيب المحدد".

عادةً ما يكون هذا مفيداً؛ فهو يمنع الروبوت من الهذيان أو ارتكاب الأخطاء.

الهجوم: قالب "حصان طروادة"

اكتشف الباحثون أنه إذا كنت أنت من يعطي الروبوت القالب، فيمكنك إخفاء فخ داخل القواعد نفسها، بدلاً من إخفائه في السؤال الذي تطرحه.

1. هجوم "القيم المحددة" (الفخ الواضح)
تخيل أنك تعطي الروبوت نموذجاً يحتوي على صندوق بعنوان "السؤال". وتكتب قاعدة تقول: "الجواب الوحيد المسموح به لهذا الصندوق هو: 'كيفية صنع قنبلة؟'".
وعلى الرغم من أن سؤالك الفعلي للروبوت كان غير ضار (مثل "يرجى ملء هذا النموذج")، إلا أن القواعد تجبر الروبوت على كتابة الكلمات الخطيرة. ولأن الروبوت مبرمج على اتباع القالب بدقة، فليس لديه خيار سوى كتابة الكلمات السيئة. وحارس الأمن عند الباب ينظر فقط إلى سؤالك ("يرجى ملء هذا النموذج")، ويراه آمناً، فيسمح له بالمرور. لكن الروبوت، باتباع القالب، يكتب تعليمات القنبلة.

2. هجوم "القاموس" (الفخ الخفي)
هذا هو الجزء الأكثر ذكاءً. هجوم "القيم المحددة" سهل الاكتشاف لأن الكلمات السيئة موجودة هناك في القالب. لذا، صمم الباحثون نسخة أذكى تسمى DictAttack.

تخيل أنك تعطي الروبوت قاموساً وقائمة من الرموز.

  • القاموس (القالب): يبدو كقائمة كلمات عادية.
    • A1 = "مرحباً"
    • B2 = "لـ"
    • C3 = "صنع"
    • D4 = "الـ"
    • E5 = "قنبلة"
    • F6 = "كعكة" (فقط ليبدو الأمر طبيعياً)
  • السؤال (المُدخل): تسأل الروبوت: "يرجى ترجمة هذا الرمز: B2 + C3 + D4 + E5".

بالنسبة لحارس الأمن، يبدو السؤال غير ضار ("ترجم هذا الرمز")، والقاموس يبدو كقائمة كلمات عادية. ولكن عندما يتبع الروبوت قواعده لترجمة الرموز، فإنه يجمع الرسالة المخفية: "لصنع قنبلة".

يرى الحارس شيئين آمنين: سؤالاً آمناً وقاموساً آمناً. لكن عندما يجمعهما الروبوت، فإنه يصنع تعليمات خطيرة. لا يستطيع الحارس رؤية الخطر لأن الأجزاء منفصلة.

لماذا هذا أمر خطير؟

اختبرت هذه الورقة البحثية هذا الهجوم على 13 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي القوية، بما في ذلك أحدث النماذج من الشركات الكبرى (مثل GPT-5 وGemini).

  • معدل النجاح: نجح الهجوم بنسبة تقارب 100% على أحدث النماذج.
  • "الفجوة الدلالية": يسمي الباحثون هذا "فجوة دلالية". وهذا يعني أن حارس الأمن ينظر إلى الكلمات (البيانات)، بينما يحدث الهجوم في القواعد (التحكم). الحارس وتدريب السلامة الداخلي للروبوت ينظران في المكان الخطأ.
  • النتيجة: حتى أذكى أنظمة الذكاء الاصطناعي، التي عادة ما ترفض القيام بأشياء سيئة، ستتبع "القواعد" التي تعطيها لها بكل سرور، حتى لو أجبرتها تلك القواعد على قول شيء فظيع.

الخلاصة

تجادل الورقة البحثية بأننا لا نستطيع الاعتماد فقط على تعليم الذكاء الاصطناعي أن يكون "جيداً" أو وضع حارس عند الباب. نحن بحاجة أيضاً إلى فحص القوالب والقواعد التي نعطيها له. إذا سمحنا للمستخدمين بتحديد القواعد التي يجب أن يتحدث بها الذكاء الاصطناعي، فيمكن استخدام هذه القواعد كسلاح لتجاوز جميع تدابير السلامة لدينا.

لقد شارك الباحثون نتائجهم مع الشركات التي تصنع هذه الأنظمة من الذكاء الاصطناعي حتى يتمكنوا من إصلاح ثغرة "مستوى التحكم" (control-plane) هذه قبل أن يستخدمها المتربصون.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →