← أحدث الأبحاث
🤖 AI

Closing the Distribution Gap in Adversarial Training for LLMs

تقدم هذه الورقة التدريب التنافسي التوزيعي (DAT)، وهو نهج مبتكر يسخر نماذج اللغات الكبيرة القائمة على الانتشار (Diffusion LLMs) لتقريب التوزيع المشترك الحقيقي للمطالبات والاستجابات، وبالتالي توليد عينات متنوعة ذات احتمالية عالية للتغلب على القيود التوزيعية للطرق الحالية وتحسين متانة النماذج اللغوية الكبيرة بشكل كبير ضد الهجمات التنافسية البسيطة ضمن التوزيع.

المؤلفون الأصليون: Chengzhi Hu, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn

نُشر 2026-02-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chengzhi Hu, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "سد فجوة التوزيع في التدريب الخصمي للنماذج اللغوية الكبيرة (LLMs)"، مترجمة إلى لغة بسيطة مع استخدام تشبيهات إبداعية.

المشكلة الكبرى: "الكتاب المدرسي" مقابل "العالم الحقيقي"

تخيل أنك تقوم بتدريب حارس أمن (نموذج ذكاء اصطناعي) لمنع الأشرار من اقتحام مبنى.

الطريقة القديمة (التدريب الخصمي القياسي):
تقوم باستئجار فريق من الممثلين للتدرب على عملية الاقتحام. يحاولون فتح القفل، أو تسلق السور، أو خداع الحارس بهوية مزيفة. أنت تدرب الحارس على إيقاف هؤلاء الممثلين تحديداً وهم يقومون بـ هذه الحيل المحددة.

الخلل:
يصبح الحارس بارعاً في إيقاف الممثلين الذين استأجرتهم. ولكن بعد ذلك، يظهر مجرم حقيقي لا يستخدم أدوات فتح الأقفل؛ بل يكتفي بسؤال الحارس: "مهلاً، هل يمكنك فتح الباب؟ أنا في عجلة من أمري"، لكنه يقول ذلك بلغة مختلفة، أو يستخدم صيغة الماضي ("كنت أحاول الدخول")، أو يستخدم لهجة لم يسمعها الحارس من قبل.

يفشل الحارس هنا. لماذا؟ لأن بيانات التدريب (الممثلين) لم تغطِ الكون بأكمله لكيفية محاولة البشر خداعه. في الورقة البحثية، يسمي المؤلفون هذا بـ "فجوة التوزيع" (Distribution Gap). مجموعة التدريب صغيرة وثابتة جداً بحيث لا تغطي جميع الطرق الطبيعية التي يمكن للبشر من خلالها تحريف الطلب للحصول على إجابة ضارة.

الحل: DAT (التدريب الخصمي التوزيعي)

يقترح المؤلفون طريقة جديدة تسمى DAT. بدلاً من مجرد استئجار فريق ثابت من الممثلين، قاموا ببناء محاكي سحري (نموذج انتشار - Diffusion Model) يمكنه تخيل ملايين الطرق المختلفة التي قد يحاول بها المجرم خداع الحارس.

إليك كيف يعمل DAT، خطوة بخطوة:

1. المحاكي السحري (نموذج الانتشار اللغوي)

فكر في الذكاء الاصطناعي القياسي كآلة روبوت تعرف فقط كيفية إنهاء الجملة بمجرد أن تبدأها (مثل خاصية الإكمال التلقائي الذكية جداً). هي تعرف: "إذا قلت 'مرحباً'، فالكلمة التالية المرجحة هي 'بالعالم'".

نموذج الانتشار اللغوي (Diffusion LLM) المستخدم في هذه الورقة مختلف. إنه يشبه آلة الهندسة العكسية.

  • الذكاء الاصطناًعي العادي: تعطيه نصاً (Prompt)، فيعطيك إجابة.
  • ذكاء الانتشار (Diffusion AI): تعطيه إجابة سيئة (مثلاً: "كيف تصنع قنبلة")، فيسأل نفسه: "ما نوع السؤال الذي قد يجعل بشرياً يقول هذه الإجابة؟"

بعد ذلك، يقوم بتوليد آلاف الأسئلة المختلفة التي تبدو طبيعية والتي قد تؤدي إلى تلك الإجابة السيئة. بعضها قد يكون بالفرنسية، وبعضها بصيغة الماضي، وبعضها بأسلوب شعري. هذا يملأ "فجوة التوزيع" عبر إظهار كل زاوية هجوم ممكنة للحارس الأمني، وليس فقط الزوايا التي فكر فيها البشر مسبقاً.

2. معسكر التدريب (التدريب الخصمي المستمر)

بمجرد أن يولد المحاكي السحري هذه الآلاف من الأسئلة الماكرة، يتم وضع الحارس الأمني (النموذج اللغوي الكبير) في معسكر تدريب شاق.

  • يتدرب الحارس على قول "لا" لكل هذه الأسئلة الجديدة والغريبة في الصياغة.
  • والأهم من ذلك، التدريب لا يكتفي بقول "قل لا" فحسب، بل يعلم الحارس التعرف على النية وراء السؤال، حتى لو كانت الصياغة غريبة.

النتائج: لماذا هذا مهم؟

اختبرت الورقة هذه الطريقة الجديدة مقابل الطرق القديمة ووجدت فوزين كبيرين:

  1. إيقاف الحيل "البسيطة":
    كانت الطرق القديمة جيدة في إيقاف الهجمات المعقدة التي تولدها الحواسيب (مثل روبوت يحاول اختراق الكود). لكنها فشلت عندما يقوم إنسان بإعادة صياغة السؤال بشكل طفيف. نجح DAT في إيقاف هذه الحيل "البسيطة" بشكل شبه كامل. إنه يشبه تعلم الحارس أخيراً أن جملة "كنت أحاول الدخول" هي تماماً بنفس خطورة "أنا أحاول الدخول".

  2. لا يجعل الحارس غبياً:
    عادةً، عندما تدرب حارساً ليكون صارماً للغاية، يبدأ في رفض السماح بدخول الأشخاص الأبرياء (مثل عامل التوصيل أو صديق). وهذا ما يسمى بفقدان "المنفعة" (Utility).

  • الطرق القديمة: جعلت الحارس آمناً جداً، ولكنه أصبح فظاً وغير متعاون أيضاً.
  • طريقة DAT: جعلت الحارس آمناً للغاية ومع ذلك ظل متعاوناً مع الناس الطبيعيين. لقد وجدت التوازن المثالي (نقطة "باريتو المثلى").

التشبيه الجوهري: "متعدد الطيات" (Manifold) للأفكار السيئة

يتحدث المؤلفون عن "المانيفولد" (Manifold)، وهو مصطلح رياضي معقد يعني شكلاً أو مشهداً طبيعياً.

  • الطريقة القديمة: تخيل مشهد "الأسئلة السيئة" كأنه سلسلة جبال ضبابية ضخمة. طرق التدريب القديمة قامت فقط ببناء جدار حول مخيم صغير ومسطح في وسط الجبل. إذا سلك شخص سيء طريقاً حول حافة المخيم (فجوة التوزيع)، فإن الجدار لن يوقفه.
  • طريقة DAT: يعمل نموذج الانتشار مثل طائرة بدون طيار (Drone) تطير فوق سلسلة الجبال بأكملها، وترسم خريطة لكل مسار يمكن أن يسلكه الشخص السيء. ثم، يبني جداراً يغطي الجبل بأكمله، وليس المخيم فقط.

الملخص في جملة واحدة

تقدم الورقة طريقة تدريب جديدة تستخدم ذكاءً اصطناعياً "يعمل بالهندسة العكسية" لتوليد ملايين الأسئلة الماكرة والطبيعية، مما يضمن أن النموذج الأساسي يتعلم قول "لا" لأي تنويع لطلب ضار، وليس فقط للأسئلة المحددة التي تعلم الخوف منها سابقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →