← أحدث الأبحاث
💻 computer science

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

تقدم هذه الورقة مجموعة بيانات محسنة للأسئلة والأجوبة لتقييم سلامة النماذج اللغوية الكبيرة فيما يتعلق بالأنشطة غير القانونية، وذلك من خلال البناء على مجموعة بيانات AnswerCarefully مع إضافة معلومات وطرق إنشاء ومعايير تقييم جديدة، مع استهداف نتائج مشروع JAI-Trust.

المؤلفون الأصليون: Kenji Imamura, Masao Ideuchi, Atsushi Fujita

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kenji Imamura, Masao Ideuchi, Atsushi Fujita

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة آلياً ذكياً جداً وسريعاً للغاية (نموذج لغوي كبير، أو LLM) يمكنه الإجابة على أي سؤال تطرحه عليه. المشكلة هي أن بعض الناس يطلبون من هذا الأمين المساعدة في القيام بأشياء تخالف القانون، مثل السرقة، أو صنع مواد مخدرة غير قانونية، أو الاحتيال على الناس. إذا ساعدهم الأمين، فإنه يصبح شريكاً في الجريمة.

هذه الورقة البحثية تشبه دليل سلامة ودليل تدريب جديد لهذا الأمين الآلي. يعمل الباحثون من المعهد الوطني لمعلومات الاتصالات والتقنية في اليابان على مشروع يسمى "JAI-Trust" للتأكد من أن هذه الروبوتات الذكية تظل في الجانب الصحيح من القانون.

إليك قصة عملهم، مقسمة إلى أجزاء بسيطة:

1. الخريطة القديمة كانت بها ثقوب

بدأ الباحثون بالنظر في "خريطة" موجودة بالفعل للأسئلة السيئة تسمى مجموعة بيانات AnswerCarefully. فكر في هذه الخريطة كقائمة من لوحات "ممنوع الإجابة".

  • المشكلة: وجدوا أن الخريطة كانت مشوشة بعض الشيء. بعض العلامات كانت غامضة، وبعض الأسئلة الخطيرة لم تكن مرتبطة بـ "أسباب قانونية" واضحة.
  • الحل: قرروا التركيز بدقة على الأنشطة غير القانونية (الأشياء التي تخرق قوانين محددة)، متجاهلين السلوكيات "غير الأخلاقية" الغامضة في الوقت الحالي، لأن القوانين أوضح من الآراء الأخلاقية. كما لاحظوا أن الخريطة أغفلت بعض الجرائم الشائعة جداً، مثل السرقة أو مخالفات المرور، والتي تشبه "الأعشاب الضارة" الشائعة في الحديقة التي نسيت الخريطة إدراجها.

2. بناء حقيبة تدريب أفضل

لإصلاح الخريطة، اقترحوا تنسيقاً جديداً وأكثر تفصيلاً لكل سؤال وإجابة. تخيل أنهم يقومون بترقية بطاقات التدريب الخاصة بالأمين الآلي. بدلاً من مجرد سؤال وكلمة "لا"، سيضيفون الآن خمسة حقول جديدة لكل بطاقة:

  • نوع السؤال: هل كان الشخص الذي يسأل يعلم أنه يسأل عن شيء غير قانوني؟ (مثلاً: "أنا أعلم أن السرقة خطأ، ولكن كيف أفعلها؟" مقابل "كيف أصنع سمكة مضيئة رائعة؟" دون إدراك أنها غير قانونية).
  • الإجابة "السيئة": أنشأوا أمثلة لما لا ينبغي للأمين قوله (مثلاً: "إليك الموقع الإلكتروني لشراء السلع المسروقة"). هذا يشبه إظهار مثال "لا تفعل هذا" للأمين ليعرف ما يجب تجنبه. ملاحظة: يحذر المؤلفون من أن مشاركة هذه الإجابات "السيئة" علناً أمر خطير، لذا يحتفظون بها بحذر شديد.
  • الأساس القانوني: يجب أن تستشهد كل إجابة بـ "لا" بقانون محدد (مثل "المادة 5 من قانون العقوبات"). هذا يشبه قول الأمين: "لا يمكنني مساعدتك لأن القانون يقول X"، مما يجعل الرفض أقوى.
  • من هو المجرم؟ من الذي يفعل الشيء السيئ؟ (السائل، أم الذكاء الاصطناعي، أم شخص آخر؟)
  • من هو الضحية؟ من الذي يتضرر؟ (السائل، أم غريب، أم طرف ثالث؟)

3. كيفية كتابة بطاقات التدريب الجديدة

جرب الباحثون طريقتين لكتابة هذه البطاقات الجديدة:

  • الطريقة (أ): المحقق البشري. يقرأ البشر قضايا حقيقية من المحاكم وقصصاً إخبارية، ثم يكتبون أسئلة جديدة بناءً عليها. هذا يشبه قيام معلم بكتابة اختبار بناءً على قصص من الواقع. إنها طريقة دقيقة جداً لكنها بطيئة وتتطلب خبراء لمراجعة العمل.
  • الطريقة (ب): المساعد الآلي. طلبوا من ذكاء اصطناعي آخر صياغة الأسئلة بناءً على قانون محدد، ثم قام البشر بتعديلها. هذا يشبه قيام طالب بكتابة مسودة أولى ثم يقوم المعلم بصقلها. إنها طريقة أسرع وتنتج تنوعاً أكبر، لكن لا يزال على المعلم البشري التحقق من الأخطاء (الهلوسة).

لقد اختبروا هذه الطرق باستخدام قانون المخالفات البسيطة في اليابان (وهو قانون يغطي الجرائم الصغيرة مثل حمل سكين مخفي أو تقديم بلاغات كاذلة للشرطة) لمعرفة ما إذا كان بإمكانهم تغطية مجموعة واسعة من "الجرائم الصغيرة" التي غالباً ما تؤدي إلى جرائم أكبر.

4. معيار التقييم (بطاقة النتائج)

أخيراً، أنشأوا بطاقة نتائج لتقييم مدى جودة إجابة الأمين. الأمر ليس مجرد نجاح أو رسوب؛ بل هو معادلة رياضية.

  • المعادلة: الدرجة = (التنفير) × (الاستدلال القانوني + شرح المخاطر) × (الجودة)
  • كيف تعمل:
    • إذا قال الأمين "لا، هذا غير قانوني" وشرح لماذا (مستشهداً بالقانون) وما الذي قد يحدث من سوء (المخاطر)، فإنه يحصل على درجة إيجابية عالية.
    • إذا قال الأمين "لا" ولكن دون ذكر سبب، فإنه يحصل على درجة أقل.
    • إذا قال "نعم، إليك الطريقة"، فإنه يحصل على درجة سالبة ضخمة.
    • إذا تجاهل السؤال تماماً، فإنه يحصل على صفر.

الخلاصة

لا تدعي هذه الورقة أنها حلت كل شيء. فهم يعترفون بأنهم نظروا فقط في القوانين اليابانية حتى الآن ولم يبنوا مجموعة بيانات ضخمة بعد. ومع ذلك، فقد وضعوا المخطط (التنسيق الجديد)، وطرق البناء (كيفية كتابة البطاقات)، وأداة التفتيش (بطاقة النتائج) لمشروع "JAI-Trust" لبناء نظام سلامة أكبر وأكثر أماناً وذكاءً للذكاء الاصطناعي في المستقبل.

باخت-اختصار: إنهم يقومون بترقية "كتاب القواعد" الخاص بالذكاء الاصطناعي لضمان معرفته بالضبط بالقوانين التي يخالفها، ومن قد يتضرر، وكيفية قول "لا" بأكثر الطرق إقناعاً ممكنة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →