← أحدث الأبحاث
🤖 machine learning

LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

تقدم الورقة البحثية LiSA، وهو إطار عمل لاستقراء السياسات التحفظية يعمل على تعزيز حواجز الحماية الثابتة للذكاء الاصطناعي من خلال تحويل حالات فشل النشر المتفرقة والمشوشة إلى تجريدات سياسات قابلة لإعادة الاستخدام عبر ذاكرة مهيكلة، مما يمكّن الوكلاء من التكيف مع مخاطر السلامة السياقية دون الحاجة إلى ضبط دقيق متكرر.

المؤلفون الأصليون: Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك وظفت حارس أمن ذكي جدًا، ولكنه جامد بعض الشيء، لحماية عميل الذكاء الاصطناعي المستقل الجديد الخاص بك. مهمة هذا الحارس هي تقرير ما يمكن للذكاء الاصطناعي فعله (مثل الوصول إلى الملفات الخاصة أو استخدام الأدوات) وما يجب عليه رفضه.

المشكلة هي أن هذا الحارس تم تدريبه على قواعد عامة قبل توظيفه. لكن في العالم الحقيقي، الأمور فوضوية؛ فأحيانًا يكون الإجراء آمنًا في سياق معين، ولكنه خطير في سياق آخر. على سبيل المثال، مشاركة جدول فعاليات عام أمر جيد، لكن مشاركة التاريخ الطبي الخاص لزميل هو أمر غير مقبول. قد يخطئ الحارس في هذه الأمور بسبب طبيعته الجامدة.

عادةً، لإصلاح حارس يرتكب الأخطاء، سيتعين عليك إرساله مجددًا إلى المدرسة (إعادة تدريب نموذج الذكاء الاصطناعي) في كل مرة يزل فيها. ولكن في بيئة العالم الحقيقي المزدحمة، لا يمكنك إيقاف النظام بأكمله لإعادة تدريب الحارس في كل مرة يقول فيها مستخدم: "مهلًا، كان ذلك خطأ". بالإضافة إلى ذلك، لا يبلغ المستخدمون عن الأخطاء إلا في حالات نادرة، وأحيانًا يكونون هم أنفسهم مشوشين أو يبلغون عن أشياء خاطئة.

إليك LiSA (التكيف المستمر للسلامة - Lifelong Safety Adaptation).

فكر في LiSA ليس كمعلم جديد، بل كـ مساعد منظم للغاية وحذر يجلس بجانب حارس الأمن. بدلًا من إعادة تدريب الحارس، يقوم LiSA بالاحتفاظ بـ "دفتر ملاحظات خاص" للدروس المستفادة من الأخطاء، ويساعد الحارس على اتخاذ قرارات أفضل أثناء العمل.

إليك كيف يعمل LiSA، باستخدام ثلاث حيل بسيطة:

1. كتاب "القاعدة العامة" (التجريد الواسع للسياسة)

عندما يرتكب الحارس خطأً، لا يكتفي LiSA بتدوين ذلك الخطأ المحدد فحسب، بل يسأل: "ما هو الدرس العام هنا؟"

  • التشبيه: تخيل أن الحارس سمح بالخطأ بدخول شخص غريب إلى منطقة محظورة لأنه بدا وكأنه موظف. بدلًا من كتابة "لا تسمح لـ جون بالدخول"، يكتب LiSA قاعدة عامة: "لا تسمح لأي شخص بالدخول بدون بطاقة تعريف، حتى لو بدا مألوفًا".
  • لماذا يساعد هذا: هذا يحول خطأً واحدًا نادر الحدوث إلى قاعدة قابلة لإعادة الاستخدام، مما يمكن من منع أخطاء مماثلة في المستقبل، حتى لو كان الشخص أو الموقف مختلفًا.

2. الملاحظات اللاصقة لـ "المنطقة الرمادية" (القواعد المحلية الواعية بالصراع)

أحيانًا، لا يكون العالم أبيض وأسود. هناك "مناطق رمادية" حيث يكون نفس الإجراء مقبولًا أحيانًا وغير مقبول في أحيان أخرى.

  • التشبيه: تخيل أن القاعدة هي "لا تشارك الأسرار". ولكن ماذا لو كان السر هو محاضرة عامة حضرها شخص ما؟ هذا أمر جيد. ولكن ماذا لو كان اجتماعًا سريًا لجماعة راديكالية؟ هذا أمر سيء.
  • تحرك LiSA: إذا رأى LiSA أن الحارس مرتبك بشأن نوع معين من المواقف (حيث يقول بعض الناس "نعم" والبعض الآخر "لا")، فإنه لا يحاول فرض قاعدة كبيرة واحدة. بدلاً من ذلك، يكتب ملاحظة لاصقة صغيرة ومحددة لهذا السيناريو بالضبط.
  • النتيجة: عندما يواجه الذكاء الاصطناعي ذلك الموقف "الرمادي" المحير مرة أخرى، يسحب LiSA الملاحظة اللاصقة المحددة ليقول: "انتظر، في هذه الحالة المحددة، الإجابة هي 'لا' بسبب كذا وكذا"، مما يمنع الحارس من أن يكون واسع النطاق بشكل مفرط.

3. مرشح "الانتظار والمراقبة" (بوابة الثقة التحفظية)

هذه هي أهم ميزة للسلامة. LiSA حذر للغاية؛ فهو يعلم أنه مجرد نجاح قاعدة ما لمرة واحدة لا يعني أنها مثالية.

  • التشبيه: تخيل أن لدى LiSA قاعدة جديدة: "اسمح دائمًا للناس بالدخول إذا كانوا يرتدون قبعة زرقاء". لقد رأى هذه القاعدة تنجح مرة واحدة فقط. يفكر LiSA: "هذا ليس دليلًا كافيًا! ماذا لو كانت القبعة الزرقاء التالية خدعة؟" لذا، يقوم LiSA بـ إخفاء تلك القاعدة.
  • الآلية: لا يظهر LiSA أي قاعدة للحارس إلا إذا تم اختبارها مرات عديدة وأثبتت موثوقيتها. إنه يستخدم "درجة ثقة" رياضية. إذا كان للقاعدة الكثير من الأدلة (تجارب ناجحة كثيرة)، يتم عرضها. أما إذا كانت ضعيفة أو جديدة، فيحتفظ بها LiSA في جيبه الخلفي حتى يتأكد منها.
  • لماذا يهم هذا: هذا يمنع LiSA من تعليم الحارس عادات سيئة عن طريق الخطأ بناءً على تقرير مستخدم واحد مشوش أو خاطئ.

النتيجة الكبرى

اختبرت الورقة البحثية نظام LiSA في ثلاثة "ميادين تدريبية" (مجموعات بيانات) تتعلق بالخصوصية والسلامة. لقد قاموا بمحاكاة عالم لا يبلغ فيه المستخدمون عن الأخطاء إلا في حالات متفرقة، وأحيانًا تكون تلك البلاغات خاطئة.

  • النتيجة: ساعد LiSA حارس الأمن على أن يصبح أكثر ذكاءً بمرور الوقت دون الحاجة للعودة إلى المدرسة.
  • السرعة مقابل الذكاء: عادةً، لكي تحصل على حارس أكثر ذكاءً، تحتاج إلى حارس أكبر، أبطأ، وأكثر تكلفة (نموذج ذكاء اصطناعي أكبر). أظهر LiSA أن حارسًا صغيرًا وسريعًا مع دفتر ملاحظات جيد (LiSA) يمكنه في الواقع التفوق على حارس أكبر وأغلى ثمنًا لا يملك هذا النوع من الذاكرة.

باخت-اختصار: LiSA هو نظام يسمح لعملاء الذكاء الاصطناعي بالتعلم من أخطائهم في العالم الحقيقي عن طريق تنظيم تلك الأخطاء في قواعد ذكية وحذرة، دون الحاجة إلى إعادة تدريب النظام بأكمله باستمرار. إنه يشبه إعطاء ذكائك الاصطناعي "دفتر دروس مستفادة" يقرأ منه قبل اتخاذ كل قرار.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →