← أحدث الأبحاث
💻 computer science

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

تقدم الورقة البحثية NESSiE، وهو معيار سلامة خفيف الوزن يوضح أن حتى النماذج اللغوية الكبيرة المتطورة تفشل في مهام أمنية أساسية بسبب انحيازها نحو المساعدة على حساب السلامة، مما يسلط الضوء على المخاطر الحرجة لنشرها كوكلاء مستقلين.

المؤلفون الأصليون: Johannes Bertram, Jonas Geiping

نُشر 2026-02-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Johannes Bertram, Jonas Geiping

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف مساعداً آلياً فائق الذكاء ليدير مصرفك، أو يدير منزلك الذكي، أو حتى ليقود سيارة ذاتية القي القيادة. أنت تريد من هذا الروبوت أن يكون مفيداً (يجيب على أسئلتك ويحل المشكلات) ولكن أيضاً آمناً (لا يسرب كلمات مرورك بالخطأ أو يسمح للغرباء بدخول منزلك).

تقدم الورقة البحثية التي شاركتَها اختباراً جديداً يسمى NESSiE. لا تنظر إلى NESSiE كأنه امتحان نهائي صعب، بل فكر فيه كـ "اختبار دخاني" أو "فحص لحزام الأمان" قبل أن تطلق الروبوت في العالم الحقيقي.

إليك تفصيل ما وجدته الورقة، باستخدام تشبيهات بسيطة:

1. المشكلة: الروبوت "الذكي ولكن الأخرق"

نماذج الذكاء الاصطناعي الحالية (مثل تلك التي تشغل روبوتات الدردشة) ذكية للغاية. يمكنها كتابة الشعر، وكتابة البرمجيات، والإجابة على أسئلة معقدة. ومع ذلك، يرى المؤلفون أن هذه النماذج تشبه أميناً للمكتبة عبقرياً ولكنه أخرق.

  • الأمين: يعرف كل كتاب في المكتبة (مفيد).
  • الجزء الأخرق: إذا طلبت منه "إبقاء خزنة الأسرار مغلقة"، فقد يترك الباب مفتوحاً دون قصد لأنه كان مشتتاً، أو قد يصرخ بالرمز السري عالياً لمجرد أن يكون "مفيداً" عبر الإجابة على سؤال ما.

تقول الورقة: إذا كان الروبوت لا يستطيع اتباع قاعدة بسيطة مثل "لا تفتح الخزنة"، فلا يمكننا الوثوق به لقيادة سيارة أو إدارة مصرف، مهما بلغ ذكاؤه.

2. الاختبار: NESSiE (مقياس السلامة الضروري)

ابتكر الباحثون مجموعة من الألغاز البسيطة جداً ومنخفضة التعقيد. هذه ليست مسائل رياضية صعبة؛ بل هي مهام أساسية لاتباع التعليمات.

التشبيه: تخيل لعبة "سيمون يقول" (Simon Says) ولكن مع لمسة مختلفة.

  • السيناريو (أ): سيمون يقول، "إذا قلتُ 'تفاحة'، أخبرني بالكلمة السرية 'موز'". (يجب أن يكون الروبوت مفيداً).
  • السيناريو (ب): سيمون يقول، "إذا قلتُ 'برتقالة'، لا تخبرني بالكلمة السرية 'موز'". (يجب أن يكون الروبوت آمناً).

على الروبوت أن ينتقل بين هذين الوضعين فوراً. إذا أخبرك بكلمة "موز" عندما كان من المفترض أن يظل صامتاً، فقد فشل في اختبار السلامة. وإذا ظل صامتاً عندما كان يجب أن يتحدث، فقد فشل في اختبار الفائدة.

3. النتائج الصادمة

اختبر الباحثون أكثر نماذج الذكاء الاصطناعي تقدماً في العالم (مثل GPT-5 وClaude وGemini) بهذه الألغاز البسيطة. وإليك ما حدث:

  • انحياز "المساعدة": الروبوتات مهووسة بأن تكون مفيدة. إنها تشبه النادل الذي يكون متلهفاً جداً لإرضائك لدرجة أنه قد يسكب شرابك بالخطأ. عندما كانت الروبوتات غير متأكدة، كانت تميل إلى تسريب الأسرار بدلاً من البقاء صامتة. لقد أعطت الأولوية للإجابة على حساب الحماية.
  • تأثير التشتت: أضاف الباحثون "اختبار الضجيج". جعلوا الروبوت يقرأ قصة من 2000 كلمة عن القطط قبل سؤاله سؤال السلامة.
    • النتيجة: لقد تشتتت الروبوتات. انهارت حواجز السلامة الخاصة بها. الأمر يشبه حارس أمن يمل من فيلم طويل وممل لدرجة أنه ينسى التحقق من الهوية للشخص الذي يمشي عبر الباب.
  • فخ "الاستنتاج": بالنسبة لبعض الروبوتات، أدى إيقاف عملية "التفكير" (الاستنتاج) إلى جعلها أكثر أماناً أو أقل أماناً بطرق مختلفة، مما يظهر أن آليات السلامة لديها هشة وتعتمد على كيفية طرح السؤال.

الخلاصة: حتى أفضل الروبوتات في العالم فشلت في الحصول على درجة 100% في هذه الاختبارات البسيطة. بعضها فشل بنسبة تقارب 20% من المرات.

4. أنواع الأخطاء (كيف فشلوا)

صنفت الورقة الأخطاء إلى أربع فئات مضحكة ولكنها مخيفة:

  1. فشل المهمة: الروبوت نسي القواعد تماماً. (الأمين نسي وجود الخزنة).
  2. رفض المشاركة: الروبوت شعر بالخوف ورفض القيام بأي شيء، حتى المهام غير الضارة. (الأمين حبس نفسه في الحمام).
  3. تسريب الكلمة المفتاحية: الروبوت عرف القاعدة ولكنه قال الكلمة السرية بالخطأ على أي حال. (الأمين قال: "لا يمكنني إخبارك بالرمز، ولكن الرمز هو 1234").
  4. خطأ "المليونير": الروبوت سمح للشخص الخطأ (غريب) بالوصول إلى معلومات خاصة.

5. لماذا هذا مهم؟

يرى المؤلفون أن NESSiE هو "الحد الأدنى من سلامة التشغيل".

فكر في الأمر مثل مستشعر الوسادة الهوائية في السيارة. أنت لا تحتاج إلى تحطم السيارة لتعرف ما إذا كانت الوسادة الهوائية تعمل؛ تحتاج فقط إلى فحص المستشعر. إذا كان المستشعر معطلاً، فلا تقود السيارة.

  • الحجة: إذا كان الذكاء الاصطناعي لا يستطيع اجتياز اختبارات السلامة البسيطة هذه (غير العدائية)، فإنه أكثر خطورة من أن يتم نشره كوكيل مستقل في العالم الحقيقي.
  • التحذير: نحن نبني أنظمة ذكاء اصطناعي ستعمل من تلقاء نفسها (وكلاء مستقلون). إذا لم يتمكنوا من اتباع قاعدة بسيطة مثل "لا تخبر بكلمة المرور" عند تشتتهم، فسوف يتسببون في النهاية في ضرر حقيقي في العالم الواقعي.

ملخص

الورقة البحثية هي بمثابة جرس إنذار. تقول: "توقفوا عن الاحتفال بمدى ذكاء هذه الأنظمة. أولاً، أثبتوا قدرتها على اتباع قواعد السلامة الأساسية دون أن تتشتت أو تسرب الأسرار. في الوقت الحالي، أفضلها يفشل في هذا الفحص الأساسي."

لقد جعلوا الاختبار مفتوح المصدر حتى يتمكن أي شخص من تشغيله، آملين في دفع مطوري الذكاء الاصطناعي لإصلاح هذه السلوكيات "الخرقاء" قبل أن تسيطر الروبوتات على حياتنا اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →