Are Aligned Large Language Models Still Misaligned?
تقدم هذه الورقة البحثية Mis-Align Bench، وهو معيار موحد ومجموعة بيانات SAVACU التي تضم أكثر من 382,000 عينة، لتقييم عدم توافق النماذج اللغوية الكبيرة عبر أبعاد السلامة والقيم والثقافة في آن واحد، مما يكشف أن النماذج المُحسّنة لأبعاد منفردة تعاني من معدلات فشل كاذب عالية وانخفاض في درجات التوافق عند مواجهة ظروف واقعية مشتركة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف مساعداً جديداً لإدارة تجمع عائلي دولي مزدحم. لديك ثلاث قواعد رئيسية له:
- السلامة: يجب ألا يقول أبداً أي شيء خطير أو جارح (مثل اقتراح شرب السم على شخص ما).
- القيم: يجب أن يحترم الأخلاق البشرية (مثل كون المرء طيباً وصادقاً).
- الثقافة: يجب أن يفهم أن العائلات المختلفة لديها تقاليد مختلفة (مثل معرفة أن تقديم المشروبات الكحولية في بعض الثقافات أمر طبيعي، بينما في ثقافات أخرى، يعد ذلك أمراً مرفوضاً تماماً).
المشكلة: "المتخصص" مقابل "العام"
لفترة طويلة، اختبر الباحثون المساعدين الآليين عبر فحص قاعدة واحدة فقط في كل مرة.
- سألوا: "هل هذه الإجابة آمنة؟" (نعم/لا).
- سألوا: "هل هذه الإجابة أخلاقية؟" (نعم/لا).
- سألوا: "هل هذه الإجابة صحيحة ثقافياً؟" (نعم/لا).
تجادل الورقة البحثية بأن هذا يشبه اختبار طاهٍ بسؤاله فقط: "هل تستطيع تقطيع البصل؟" و"هل تستطيع خبز كعكة؟" بشكل منفصل. قد تحصل على مقطع بصل بارع وخباز ممتاز، ولكن إذا طلبت منه إعداد وجبة كاملة حيث يجب خبز صلصة البصل داخل الكعكة، فقد يفشل فشلاً ذريعاً.
في العالم الحقيقي، يجب على الذكاء الاصطناعي تلبية القواعد الثلاث في الوقت ذاته تماماً.
الأداة الجديدة: "Mis-Align Bench"
بنى المؤلفون ساحة اختبار جديدة تسمى Mis-Align Bench. فكر في الأمر كـ "اختبار جهد" للذكاء الاصطناعي.
بدلاً من طرح أسئلة بسيطة، أنشأوا مكتبة ضخمة من 382,000 سيناريو معقد (تسمى SAVACU). تجبر هذه السيناريوهات الذكاء الاصطناعي على الموازنة بين السلامة، والقيم، والثقافة في آن واحد.
مثال على سيناريو:
- السؤال: "هل ينبغي تقديم الكحول في جميع التجمعات العائلية؟"
- الإجابة "الآمنة" ولكن "الخاطئة": "نعم، يجب على الجميع الشرب!" (آمنة؟ نعم. أخلاقية؟ ربما. ثقافياً؟ لا، لأن بعض العائلات تلتزم بالامتناع عن الكحول أو لديها خلفيات دينية).
- الإجابة "الأخلاقية" ولكن "الخاطئة": "لا، لا تشربوا أبداً!" (آمنة؟ نعم. ثقافياً؟ لا، لأن بعض الثقافات ترى في النبيذ شيئاً مقدساً).
- الإجابة "المتوافقة": "يعتمد الأمر على تقاليد العائلة والقوانين المحلية." (آمنة، أخلاقية، ومدركة ثقافياً).
ما الذي اكتشفوه
اختبر الباحثون العديد من نماذج الذكاء الاصط_ي (بعضها تم "ضبطه بدقة" ليكون خبيراً في مجال واحد فقط، وبعضها نماذج عامة الأغراض). وإليك ما حدث:
- فخ "المتخصص":
النماذج التي تم تدريبها لتكون "آمنة للغاية" فقط أو "أخلاقية للغاية" فقط، برعت في وظيفتها المحددة (حققت نجاحاً بنسبة 97%!).
- العائق: عندما سألتهم عن التعامل مع موقف يتطلب القواعد الثلاث معاً، أصبحوا متعثرين. بدأوا في رفض الإجابات الجيدة لمجرد أنهم كانوا صارمين للغاية بشأن قاعدة واحدة. لقد فشلوا في رؤية الصورة الكبيرة.
- تشبيه: تخيل حارس أمن مهووس بـ "السلامة" لدرجة أنه يمنع جدة من إدخال حفيدها إلى الحديقة لأن الصبي يرتدي قبعة تبدو "مريبة". لقد اتبعوا القاعدة لكنهم فشلوا في المهمة.
ميزة "العام":
النماذج التي تم تدريبها للتعامل مع كل شيء معاً (نماذج الأغراض العامة المتوافقة) كانت أفضل في الموازنة بين القواعد الثلاث. لم يكتشفوا كل خطأ صغير، لكنهم لم يطلقوا الكثير من "الإنذارات الكاذبة". لقد فهموا الفروق الدقيقة.النماذج "الخام":
النماذج التي لم يتم تدريبها على التوافق على الإطلاق كانت الأكثر "استرخاءً". نادراً ما قالوا "لا" للإجابات الجيدة (إنذارات كاذبة منخفضة)، لكنهم أيضاً أغفلوا الكثير من المخاطر الفعلية لأنهم لم يهتموا بالقواعد بما يكفي.
الخلاصة الكبرى
تخلص الورقة البحثية إلى أن "التوافق" ليس مجرد كون المرء آمناً، أو أخلاقياً، أو واعياً ثقافياً بشكل منعزل. بل يتعلق بكيفية نسج هذه الأشياء الثلاثة معاً.
إذا دربت ذكاءً اصطناعياً ليكون "نينجا في السلامة"، فقد يصبح مهووساً لدرجة أنه يتوقف عن كونه مفيداً أو حساساً ثقافياً. لبناء ذكاء اصطناعي مفيد حقاً، نحتاج إلى اختباره في مواقف معقدة من العالم الحقيقي حيث يتعين عليه تحقيق توازن مثالي، وليس مجرد اتباع كتاب قواعد واحد.
باختاً: أنت لا تريد روبوتاً هو "آمن" فقط، أو "مهذب" فقط. أنت تريد روبوتاً يعرف متى يكون آمناً، ومتى يكون مهذباً، ومتى يحترم التقليد الثقافي، كل ذلك أثناء إجراء محادثة معك. تقدم هذه الورقة أول طريقة حقيقية لاختبار ما إذا كان بإمكان روبوتاتنا القيام بذلك بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.