← أحدث الأبحاث
🤖 AI

Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

تجادل هذه الورقة بأن المواءمة ذات الصلة بالنشر لا يمكن استنتاجها من تقييمات مستوى النموذج وحدها، حيث تثبت من خلال عمليات التدقيق واختبارات الإجهاد أن المعايكات الحالية تفتقر إلى التحقق الموجه للمستخدم والقدرة على توجيه العمليات، مما يستوجب التحول نحو أطر تقييم على مستوى النظام تأخذ في الاعتبار صراحةً سياقات التفاعل وتبعية السقالات.

المؤلفون الأصليون: Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

نُشر 2026-05-07
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.

الفكرة الجوهرية: "اختبار السيارة" مقابل "الرحلة على الطريق"

تخيل أنك تريد معرفة ما إذا كانت سيارة جديدة ذاتية القيادة آمنة للقيادة على الطرق السريعة الحقيقية.

الممارسة الحالية (التقييم على مستوى النموذج):
في الوقت الحالي، يقوم الباحثون باختبار "عقل" السيارة (نموذج الذكاء الاصطناعي) في مرآب هادئ وخالٍ. يسألونها: "إذا ضغطتُ على المكابح، هل تتوقف؟" أو "إذا سألتك عن الوقت، هل تعطيني الوقت الصحيح؟"
إذا أجابت السيارة بشكل صحيح في المرآب، نفترض أنها آمنة للقيادة في أي مكان. نعطيها درجة عالية ونقول: "هذه السيارة متوافقة مع قواعد السلامة".

حجة الورقة البحثية:
يقول المؤلفون إن هذا خطأ خطير. فمجرد عمل عقل السيارة بشكل مثالي في المرآب لا يعني أنها ستتعامل جيداً مع طريق سريع ممطر، أو راكب مرتبك، أو تغيير مفاجئ في المسار.

  • المرآب = المعايير المرجعية الحالية (اختبار النموذج بمفرده).
  • الطريق السريع = العالم الحقيقي (حيث يُستخدم الذكاء الاصطناعي فعلياً).

تجادل الورقة بأنه لا يمكنك استنتاج كيفية سلوك السيارة على الطريق السريع بمجرد اختبارها في المرآب. لمعرفة ما إذا كان الذكاء الاصطناعي "متوافقاً" حقاً (آمناً ومفيداً) في العالم الحقيقي، يجب عليك اختباره أثناء القيادة، مع وجود ركاب، ومع وجود حركة مرور.


المستويات الأربعة للاختبار

يقسم المؤلفون اختبار الذكاء الاصطناعي إلى أربعة "طوابق" لمبنى. معظم الاختبارات الحالية تحدث في الطابق الثاني، لكننا نطلق ادعاءات حول الطابق الرابع.

  1. الطابق 1: النموذج (العقل): اختبار الكود الخام والأوزان. ("هل الرياضيات تعمل؟")
  2. الطابق 2: الاستجابة (الإجابة): إعطاء النموذج سؤالاً ثابتاً وتقييم إجابته الوحيدة. ("هل أجاب بـ '42' عندما سألناه 6×9؟") هذا هو المكان الذي يحدث فيه معظم الاختبارات الحالية.
  3. الطابق 3: التفاعل (المحادثة): مراقبة كيفية تحدث الذكاء الاصطناعي عبر عدة جولات. هل يطلب توضيحاً؟ هل يسمح للمستخدم بتغيير الخطة؟ هل يعترف عندما يكون غير متأكد؟
  4. الطابق 4: النشر (الوظيفة الحقيقية): عمل الذكاء الاصطناعي داخل شركة معينة، بقواعد حقيقية، ورؤساء حقيقيين، ومستخدمين حقيقيين.

المشكلة: نحن نختبر في الطابق 2، لكننا نطلق وعوداً عن الطابق 4. الفجوة بين هذه الطوابق هائلة.


الدراستان الكبيرتان (الأدلة)

لم يكتفِ المؤلفون بقول ذلك فحسب؛ بل أجروا دراستين لإثباته.

الدراسة 1: تدقيق "صندوق الأدوات"

نظروا في 11 أداة اختبار شهيرة للذكاء الاصطناعي (المعايير المرجعية) لمعرفة ما تقيسه بالفعل. استخدموا قائمة مراجعة تضم 8 "مهارات تفاعلية" مهمة، مثل:

  • دعم التحقق: هل يظهر الذكال الاصطناعي خطوات عمله حتى يتمكن المستخدم من التحقق مما إذا كان صحيحاً؟ (مثل إظهار خطوات حل مسألة رياضية).
  • قابلية التوجيه أثناء العملية: هل يمكن للمستخدم أن يطلب من الذكاء الاصطناعي تغيير طريقة حله للمشكلة؟ (مثل قول: "لا، جرب مساراً مختلفاً").

النتائج:

  • فراغ "التحقق": لم تتحقق أي واحدة من أصل 11 من المعايوهات مما إذا كان الذكاء الاصطناعي يساعد المستخدم على التحقق من الإجابة. لقد تحققوا فقط مما إذا كانت الإجابة "صحيحة"، وليس مما إذا كان بإمكان المستخدم الوثوق بها.
  • فجوة "قابلية التوجيه": لم يتحقق أي عدد يذكر مما إذا كان بإمكان المستخدم التحكم في العملية.
  • التجزئة: الاختبارات القليلة التي تحققت بالفعل من مهارات التفاعل كانت مشتتة. أحدها اختبر الذاكرة، والآخر اختبر استخدام الأدوات، ولكن لا يوجد شيء يختبر الصورة الكاملة. إنه يشبه امتلاك صندوق أدوات يحتوي على مطرقة وأخرى مفك براغي، ولكن ليس لديك مفتاح ربط.

التشبيه: تخيل أنك تحكم على طاهٍ فقط بناءً على مدى براعته في تقطيع البصل في مطبخ هادئ. أنت لا تراه أبداً وهو يتذوق الحساء، أو يسأل الزبون عما إذا كان لديه حساسية من المكسرات، أو يعدل الوصفة بناءً على مزاج الزبون. أنت لا تعرف ما إذا كان طاهياً جيداً، بل تعرف فقط أنه مقطع بصل جيد.

الدراسة 2: "نفس السيارة، طرق مختلفة" - اختبار الضغط

أخذ المؤلفون ثلاثة نماذج ذكاء اصطناعي مختلفة (Claude و GPT-4o و Llama) وأبقوا "عقولها" كما هي تماماً. ثم قاموا بتغيير "السقالات" (التعليمات والواجهة التي تغلف النموذج).

أعطوا النماذج أربعة "أزياء" مختلفة:

  1. الدردشة العادية: مجرد تحدث.
  2. وضع التوضيح: إجبار الذكاء الاصطناعي على طرح أسئلة قبل الإجابة.
  3. وضع التخطيط: إجبار الذكاء الاصطناي على إظهار خطة قبل التنفيذ.
  4. وضع التحقق: إجبار الذكاء الاصطناعي على إظهار افتراضاته وكيفية التحقق من الإجابة.

النتيجة الصادمة:

  • النموذج أ (Claude): عندما وُضع في "وضع التحقق"، أصبح بارعاً جداً في مساعدة المستخدمين على التحقق من الإجابات.
  • النموذج ب (GPT-4o): عندما وُضع في نفس "وضع التحقق"، لم يتغير على الإطلاق. ظل كما هو.
  • النموذج ج (Llama): لم يتغير إلا قليلاً، وفي بعض الحالات أصبح أسوأ في اتباع التعليمات.

الدرس المستفاد: "الزي" (تصميم النظام) يهم بقدر أهمية "العقل" (النموذج). لا يمكنك التنبؤ بكيفية سلوك النموذج في نظام حقيقي بمجرد النظر إلى النموذج وحده. نفس التعليمات تعمل بشكل رائع مع ذكاء اصطناعي واحد ولا تفعل شيئاً لآخر.


ماذا يجب أن نفعل بدلاً من ذلك؟

تقترح الورقة طريقة جديدة للإبلاغ عن نتائج الذكاء الاصطناعي، تسمى "ملف التوافق" (Alignment Profile).

بدلاً من قول: "هذا الذكاء الاصطناعي لديه درجة 95/100 وهو آمن للمستشفيات." (وهذه كذبة مبنية على اختبار المرآب).

يجب أن نقول: "هذا الذكاء الاصطناعي، عند استخدامه مع [تعليمات محددة] و [واجهة مستخدم محددة]، أظهر هذه السلوكيات المحددة. نحن لم نختبره في مستشفى حقيقي، لذا لا يمكننا الادعاء بأنه آمن لتلك الوظيفة المحددة."

المقترح:

  1. توقف عن التظاهر بأن درجة واحدة تغطي كل شيء.
  2. اختبر النظام بالكامل: اختبر النموذج بالإضافة إلى التعليمات بالإضافة إلى واجهة المستخدم معاً.
  3. كن صادقاً بشأن الفجوة: صرّح بوضوح: "لقد اختبرنا هذا في المرآب. لم نختبره على الطريق السريع بعد".

الملخص

تجادل الورقة بأن توافق الذكاء الاصطناعي ليس خاصية للعقل وحده؛ بل هو خاصية للنظام بأكمله. لا يمكنك الحكم على سيارة ذاتية القيادة باختبار محركها في المختبر. يجب عليك قيادتها على الطريق، مع وجود راكب، وفي المطر. وإلى أن نبدأ في اختبار الذكاء الاصطناعي في هذا السياق، فإن ادعاءاتنا حول سلامته وفائدته ليست سوى مجرد تخمينات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →