← أحدث الأبحاث
💬 NLP

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

تتقصى هذه الورقة البحثية تقدير عدم اليقين لنماذج التنشيط (activation oracles) من خلال تقييم ست طرق لتقدير الثقة، حيث وجدت أن تردد النمط القائم على "بوتستراب" (bootstrap mode frequency) يقدم أفضل معايرة، بينما يعمل الاحتمال اللوغاريتمي (log-probability) كإشارة فرز فعالة من حيث التكلفة.

المؤلفون الأصليون: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا فائق الذكاء (لنسمه "الهدف") لديه سر. ربما تمت برمجته لإبقاء كلمة معينة، مثل "شجرة"، مخفية داخل دماغه. لا يمكنك رؤية الكلمة مباشرة؛ يمكنك فقط رؤية الإشارات الكهربائية (تنشيطاته) عندما يفكر.

تخيل الآن أن لديك روبوتًا ثانيًا، وهو "الأوراكل" (العراف)، ومهمته الوحيدة هي النظر في تلك الإشارات الكهربائية وترجمتها إلى لغة إنجليزية بسيطة. يقول: "الكلمة السرية هي شجرة!"

المشكلة:
الأوراكل بارع في تخمين الكلمة، لكن لديه عيب كبير في الشخصية: هو لا يعرف أبدًا متى يكون مخطئًا. فهو يقول "الكلمة السرية هي شجرة" بنفس القدر من الثقة سواء كان محقًا أو مجرد يتخيل (يهلوس). إذا كنت تستخدم هذا الأوراكل لاتخاذ قرارات مهمة (مثل "هل هذا الذكاء الاصطناعي آمن للإطلاق؟")، فأنت بحاجة لمعرفة: إلى أي مدى هو واثق حقًا؟

التجربة:
حاول مؤلفو هذه الورقة البحثية تعليم الأوراكل كيف يقول: "أنا شبه متأكد"، أو "أنا مجرد أخمن". لقد اختبروا ست طرق مختلفة لقياس ثقة الأوراكل، تمامًا كما تحاول اختبار مدى موثوقية توقعات الطقس بست طرق مختلفة.

إليك كيف اختبروها، باستخدام تشبيهات بسيطة:

طرق الثقة الست

  1. "الشعور الداخلي" (الاحتمالية اللوغاريتمية - Log-Probability):

    • كيف تعمل: ينظر الأوراكل إلى الكلمة التي قالها للتو ويسأل نفسه: "ما مدى احتمالية اختياري لهذه الكلمة تحديدًا؟"
    • النتيجة: إنها تخمين جيد، لكن الأوراكل غالبًا ما يكون مفرط الثقة. يعتقد أنه متأكد بنسبة 90% بينما هو في الواقع محق بنسبة 60% فقط.
  2. "تصويت الجمهور" (تردد نمط بوتستراب - Bootstrap Mode Frequency):

    • كيف تعمل: بدلًا من سؤال الأوراكل مرة واحدة، تسأله 20 مرة متتالية، وتجعله عشوائيًا قليلاً في كل مرة (مثل رمي النرد). إذا قال "شجرة" 18 مرة و"سيارة" مرتين، فأنت تعرف أنه واثق جدًا. أما إذا قال "شجرة"، "سيارة"، "سحابة"، "صخرة"، ثم "شجرة" بشكل عشوائي، فأنت تعرف أنه مرتبك.
    • النتيجة: كانت هذه هي الفائزة. كانت الأكثر دقة في إخبارك متى يكون الأوراكل محقًا أو مخطئًا. الأمر يشبه سؤال حشد من الناس؛ إذا اتفقوا جميعًا، يمكنك الوثوق بالإجابة.
  3. "المقابلة الصادقة" (التقرير الذاتي المباشر - Direct Self-Report):

    • كيف تعمل: ببساطة تسأل الأوراكل: "على مقياس من 0 إلى 100، ما مدى ثقتك؟"
    • النتيجة: كانت هذه أسوأ طريقة. الأوراكل سيء جدًا في معرفة ذاته. في النموذج الأكبر، كان في الواقع أكثر ثقة عندما يكون مخطئًا مما كان عليه عندما يكون محقًا. إنه يشبه طالبًا متأكدًا بنسبة 100% من أنه حل المسألة الرياضية بشكل صحيح، رغم أنه أخطأ تمامًا.
  4. "سلسلة MCMC" (أخذ العينات بالقوة - Power Sampling):

    • كيف تعمل: هذه خدعة رياضية معقدة حيث يحاول الأوراكل "القفز" بين الإجابات المحتملة المختلفة ليرى ما إذا كان سيعلق على إجابة واحدة.
    • النتيلة: لم تنجح بشكل جيد. نظرًا لأن عقل الأوراكل يركز بشدة على إجابة واحدة، فإنه لا "يقفز" أبدًا إلى الاحتمالات الأخرى، لذا لم تستطع هذه الطريقة معرفة ما إذا كان واثقًا أم مجرد عنيد.
  5. "شد الحبل" (حساسية التوجيه - Steering Sensitivity):

    • كيف تعمل: تقوم بدفع عقل الأوراكل بلطف في اتجاهات مختلفة لترى ما إذا كان سيغير إجابته. إذا بقيت الإجابة كما هي، فهو واثق.
    • النتيجة: كانت خشنة للغاية. كانت مثل محاولة قياس درجة الحرارة بميزان حرارة يحتوي فقط على إعدادات "حار" و"بارد".
  6. "تصويت السلسلة المتعددة" (Multi-Chain Vote):

    • كيف تعمل: مشابهة لـ "تصويت الجمهور"، ولكن باستخدام طريقة رياضية أكثر تعقيدًا وتكلفة لتوليد الإجابات العشرين.
    • النتيجة: عملت بشكل جيد، لكنها كانت أبطأ بكثير ولم تعطِ نتائج أفضل من "تصويت الجمهور" البسيط.

النتائج الرئيسية الكبرى

  • الأداة الأفضل: "تصويت الجمهور" (سؤال النموذج 20 مرة ورؤية عدد المرات التي يتفق فيها مع نفسه) هو أفضل طريقة لمعرفة ما إذا كان الأوراكل يقول الحقيقة.
  • الفخ: لا تثق أبدًا في الأوراكل عندما يقول ببساة "أنا واثق". وجدت الورقة أنه عندما يُطلب من الأوراكل تقييم ثقته الخاصة، فإنه غالبًا ما يهلوس بالثقة تمامًا كما يهلوس بالإجابة.
  • التكلفة: "تصويت الجمهور" يتطلب قوة حوسبة أكبر لأن عليك تشغيل النموذج 20 مرة. طريقة "الشعور الداخلي" أسرع ولكنها أقل دقة. يقترح المؤلفون استخدام الطريقة السريعة كفلتر سريع فقط، ولكن الاعتماد على "تصويت الجمهور" لاتخاذ القرار النهائي.

لماذا هذا مهم؟

إذا كنت تبني نظام سلامة لفحص نماذج الذكاء الاصطناعي، فلا يمكنك مجرد الاستماع لما يقوله الأوراكل. أنت بحاجة لمعرفة مدى الثقة التي يمكنك وضعها فيما يقوله. تقدم لنا هذه الورقة دليلًا حول كيفية بناء هذه الثقة، موضحة أن طلب "التفكير مرتين" من الأوراكل (عبر تصويت الجمهور) هو الطريقة الأكثر موثوقية للإمساك به عندما يختلق الأمور.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →