← أحدث الأبحاث
💬 NLP

Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models

تحدد هذه الورقة عدم أمانة منهجي في إطار عمل Patchscopes حيث تعتمد النماذج اللغوية الكبيرة على التحيزات اللغوية المتأصلة بدلاً من التمثيلات الخفية السياقية، وتقترح طريقة BALOR لإعادة معايرة الـ logits وتحسين أمانة التفسير بشكل كبير.

المؤلفون الأصليون: Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

نُشر 2026-02-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة "Faithful-Patchscopes" باستخدام لغة بسيطة وتشبيهات إبداعية.

الصورة الكبيرة: قراءة "عقل" الذكاء الاصطناعي

تخيل أن النموذج اللغوي الكبير (LLM) عبارة عن مصنع ضخم ومعقد. عندما تطرح عليه سؤالاً، فهو لا يكتفي بالتفكير فحسب؛ بل يعالج المعلومات عبر طبقات من الآلات، وينتج "مخططات" داخلية (تسمى التمثيلات الخفية - hidden representations) تحمل التفاصيل المحددة لطلبك.

مؤخراً، اخترع الباحثون أداة تسمى Patchscopes. فكر في Patchscopes كأنها "آلة لقراءة العقول". فهي تأخذ أحد هذه المخططات الداخلية، وتدمجه في سؤال جديد، ثم تطلب من الذكاء الاصطناعي شرح ما يعنيه ذلك المخطط بلغة بسيطة.

المشكلة: تجادل الورقة بأن آلة قراءة العقول هذه غالباً ما تكون غير أمينة (unfaithful). فهي لا تخبر دائماً بالحقيقة عما يوجد في المخطط؛ بل إنها غالباً ما تتجاهل التفاصيل المحددة التي قدمتها لها وتكتفي بسرد ما تعتقد أنه "المعتاد".

التشبيه: انحياز "البروكلي"

لفهم المشكلة، تخيل أنك تعرض صورة لـ بروكلي بنفسجي على إنسان آلي (روبوت).

  1. الواقع: في الصورة، البروكلي بنفسجي بوضوح. المخطط الداخلي للروبوت لهذه الصورة يشفر اللون "البنفسجي" بشكل صحيح.
  2. عادة الروبوت: ومع ذلك، في العالم الحقيقي (وفي كميات النصوص الهائلة التي تدرب عليها الروبوت)، يوصف البروكلي دائماً بأنه أخضر. لدى الروبوت عادة قوية: البروكلي = أخضر.
  3. الفشل: عندما تستخدم Patchscopes لتسأل الروبوت: "ما لون هذا البروكلي؟" بناءً على ذلك المخطط البنفسجي، يتجاهل الروبوت الدليل البنفسجي ويقول: "أخضر".

الروبوت اعتاد بشدة على عادة "الأخضر" لدرجة أنها طغت على الدليل الفعلي في ذاكرته. وتسمي الورقة هذا انحياز النموذج (Model Bias) الناتج عن الأنماط اللغوية غير المتوازنة (Imbalanced Linguistic Patterns) (أي رؤية "البروكلي الأخضر" 100 مرة أكثر من "البروكلي البنفسجي").

الحل: BALOR (المُدقق في الحقائق)

يقترح المؤلفون طريقة جديدة تسمى BALOR (محاذاة الانحياز عبر إعادة معايرة اللوجيت - Bias Alignment through Logit Recalibration) لإصلاح ذلك.

فكر في BALOR كأنه مدقق حقائق ذكي يعمل عبر محاكاة موازية. وإليك كيف يعمل:

  1. التخمين "المنحاز": ينظر الروبوت إلى البروكلي البنفسجي، وبالاعتماد على عاداته السيئة، يفكر: "من المحتمل أن يكون أخضر".
  2. تخمين "المقارنة": يسأل BALOR الروبوت سؤالاً ثانياً: "إذا لم أكن قد عرضت عليك الصورة، وسألتك عن البروكلي بشكل عام، ماذا ستقول؟" فيجيب الروبوت: "أخضر" (بسبب انحيازه الافتراضي).
  3. سحر الرياضيات: يقارن BALOR بين هذين الجوابين. ويدرك: "لقد قال الروبوت 'أخضر' في كلتا الحالتين. لكن في الحالة الأولى، كان لديه الصورة البنفسجية! حقيقة أنه لا يزال يقول 'أخضر' تعني أن انحيازه قوي جداً".
  4. التصحيح: يقوم BALOR بطرح "الانحياز الافتراضي" من "الإجابة القائمة على الصورة". هو يقول فعلياً: "حسناً، نحن نعلم أنك تريد قول 'أخضر' بسبب عاداتك. ولكن بما أن الصورة تقول 'بنفسجي'، فلنقم بتعزيز إشارة 'البنفسجي' وإلغاء عادة 'الأخضر'".

من خلال إجراء هذه العملية الحسابية على مستويات ثقة الروبوت (التي تسمى logits) قبل أن يكتب الإجابة النهائية، يجبر BALOR الروبوت على الانتباه للسياق المحدد (البروكلي البنفسجي) بدلاً من عاداته العامة.

ماذا وجدوا؟

اختبر الباحثون هذه الطريقة على أربعة نماذج مختلفة من الذكاء الاصطناعي (مثل Llama و Qwen) باستخدام مجموعة بيانات من الأسئلة الصعبة حول الألوان، والجنس، والثقافة.

  • المشكلة حقيقية: بدون مساعدة، كانت تفسيرات الذكاء الاصطناعي خاطئة بنسبة تترا-وح بين 18% إلى 28% لأنها استمرت في العودة إلى انحيازاتها.
  • BALOR يعمل: باستخدام طريقة "مدقق الحقائق" الخاصة بهم، حسنوا الدقة بشكل كبير. في بعض الحالات، أصبح الذكاء الاصطناعي أكثر أمانة بنسبة 33% للمعلومات التي يحملها فعلياً.
  • لا حاجة للجراحة: على عكس الطرق الأخرى التي تتطلب إعادة تدريب النموذج بالكامل (وهو أمر مكلف ويغير طريقة تفكير الذكاء الاصطناعي)، يعمل BALOR كفلتر في نهاية العملية. إنه يصلح الإجابة دون تغيير "دماغ" الذكاء الاصطناعي.

الملخص

تظهر الورقة أن نماذج الذكاء الاصطناعي غالباً ما تكذب بشأن ما "تعرفه" داخلياً لأنها عنيدة جداً تجاه عادات التدريب الخاصة بها. بنى المؤلفون أداة (BALOR) تعمل كحكم، يرصد متى يتجاهل الذكاء الاصطناعي الأدلة ليتبع عاداته، ويقوم رياضياً بدفعه لقول الحقيقة. وهذا يجعل الأدوات التي تحاول شرح كيفية تفكير الذكاء الاصطناعي أكثر موثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →