← أحدث الأبحاث
🤖 machine learning

TabSHAP

تقدم هذه الورقة TabSHAP، وهو إطار عمل للتفسير غير المرتبط بنموذج محدد يعمل على قياس التأثير التوزيعي للميزات الفردية في المصنفات الجدولية القائمة على النماذج اللغوية الكبيرة من خلال تكييف تقدير أسلوب شابلي باستخدام تباعد جينسن-شانون على مستوى المفتاح والقيمة المتسلسلة، مما يحقق موثوقية أعلى من الطرق التقريبية الخطية الحالية.

المؤلفون الأصليون: Aryan Chaudhary, Prateek Agarwal, Tejasvi Alladi

نُشر 2026-04-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Aryan Chaudhary, Prateek Agarwal, Tejasvi Alladi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

🧩 الصورة الكبيرة: مشكلة "الصندوق الأسود"

تخيل أن لديك روبوت طباخ فائق الذكاء (نموذج لغوي كبير - LLM) تعلم الطبخ من خلال قراءة ملايين الوصفات المكتوبة كنصوص. تعطي هذا الروبوت قائمة من المكونات (مثل "العمر: 50"، "الوظيفة: معلم")، وهو يتنبأ ما إذا كانت الطبخة ستكون ناجحة أم فاشلة.

المشكلة؟ هذا الروبوت عبارة عن صندوق أسود. هو يعطيك الإجابة، لكنه لا يخبرك لماذا.

  • هل قال "ناجحة" لأن الشخص عمره 50 عاماً؟
  • أم لأنه معلم؟
  • أم أنه خمن فقط؟

في المجالات عالية المخاطر مثل الرعاية الصحية (تشخيص أمراض القلب) أو التمويل (الموافقة على القروض)، لا يمكننا مجرد الثقة في الروبوت. نحن بحاجة لمعرفة أي "مكون" كان الأكثر أهمية حتى نتمكن من الوثوق بالقرار.

🛠️ الطريقة القديمة مقابل الطريقة الجديدة

الطريقة القديمة (الوكيل الخطي - Linear Proxy):
سابقًا، حاول الناس فهم هذه الروبوتات عبر بناء نموذج بسيط وغبي (مثل جدول بيانات أساسي) ليحاكي إجابات الروبوت.

  • التشبيه: الأمر يشبه محاولة فهم سيمفونية معقدة من خلال الاستماع إلى عازف فلوت واحد فقط. ستحصل على فكرة تقريبية عن اللحن، لكنك ستفتقد كل التفاصيل الدقيقة، والطبول، والآلات الوترية. إنه بسيط جدًا بحيث لا يمكنه استيعاب المنطق الحقيقي للروبوت.

الطريقة القديمة (حذف الرموز - Token Deletion):
حاول البعض حذف الكلمات واحدة تلو الأخرى لرؤية ما سيحدث.

  • التشبيه: إذا كانت الوصفة تقول "العمر: 50"، وقمت بحذف الرقم "50" فقط، سيرى الروبوت "العمر: ". سيصاب الروبوت بالارتباك، ويظن أنك ارتكبت خطأً مطبعيًا، ويبدأ في إنتاج هراء غير مفهوم. هذا لا يخبرك شيئًا عن أهمية العمر؛ بل يخبرك فقط أن الروبوت يكره الأخطاء المطبعية.

🚀 ظهور TabSHAP: المحقق "الذري"

ابتكر المؤلفون TabSHAP، وهي أداة جديدة مصممة خصيصًا للتحدث مع هذه الروبوتات النصية حول البيانات الجدولية (الصفوف والأعمدة من الأرقام والكلمات).

إليك كيف يعمل، باستخدام ثلاث حيل رئيسية:

1. القطع "الذري" (لا تقطع الكلمات!)

في النصوص، تتكون قطعة واحدة من البيانات مثل "العمر: 50" من عدة قطع صغيرة (رموز/Tokens).

  • الخطأ: قطع "50" فقط يكسر بنية الجملة.
  • حل TabSHAP: يتعامل مع "العمر: 50" كـ وحدة ذرية واحدة غير قابلة للتجزئة (مثل قطعة الليغو). عندما يريد اختبار أهمية العمر، فإنه يزيل القطعة بأكملها.
  • التشبيه: بدلاً من سحب خيط واحد من سترة (مما يؤدي لتفكك السترة بالكامل)، يقوم TabSHHAP بإزالة الكم بالكامل بعناية ليرى كيف ستصمد السترة بدونه.

2. "فحص الثقة" (ليس مجرد نعم أو لا)

الأساليب القديمة كانت تنظر فقط إلى ما إذا كان الروبوت قد غير رأيه (مثل التحول من "نعم" إلى "لا").

  • حل TabSHAP: ينظر إلى ثقة الروبوت. يسأل: "ما مدى تأكد الروبوت قبل إزالة هذه الميزة، وما مدى تأكده الآن؟"
  • التشبيه: تخيل مذيع نشرة الطقس.
    • الطريقة القديمة: هل تغير التوقع من "مطر" إلى "شمس"؟
    • طريقة TabSHAP: كان المذيع متأكدًا بنسبة 90% من هطول الأمطار. بعد إزالة بيانات "الرطوبة"، انخفضت ثقته إلى 50%. هذا الانخفاض الكبير في الثقة يخبرك أن "الرطوبة" كانت أهم دليل، حتى لو ظل التوقع النهائي "مطر".

3. "العناق الجماعي" (تجميع الإجابات)

النماذج اللغوية الكبيرة غريبة الأطوار. قد تتنبأ بـ "نعم" بكتابة "نعم"، أو "نعم"، أو "نـ م " (بأشكال كتابة مختلفة).

  • حل TabSHAP: يقوم بتجميع كل هذه الكتابات المختلفة في "سلة" واحدة تسمى "نعم" قبل حساب الأهمية. هذا يضمن أن تكون الرياضيات مستقرة وعادلة.

🧪 الإثبات: "لعبة الحذف"

لإثبات فعالية TabSHA، لعب المؤلفون لعبة على مجموعتي بيانات شهيرتين: دخل البالغين (Adult Income) (التنبؤ بما إذا كان الشخص يكسب أكثر من 50 ألف دولار) و أمراض القلب (Heart Disease).

اللعبة:

  1. أخذوا قائمة من الميزات (العمر، الوظيفة، التعليم، إلخ).
  2. قاموا بترتيب الميزات من "الأكثر أهمية" إلى "الأقل أهمية" باستخدام TabSHAP.
  3. بدأوا في حذف الميزات واحدة تلو الأخرى، بدءًا من "الأكثر أهمية".
  4. النتيجة: بمجرد حذف الميزات الأعلى أهمية، انهارت ثقة الروبوت.
  5. المقارنة: عندما حذفوا الميزات بترتيب عشوائي، ظلت ثقة الروبوت مرتفعة لفترة طويلة. وعندما استخدموا طريقة قديمة (TreeSHAP)، لم يكن الانهيار حادًا بنفس القدر.

الاستنتاج: نجح TabSHAP في تحديد "الأدلة الحاسمة" التي كان الروبوت يستخدمها بالفعل.

🌟 لماذا هذا مهم؟

هذه الورقة تجسر الفجوة بين سحر الذكاء الاصطنا_ي و الثقة البشرية.

  • هي تُظهر أن نماذج الذكاء الاصطنا-ي الجديدة هذه لا تخمن فحسب، بل تستخدم منطقًا حقيقيًا (وإن كان أحيانًا منطقًا مختلفًا عن النماذج الرياضية التقليدية).
  • هي تمنح الأطباء، والمصرفيين، والمشرعين وسيلة للقول: "حسنًا، لقد قال الذكاء الاصطناعي 'خطر مرتفع' بسبب هذا العامل المحدد، ويمكننا التحقق من أن هذا المنطق منطقي ومعقول".

باختصار: TabSHAP هو المترجم الذي يسمح لنا بالتلصص داخل عقل الروبوت، ليس عن طريق تحطيمه، بل عن طريق إزالة مكوناته بعناية واحدة تلو الأخرى لنرى المكونات التي يحتاجها حقًا لطهي قراراته.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →