← أحدث الأبحاث
💻 computer science

From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition

تقدم هذه الورقة SITH، وهو إطار عمل جديد لا يعتمد على البيانات ولا يتطلب إعادة تدريب، يقوم بتفكيك أوزان رؤوس الانتباه في نموذج CLIP إلى متجهات مفردة وتفسيرها كمفاهيم متماسكة ومتفرقة عبر خوارزمية جديدة، مما يتيح تفسيرات دقيقة داخل الرأس الواحد وتعديلات دقيقة للنموذج دون الحاجة لإعادة التدريب.

المؤلفون الأصليون: Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا فنانًا فائق الذكاء يُدعى CLIP. يمكن لهذا الروبوت النظر إلى صورة ووصفها بشكل مثالي، أو قراءة وصف ما والعثور على الصورة المطابقة له. لكن المشكلة تكمن في أنه لا أحد يعرف حقًا كيف يفعل ذلك. إنه يشبه "الصندوق الأسود"؛ تضع صورة في الداخل، فتخرج منها أوصاف، لكن التروس بالداخل مخفية.

عادةً، لفهم كيفية تفكير الروبوت، يتعين على العلماء تغذيته بآلاف الصور ومراقبة ما يحدث بداخله أثناء عمله. هذا يشبه محاولة فهم طباخ من خلال مراقبته وهو يطهو وجبة؛ ترى المكونات التي يلتقطها، لكنك لا تعرف الوصفة السرية المكتوبة على الحائط. وأيضًا، إذا كان الطباخ يطبخ فقط بمكونات من متجر بقالة معين، فقد تعتقد أن هذا هو كل ما يعرفه، وهذا ليس صحيحًا.

يقدم البحث طريقة جديدة تسمى SITH (والتي تبدو كاسم شبح مخيف، لكنها ترمز إلى الفحص الدلالي لرؤوس المحولات - Semantic Inspection of Transformer Heads). SITH هي بمث সাই مثل الأشعة السينية السحرية التي تسمح لنا برؤية "دماغ" الروبوت دون عرض صورة واحدة عليه.

إليك كيف تعمل SITH، مقسمة إلى خطوات بسيطة:

1. "كتاب الوصفات" مقابل "برنامج الطهي"

كانت الأساليب السابقة تشبه مشاهدة "برنامج الطهي" (النظر إلى التنشيطات). كانت تحتاج إلى الكثير من البيانات (المكونات) لتخمين ما يفكر فيه الروبوت. إذا رأى الروبوت الكثير من صور القطط، فقد يعتقد أنه لا يعرف سوى القطط.

SITH مختلفة. فهي تنظر مباشرة إلى كتاب الوصفات (الأوزان). هي لا تهتم بما يطبخه الروبوت حاليًا؛ بل تقرأ فقط التعليمات المكتوبة في دماغه. وهذا يعني أنها خالية من البيانات (Data-free). لا تحتاج لرؤية صورة واحدة لفهم كيفية عمل الروبوت.

2. تشبيه "السكين السويسري"

داخل دماغ الروبوت، توجد أدوات صغيرة تسمى رؤوس الانتباه (Attention Heads). فكر في أحد هذه الرؤوس كأنه سكين سويسري.

  • الطريقة القديمة: كان العلماء يقولون: "هذه السكين جيدة للقطع". هذا وصف غامض نوعًا ما. هل هي جيدة لقطع الورق؟ أم اللحم؟ أم الشعر؟
  • طريقة SITH: تقوم SITH بتفكيك السكين. تستخدم أداة رياضية تسمى SVD (تحلل القيم المفردة) لفصل السكين إلى شفراتها الفردية: مفك براغي صغير، مقص صغير، وفتاحة زجاجات.

3. "المترجم" (COMP)

بمجرد أن تقوم SITH بتفكيك السكين السويسري إلى شفرات فردية، لا تزال بحاجة لمعرفة وظيفة كل شفرة. وهنا يأتي دور خوارزمية جديدة تسمى COMP.

تخيل أن لديك شكلًا غريبًا ومجردًا (شفرة). تريد وصف هذا الشكل باستخدام الكلمات.

  • المشكلة: إذا اخترت أقرب كلمة فقط، فقد تقول "أحمر" لشكل هو في الواقع "نجمة حمراء حادة وغاضبة". ستفتقد هنا إلى الدقة والبراعة.
  • حل SITH (عبر COMP): COMP هو مثل مترجم ذكي يبني وصفًا باستخدام مزيج متماسك ومتفرق (sparse, coherent combination). فهو يقول: "حسنًا، هذه الشفرة ليست مجرد 'أحمر'. إنها مزيج من 'القرمزي'، و'الحاد'، و'الخطر'". إنه يختار بضع كلمات تتناسب مع بعضها البعض تمامًا لوصف تلك الشفرة المحددة.

4. ماذا وجدوا؟

عندما استخدموا SITH على روبوت CLIP، اكتشفوا أشياء مذهلة:

  • شفرات متخصصة: اكتشفوا أنه داخل "سكين" واحد (رأس انتباه)، توجد شفرات محددة مخصصة للألوان (شفرة لـ "الأحمر"، وأخرى لـ "الأزرق")، والمواقع (واحدة لـ "المطابخ"، وأخرى لـ "الشواطئ")، وحتى الحروف (بعض الشفرات يمكنها بالفعل "قراءة" النصوص داخل الصورة!).
  • لا يوجد تحيز: لأنهم نظروا إلى كتاب الوصفات وليس إلى برنامج الطهي، فقد وجدوا هذه السمات حتى لو لم يرَ الروبوت صورة لـ "طائر فلامنجو وردي" خلال تدريبه.

5. القوة الخارقة: "جراحة الدماغ" بدون تخدير

الجزء الأروع هو ما يمكنك فعله بهذه المعرفة. بما أن SITH تفهم دماغ الروبوت من حيث المفاهيم (مثل "الأحمر" أو "الخلفية")، يمكننا إجراء جراحة على الروبوت دون إعادة تدريبه.

  • إصلاح العادات السيئة: تخيل أن الروبوت يعتقد أن "الطائر" هو طائر فقط إذا كان واقفًا على "شجرة". إذا أريته طائرًا على "صخرة"، فسيصاب بالارتباك. يمكن لـ SITH العثور على شفرة "الشجرة" المحددة وخفض قوتها. الآن يمكن للروبوت رؤية الطيور على الصخور أيضًا!
  • السلامة: إذا كان الروبوت حساسًا جدًا للصور "المخيفة" أو "غير الآمنة"، يمكن لـ SITH العثور على شفرات "الخوف" وكتم صوتها، مما يجعل الروبوت أكثر أمانًا للاستخدام.
  • أداء أفضل: إذا كنت تريد أن يكون الروبوت أفضل في التعرف على الزهور، يمكن لـ SITH رفع "مستوى صوت" شفرات "الزهور" وخفض شفرات "السيارات".

الملخص

SITH هي أداة تسمح لنا بالتلصص داخل دماغ ذكاء اصطنا_بصري عبر قراءة دليل التعليمات الخاص به (الأوزان) بدلاً من مراقبته أثناء العمل. إنها تفكك أجزاء الدماغ المعقدة إلى مفاهيم بسيطة يمكن للبشر قراءتها (مثل "الأخضر" أو "الشاطئ"). وهذا يسمح لنا بإصلاح عادات الروبوت السيئة، وجعله أكثر أمانًا، وتحسين مهاراته — كل ذلك دون الحاجة إلى تغذيته بمزيد من البيانات أو إعادة تدريبه من الصفر.

إنه يشبه أخذ صندوق أسود، وفتحه، وإيجاد الأسلاك المحددة المسؤولة عن "الأحمر" و"الأزرق"، والقدرة على ضبطها باستخدام مفك براغي، وكل ذلك بينما لا يزال الروبوت يعمل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →