← أحدث الأبحاث
🤖 AI

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

تقدم هذه الورقة أول إطار عمل لتتبع الدوائر الشفاف في نماذج الرؤية واللغة، باستخدام المحولات (transcoders) ورسوم العزو البيانية للكشف عن الدوائر السببية المسؤولة عن الاستدلال متعدد الوسائط الهرمي والارتباطات عبر الوسائط والتحقق منها والتحكم فيها.

المؤلفون الأصليون: Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

نُشر 2026-02-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً للغاية يمكنه النظر إلى صورة والإجابة على أسئلة حولها، تماماً مثل البشر. تسأله: "كم إصبعاً يرفع هذا الشخص؟" فيجيب: "خمسة". ولكن إذا سألته عن يد بها ستة أصابع، فقد يظل يقول "خمسة" لأنه مرتبك.

لفترة طويلة، تعاملنا مع هذه الروبوتات (التي تسمى نماذج الرؤية واللغة أو VLMs) كأنها صناديق سوداء. نحن نعرف ما يدخل إليها (صورة وسؤال) وما يخرج منها (إجابة)، ولكن ليس لدينا أدنى فكرة عما يحدث داخل الصندوق. الأمر يشبه محاولة فهم كيفية عمل محرك السيارة من خلال النظر فقط إلى عجلة القيادة ودواسة الوقود.

تقدم هذه الورقة البحثية طريقة جديدة لـ "رفع غطاء المحرك" ورؤية المحرك وهو يعمل. لقد بنى المؤلفون إطار عمل لـ "تتبع الدوائر" يسمح لنا برؤية كيف يربط الروبوت بين ما يراه وما يفكر فيه بدقة.

إليك كيف فعلوا ذلك، مشروحاً ببعض التشبيهات من الحياة اليومية:

1. "المترجم" (Transcoders)

داخل عقل الروبوت، تُخزن المعلومات بلغة فوضوية ومشوشة لا يفهمها إلا الآلة. الأمر يشبه كومة ضخمة من قطع "الليغو" حيث تختلط كل الألوان معاً، وقد تمثل قطعة واحدة "اللون الأحمر"، و"سيارة"، و"سريع" في آن واحد. هذا يجعل من المستحيل معرفة ما يفكر فيه الروبوت حقاً.

بنى الباحثون أداة خاصة تسمى Transcoder. فكر في هذا كـ مترجم عالي التقنية أو آلة فرز.

  • يأخذ تلك الكومة الفوضوية من قطع الليغو.
  • يقوم بفرزها بحيث يكون لكل قطعة معنى واحد واضح (على سبيل المثال: قطعة واحدة هي "أحمر" فقط، وأخرى هي "عجلة" فقط).
  • الآن، بدلاً من الفوضى المشوشة، أصبح لدينا مكتبة منظمة ونظيفة من الأفكار المحددة.

2. "شجرة العائلة" (Attribution Graphs)

بمجرد فرز الأفكار، أراد الباحثون معرفة: كيف ينتقل الروبوت من "رؤية صورة للمريخ" إلى "التفكير في مكوك فضائي"؟

لقد رسموا شجرة عائلة (أو مخطط تدفق) يسمى Attribution Graph.

  • تخيل محققاً يتتبع إشاعة ما. يبدأ من الإجابة النهائية ("مكوك فضائي") ويعمل بشكل عكسي.
  • يسأل: "من أخبرك بذلك؟" يوضح الرسم البياني أن فكرة معينة عن "المريخ" نقلت رسالة إلى فكرة "الكوكب الأحمر"، والتي نقلت بدورها رسالة إلى فكرة "المكوك الفضائي".
  • هذه الخريطة توضح سلسلة السبب والنتيجة. إنها تثبت أن الروبوت لم يتكهن فحسب؛ بل اتبع مساراً محدداً من المنطق.

3. "جهاز التحكم عن بعد" (Intervention)

الجزء الأكثر إثارة هو أنهم لم يكتفوا بالمراقبة فقط؛ بل عدّلوا النظام لإثبات نظريتهم. هذا يشبه امتلاك جهاز تحكم عن بعد لعقل الروبوت.

  • التجربة: وجدوا "الدائرة" المحددة (مسار الأفكار) التي يستخدمها الروبوت للتعرف على صورة المريخ.
  • المفتاح: قاموا بإيقاف إشارة "المريخ" وتشغيل إشارة "الأرض" في نفس المكان.
  • النتيجة: فجأة، توقف الروبوت عن التحدث عن المريخ وبدأ يتحدث عن الأرض، رغم أن الصورة كانت لا تزال للمريخ!
  • ماذا يعني هذا: هذا يثبت أن الدائرة التي وجدوها هي السبب الحقيقي وراء تلك الإجابة. إذا كسرت الدائرة، ينكسر السلوك.

ماذا اكتشفوا؟

باستخدام هذه "الرؤية بالأشعة السينية" الجديدة، اكتشفوا أشياء رائعة حول كيفية تفكير هذه الروبوتات:

  • خط التجميع: يعالج الروبوت الصور في خطوات. في الطبقات الدنيا (الطبقات المبكرة)، يرى فقط الأشكال والألوان (مثل "دائرة حمراء"). ومع انتقال المعلومات للأعلى، يبدأ في دمج هذه الأشكال في مفاهيم (مثل "كوكب"). وتحدث "اللمسة السحرية" لدمج الرؤية واللغة في الطبقات الوسطى والعليا.
  • خطأ "الستة أصابع": لماذا يخطئ الروبوت أحياناً في عد الأصابع؟ وجدوا أن "عيون" الروبوت (جزء الرؤية) ترسل إشارة قوية تقول "يد"، ويصبح "عقل" الروبوت (جزء اللغة) متحمساً جداً لكلمة "يد" لدرجة أنه يتجاهل العدد الفعلي. الأمر يشبه طالباً يعرف أن الإجابة هي "5" لأن هذا ما يسأل عنه المعلم عادةً، لذا يتجاهل حقيقة وجود 6 أصابع في الصورة.
  • الارتباطات الخفية: لدى الروبوت روابط سرية. إذا عرضت عليه صورة للمريخ، فهو لا يفكر فقط في "كوكب"؛ بل يضيء أيضاً دائرة "المكوك الفضائي" في عقله، حتى لو لم تسأل عن مكوك. إنه يشبه رؤية صورة لشاطئ وفجأة تفكر في "المثلجات" لأن عقلك يربط بين الاثنين.

لماذا يهمنا هذا؟

قبل هذا، إذا ارتكب الروبوت خطأً، كان علينا التخمين لِمَ حدث ذلك. أما الآن، فيمكننا النظر إلى خريطة الدائرة والقول: "آه، الروبوت مرتبك لأنه يخلط بين إشارة 'اليد' وإشارة 'العد'".

هذه خطوة هائلة نحو جعل الذكاء الاصطناعي شفافاً، وموثوقاً، وآمناً. إنه الفرق بين الثقة العمياء بصندوق أسود وبين فهم المحرك جيداً بما يكفي لإصلاحه عندما يتعطل. لقد جعل المؤلفون أدواتهم مفتوحة المصدر، لكي يتمكن العلماء الآخرون من البدء في تفكيك وفهم هذه الآلات المعقدة أيضاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →