← أحدث الأبحاث
💻 computer science

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

تقدم هذه الورقة البحثية إطار عمل EAGLE، وهو إطار عمل خفيف الوزن يعمل كصندوق أسود يفسر التوليد الذاتي للرموز (tokens) في النماذج اللغوية الكبيرة متعددة الوسائط من خلال عزو القرارات إلى مناطق بصرية محددة وقياس التوازن بين الأدلة البصرية والمنطلقات اللغوية، مما يوفر دقة في التوطين والأمانة والتشخيص من الهلوسة بتكلفة حوسبية أقل.

المؤلفون الأصليون: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

نُشر 2026-03-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقًا آليًا ذكيًا جدًا، ولكنه غامض بعض الشيء، يدعى EAGLE. هذا الروبوت بارع في النظر إلى الصور ووصفها بجمل (مثل، "قطة تجلس على شجرة موز"). ولكن في بعض الأحيان، يختلق أشياء من خياله (هلوسات)، أو يكون من الصعب معرفة لماذا قال ما قاله.

تقدم هذه الورقة البحثية EAGLE، وهي أداة جديدة مصممة لتكون "محققًا" لهذه الروبوتات الذكية. وهي تجيب على سؤالين كبيرين:

  1. أين نظر الروبوت؟ (أي جزء من الصورة جعله يقول "قطة"؟)
  2. على ماذا اعتمد؟ (هل رأى القطة حقًا، أم أنه خمن فقط لأنها جملة شائعة؟)

إليك شرح مبسط لكيفية عمله، باستخدام بعض التشبيهات الممتعة.

1. المشكلة: لغز "الصندوق الأسود"

تخ طيلب من طاهٍ أن يطبخ طبقًا. يقدم لك الوجبة لذيذة، لكنه لا يخبرك ما هي المكونات التي استخدمها أو بترتيب ماذا استخدمها. قد تشك في أنه استخدم الملح، ولكن ربما استخدم السكر بدلاً من ذلك.

  • نماذج اللغات الكبيرة متعددة الوسائط (MLLMs) هي مثل ذلك الطاهي. تنظر إلى صورة وتكتب قصة.
  • المشكلة: أحيانًا تكذب (تهلوس). إذا قالت، "هناك كلب في الصورة"، بينما لا يوجد كلب، فنحن بحاجة لمعرفة لما لماذا ظنت ذلك. حاولت الأدوات القديمة التخمين من خلال النظر إلى موجات دماغ الطاهي (الرياضيات الداخلية)، لكن ذلك كان فوضويًا وغالبًا ما يكون خاطئًا.

2. الحل: محقق "قطع الليغو"

لا يحتاج EAGLE للنظر داخل دماغ الروبوت. إنه يعامل الروبوت كـ صندوق أسود (لا يمكنك رؤية ما بداخله، أنت فقط تضع أشياء وتخرج أشياء).

كيف يعمل:
تخيل أن الصورة عبارة عن أحجية ضخمة مكونة من 100 قطعة صغيرة من "الليغو" (قطع صغيرة من الصورة).

  • الخطوة 1: اختبار عصب العين (اختبار عصب العين). يقوم EAGLE بتغطية معظم قطع الليغو، تاركًا عددًا قليلًا فقط مرئيًا. ثم يسأل الروبوت: "هل لا تزال قادرًا على وصف الصورة؟"
  • الخطوة 2: درجة "الاستبصار" (اختبار "الكفاية"). يحاول EAGLE العثور على أصغر مجموعة من قطع الليغو التي، إذا عُرضت على الروبوت، ستجعله يقول نفس الجملة تمامًا كما فعل من قبل.
    • تشبيه: إذا عرضت على الروبوت فقط "أذن القطة" و"ذيلها"، ولا يزال يقول "قطة"، فإن هذه هي قطع الاستبصار. إنها كافية للقيام بالمهمة.
  • الخطوة 3: درجة "الضرورة" (اختبار "الحاجة"). يأخذ EAGLE بعد ذلك صورة كاملة ويبدأ في إزالة القطع واحدة تلو الأخرى. يراقب ليرى أي قطعة، عند إزالتها، تجعل الروبوت يتوقف عن قول "قطة".
    • تشبيه: إذا أزلت "جسم القطة" وفجأة قال الروبوت "أنا لا أرى شيئًا"، فإن تلك القطعة كانت ضرورية.

من خلال الجمع بين هذين الاختبارين، ينشئ EAGLE خريطة حرارية. فهي تسلط الضوء على الأجزاء المحددة من الصورة التي كانت مهمة بالفعل.

3. التحول المفاجئ: "التخمين" مقابل "الرؤية"

هذا هو الجزء الأكثر ذكاءً. يكتشف EAGLE أيضًا ما إذا كان الروبوت يرى الشيء أو مجرد يخمن بناءً على ما يعرفه عن اللغة.

  • السيناريو: يقول الروبوت، "الرجل يمسك بـ كوب قهوة".
  • الاختبار: يكشف EAGLE الصورة للروبوت ببطء.
    • إذا كان الروبوت "متعلمًا بصريًا": بمجرد ظهور كوب القهوة، ترتفع ثقة الروبوت بشكل هائل. إنه يحتاج لرؤية الكوب ليقول الكلمة.
    • إذا كان الروبوت "مخمنًا لغويًا": يقول الروبوت "كوب قهوة" حتى عندما تكون الصورة سوداء تمامًا! إنه يخمن فقط لأن "الرجل" و"كوب القهوة" غالبًا ما يجتمعان في القصص.
  • النتيجة: يمكن لـ EAGLE أن يخبرك: "مهلًا، هذه الكلمة استندت إلى ما رآه (الدليل البصري)، ولكن تلك الكلمة الأخرى كانت مجرد تخمين محظوظ (الأولوية اللغوية)".

4. لماذا يعد هذا أمرًا مهمًا جدًا؟

اختبرت الورقة البحثية EAGLE على العديد من النماذج الشهيرة للذكال الاصطناوي ووجدته أفضل محقق حتى الآن.

  • إنه أكثر دقة: غالبًا ما كانت الأدوات القديمة تشير إلى الأجزاء الخاطئة من الصورة (مثل تسليط الضوء على السماء بينما يتحدث الروبوت عن سيارة). أما EAGLE فيشير إلى السيارة.
  • يكشف الأكاذيب: عندما يهلوس الروبوت (يختلق كلبًا ليس موجودًا)، يمكن لـ EAGLE تحديد الجزء الغريب من البكسلات الذي أربك الروبوت بدقة. إنه يشبه العثور على "الدليل القاطع" الذي تسبب في الكذبة.
  • يوفر المال: لا يحتاج إلى كمبيوتر باهظ الثمن لتشغيله. إنه خفيف الوزن وفعال.

الملخص

فكر في EAGLE كـ مترجم صادق للذكاء الاصطناي.

  • قبل ذلك، كان علينا الوثوق بالذكاء الاصطناعي بشكل أعمى.
  • الآن، يسمح لنا EAGLE أن نقول، "حسنًا، أنا أرى لماذا قلت ذلك. لقد رأيت شجرة الموز، لذا ذكرت الموز. لكنك لم ترَ قطة، فلماذا قلت أن هناك واحدة؟ دعنا ننظر إلى هذه البقعة الضبابية التي أربكتك".

إنه يجعل الذكاء الاصطناعي أكثر شفافية، وموثوقية، وأسهل في الإصلاح عندما يرتكب الأخطاء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →