← أحدث الأبحاث
🤖 AI

LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models

تقترح هذه الورقة طريقة LVLM-COUNT، وهي منهجية مرجعية تعتمد على مبدأ "فرق تسد" لتعزيز قدرة النماذج اللغوية البصرية الكبيرة على عد أعداد كبيرة من الأشياء من خلال تفكيك المهام ومنع تقسيم الأشياء لتجنب العد المتكرر.

المؤلفون الأصليون: Muhammad Fetrat Qharabagh, Mohammadreza Ghofrani, Kimon Fountoulakis

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Muhammad Fetrat Qharabagh, Mohammadreza Ghofrani, Kimon Fountoulakis

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح ورقة البحث LVLM-Count، باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة: "أمين المكتبة المنهك"

تخيل أن لديك أمين مكتبة ذكي ومطلع للغاية (هذا هو نموذج اللغة والرؤية الكبير، أو LVLM). يمكن لأمين المكتبة هذا قراءة كتاب، أو النظر إلى صورة، وإخبارك بالضبط بما يحدث فيها. إنه بارع في فهم القصص المعقدة.

ومع ذلك، إذا سألته: "كم عدد التفاحات الحمراء في هذه السلة الضخمة؟" وكان هناك ثلاث تفاحات فقط، فسيجيب بشكل صحيح. ولكن إذا عرضت عليه سلة بها 300 تفاحة، فغالبًا ما سيصاب بالارتباك. قد يقول "298" أو "315".

لماذا؟ لأن نماذج الذكاء الاصطناعي الحالية بارعة في التعرف على الأشياء ولكنها سيئة جدًا في عدّ المجموعات الكبيرة. الأمر يشبه محاولة عدّ كل حبة رمل على الشاطئ بينما تنظر إلى الشاطئ بأكمله دفعة واحدة؛ حيث يصاب عقلك بالإرهاق والارتباك.

الحل: استراتيجية "فرق تسد"

أدرك مؤلفو هذا البحث أنه بدلًا من مطالبة أمين المكتبة بعدّ الشاطئ بأكمله دفعة واحدة، يجب أن نعطيه استراتيجية أفضل. وقد أطلقوا على طريقتهم اسم LVLM-Count.

فكر في الأمر كالتالي:

  1. النهج التقليدي: تقدم لأمين المكتبة صورة لملعب مزدحم وتسأله: "كم عدد الأشخاص الذين يرتدون قبعات زرقاء؟". يضيق عينيه، ويشعر بالدوار، ثم يخمن بشكل خاطئ.
  2. نهج LVLM-Count: تأخذ مقصًا وتقطع الصورة إلى قطع أصغر يمكن التعامل معها. تقدم لأمين المكتبة قطعة صغيرة واحدة وتسأله: "كم عدد القبعات الزرقاء هنا؟". ثم تفعل الشيء نفسه مع القطعة التالية. أخيرًا، تجمع كل الإجابات الصغيرة للحصول على المجموع الكلي.

يبدو هذا بسيطًا، ولكن هناك فخ كبير في هذه الخطة.

الفخ: "مشكلة بيتزا المقطعة"

إذا قمت فقط بقطع الصورة بخطوط مستقيمة (مثل تقطيع البيتزا)، فقد تقطع بالخطأ شخصًا يرتدي قبعة زرقاء إلى نصفين.

  • الخطأ: ينظر أمين المكتبة إلى الشريحة اليسرى ويرى "نصف قبعة". ينظر إلى الشريحة اليمنى ويرى "نصف قبعة" آخر. قد يعدهما كـ شخصين مختلفين بدلاً من شخص واحد. أو قد يرتبك ويفقد أحدهما تمامًا.

يُسمى هذا العد المزدوج أو التجزئة.

السر المبتكر: "القطع الواعي بالأجسام"

هنا تبرز الابتكارات الرئيسية للورقة البحثية. لم يستخدم المؤلفون مجرد مقصات مستقيمة، بل صنعوا آلة قطع ذكية.

  1. رصد الأهداف: أولاً، يستخدم النظام "راصدًا" (نموذج كشف) لتحديد مكان القبعات الزرقاء بدقة.
  2. رسم الخريطة: يقوم بإنشاء خريطة حيث تكون القبعات "عوائق" (مثل الصخور في النهر).
  3. تحديد المسار: يستخدم النظام بعد ذلك خوارزمية لتحديد المسار (مثل نظام GPS الذي يجد طريقًا حول الازدحام المروري) لرسم خطوط القطع. تُجبر الخطوط على الدوران حول القبعات، ولا تمر أبدًا خلالها.

التشبيه: تخيل أنك تقطع كعكة، ولكن عليك تجنب قطع الكرز الموجود فوقها. تقوم بتحريك السكين بعناية بحيث تقطع الكعكة بين حبات الكرز، مما يضمن بقاء كل حبة كرز كاملة في قطعة واحدة من الكيك.

كيف يعمل الأمر خطوة بخلف خطوة

  1. الاستماع: يقرأ الذكاء الاصطناعي سؤالك (على سبيل المثال: "عُد البيض البني").
  2. التكبير: يقوم بقص الصورة لعرض المنطقة التي تحتوي على البيض فقط، متجاهلًا بقية المطبخ.
  3. رسم خريطة البيض: يرسم حدودًا غير مرئية حول كل بيضة.
  4. القطع الذكي: يرسم خطًا عبر الصورة، لكن الخط ينحني ويلتف ليمر بين البيض، ولا يقطع أي بيضة إلى نصفين أبدًا.
  5. العد والجمع: يرسل هذه الصور الأصغر والأكثر أمانًا إلى أمين المكتبة (الذكاء الاصطناعي). يقوم أمين المكتبة بعدّ البيض في كل صورة صغيرة بسهولة. ثم يجمع النظام كل الإجابات للحصول على الإجابة النهائية.

لماذا يهم هذا الأمر؟

اختبرت الورقة البحثية هذه الطريقة على العديد من مجموعات البيانات الصعبة:

  • المشاهد المزدحمة: مثل مستعمرة بطاريق حيث تتكدس البطاريق فوق بعضها البعض.
  • الأجسام المعقدة: مثل عد رموز تعبيرية (Emojis) محددة تبدو متشابهة جدًا (مثل ساعة تظهر 2:30 مقابل 2:35).
  • وظائف العالم الحقيقي: مثل عد البراميل في مستودع أو الخلايا تحت المجهر.

النتيجة: لم يتحسن الذكاء الاصطناعي قليلاً فحسب، بل أصبح أفضل بشكل ملحوظ. لقد حول "المخمن المرتبك" إلى "عداد موثوق"، حتى بالنسبة لمئات الأجسام.

الخلاصة

تعلمنا هذه الورقة أنه عندما يعاني الذكاء الاصطناعي مع الأرقام الكبيرة، فنحن لا نحتاج بالضرورة إلى جعل الذكاء الاصطناعي "أذكى" (وهو أمر صعب ومكلف). بدلاً من ذلك، يمكننا جعل المهمة أسهل للذكاء الاصطناعي عن طريق تقسيم المشكلة والحرص على عدم كسر الأجسام التي نعدّها.

إنه الفرق بين طلب عد 500 عملة معدنية من صديق دفعة واحدة، وبين إعطائه صينية لفرزها في مجموعات من 10 عملات. الصديق هو نفسه، ولكن الطريقة هي التي تصنع الفارق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →