← أحدث الأبحاث
💻 computer science

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

تُعد VespaSeg مساراً معالجةً نموذجياً وفعالاً في استهلاك الموارد لتقسيم التعبيرات المرجعية، حيث يجمع بين أدوات الربط بين الرؤية واللغة المدمجة (مثل نموذج Florence-2-base المُعدّل) ونموذج MobileSAM لتحقيق دقة وسرعة عاليتين مع تقليل التكاليف الحسابية بشكل كبير مقارنة بالنماذج الضخمة أحادية البنية.

المؤلفون الأصليون: Savindu Dilshan Wickramasinghe (University of Moratuwa)

نُشر 2026-08-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Savindu Dilshan Wickramasinghe (University of Moratuwa)

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على صديق معين في حفلة موسيقية صاخبة ومزدحمة. لا يمكنك مجرد الصراخ "ابحث عن صديقي!" وتوقع أن يعرف رجل الأمن من تقصد. عليك أن تعطي وصفاً: "الشخص الذي يرتدي قبعة حمراء ويمسك جيتاراً أزرق". هذا هو التحدي اليومي للحواسيب التي تحاول فهم لغة البشر. في عالم الذكاء الاصطناญ، يُسمى هذا "تجزئة التعبير المرجعي" (Referring Expression Segmentation). إنها الخدعة السحرية حيث ينظر الكمبيوتر إلى صورة، ويقرأ جملة مثل "الكلب الذي يطارد الكرة"، ثم يرسم تحديداً دقيقاً حول ذلك الكلب فقط، بكسل تلو الآخر.

لفترة طويلة، كانت الروبوتات التي تقوم بهذه المهمة تشبه الدبابات الضخمة والثقيلة. كانت ذكية للغاية ولكنها تتطلب كميات هائلة من الكهرباء وأجهزة كمبيوتر خارقة للتشغيل، مما يجعلها بطيئة ومكلفة للاستخدام في الحياة الواقعية، مثل استخدامها في مكنسة روبوت أو تطبيق هاتف. السؤال الكبير الذي يطرحه الباحثون هو: هل يمكننا بناء نظام يكون بنفس الجودة في العثور على الأشياء، ولكنه صغير وسريع وخفيف بما يكفي ليحمله المرء في جيبه؟ يتعمق هذا البحث في تلك المشكلة تحديداً، محاولاً استبدال الدبابات الثقيلة بفريق يتكون من جزأين رشيقين يعملان معاً لحل اللغز دون كسر الميزانية.


الرقصة ذات الخطوتين: VespaSeg

تعرف على VespaSeg. فكر فيه كفريق ذكي مكون من شخصين يحلان لغزاً بدلاً من محقق واحد ضخم ومثقل بالأعباء. أدرك المؤلف أن محاولة القيام بكل شيء في عقل واحد ضخم أمر ثقيل جداً. لذا، قام بتقسيم المهمة إلى خطوتين متميزتين: التوطين (Grounding) والتجزئة (Segmenting).

الخطوة 1: الكشاف (التوطين)
أولاً، تحتاج إلى معرفة أين يوجد الشيء. تخيل كشافاً في لعبة فيديو يتلقى أمراً نصياً: "ابحث عن صندوق الكنز". لا يحتاج الكشاف لمعرفة شكل الصندوق بدقة عالية بعد؛ يحتاج فقط إلى الإشارة بإصبعه ورسم مربع تقريبي حوله. في VespaSeg، يتم ذلك بواسطة نموذج ذكاء اصطناعي "مدمج" (عقل صغير وفعال) يقرأ جملتك ويرسم صندوق إحاطة (bounding box). الأمر يشبه صراخ الكشاف: "إنه في تلك الزاوية!".

الخطوة 2: المخطط (التجزئة)
بمجرد رسم المربع، يتولى متخصص ثانٍ المهمة. هذا هو MobileSAM، وهو نموذج مصمم خصيصاً ليكون خفيفاً وسريعاً. مهمته الوحيدة هي النظر إلى ذلك المربع والقول: "حسناً، أنا أرى المربع. الآن، دعني أرسم الحواف الدقيقة للكائن الموجود بداخله". إنه يحول ذلك المربع التقريبي إلى قناع (mask) دقيق للغاية على مستوى البكسل.

جمال هذا الإعداد هو أنه إذا كان لديك صورة تحتوي على عشرة أشياء مختلفة لتجدها، فإن "المخطط" سيضطر فقط للقيام بالعمل الشاق لتحليل الصورة مرة واحدة. فهو يحفظ "ذاكرة الصورة" (image embedding) ويعيد استخدامها لكل صندوق جديد يرسمه "الكشاف". الأمر يشبه التقاط صورة لغرفة مرة واحدة، ثم الإشارة فقط إلى قطع الأثاث المختلفة في نفس الصورة دون الحاجة لإعادة تصوير الغرفة بأكملها في كل مرة.

ما وجدوه: السرعة مقابل الحجم

اختبر الباحثون هذا الفريق باستخدام "كشافين" (نماذج توطين) مختلفين لمعرفة أيهما الشريك الأفضل. قارنوا بين عدة خيارات، بما في ذلك Florence-2 و Moondream2.

إليك المفاجأة الكبيرة التي كشفوا عنها: الأكبر ليس دائماً الأفضل.

لقد اختبروا نسخة "كبيرة" (Large) من نموذج Florence-2 مقابل نسخة "أساسية" (Base - أصغر) من نفس النموذج. قد تعتقد أن النموذج الأكبر والأكثر قوة سيفوز في كل مرة. ولكن في هذا الإعداد المحدد، حقق نموذج Florence-2-base الأصغر أداءً أفضل قليلاً!

  • الدقة: حقق النموذج الأصغر درجة 73.73 (مقاسة بمتوسط التقاطع فوق الاتحاد، أو mIoU)، بينما سجل النموذج الأكبر 72.82.
  • السرعة: كان النموذج الأصغر أسرع بمقدار 1.70 مرة، حيث عالج 22.8 استعلاماً في الثانية مقارنة بوتيرة النموذج الأكبر الأبطأ.
  • الذاكرة: استخدم النموذج الأصغر ذاكرة أقل بمقدار 1.17 جيجابايت على بطاقة الرسوميات.

تبين أن هذا النوع من رقصة "التوطين ثم التجزئة"، كان الشريك الأصغر والأكثر رشاقة أكثر كفاءة ودقة من العملاق.

ضبط المحرك

لعب الفريق أيضاً بالإعدادات لمعرفة ما إذا كان بإمكانهم جعل النظام أسرع حتى دون فقدان الدقة. وجدوا خدعتين رائعتين:

  1. تقصير التعليمات: يقوم الذكاء الاصطناعي عادةً بتوليد ما يصل إلى 64 "توكن" (قطع صغيرة من البيانات) لوصف الصندوق. وجدوا أنه يمكنهم تقليص هذا العدد إلى 32 توكن فقط دون فقدان أي دقة. الأمر يشبه قولك للكشاف: "أعطني الإحداثيات فقط، دون ثرثرة إضافية".
  2. تدريب الأجزاء الصحيحة: استخدموا تقنية تسمى LoRA (التكيف منخفض الرتبة)، وهي تشبه تعليم الذكاء الاصطناعي حِيلاً جديدة عبر تعديل جزء ضئيل جداً من عقله (حوالي 1.63% من معاملاته) بدلاً من إعادة تدريب الشيء بأكل. ساعد هذا "المخطط" (MobileSAM) على أن يصبح أفضل بكثير في رسم الحواف، مما رفع درجته من 82.22 إلى 86.61 عندما يُعطى صناديق مثالية.

العقبة: عمل قيد التطوير

بينما النتائج مثيرة، فإن المؤلف حريص جداً على عدم الادعاء بأنهم حلوا مشاكل العالم. فهو يشير إلى بعض القيود المهمة:

  • الاختبار كان محدداً: لقد اختبروا مجموعة محددة من 3,811 زوجاً من (الصورة والجملة) (باستخذام الجملة الأولى فقط لكل كائن). وهذا يختلف عن مجموعات الاختبار الكاملة والمعيارية المستخدمة في الصناعة، والتي تحتوي على أكثر من 10,000 جملة. لذا، بينما تبدو الأرقام رائعة، قد تكون متفائلة بعض الشيء بالنسبة للعالم الحقيقي الفوضوي.
  • الأجهزة: أُجريت اختبارات السرعة على بطاقة رسوميات قوية جداً وباهظة الثمن (NVIDIA RTX 6000 Ada). وهم يعترفون بأننا لا نعرف بعد كيف سيعمل هذا على هاتف عادي أو روبوت صغير.
  • لا يوجد حل سحري: إذا أخطأ الطرف الأول (الكشاف) في رسم الصندوق، فلا يمكن للطرف الثاني (المخطط) إصلاح ذلك. النظام يكون بجودة أضعف حلقة فيه.

الخلاصة

يظهر لنا VespaSeg أننا لسنا بحاجة إلى ذكاء اصطناعي ضخم ونهم لفهم لغتنا والإشارة إلى الأشياء. من خلال تقسيم المهمة إلى خطوة "إيجاد الصندوق" وخطوة "رسم المخطط"، وباستخدام نماذج أصغر وأذكى، يمكننا الحصول على نتائج تقارب دقة العمالقة الكبار ولكنها تعمل بشكل أسرع وتستهلك طاقة أقل. إن هذا يشير إلى مستقبل يمكن لأجهزتك فيه فهم ما تقوله والإشارة بدقة إلى ما تقصده، دون الحاجة إلى حاسوب خارق في جيبك. ومع ذلك، قبل أن نقول إن هذا هو الحل النهائي، يحتاج الفريق إلى اختبار ذلك على مجموعات البيانات الكاملة والمعيارية وعلى أجهزة حقيقية ليروا مدى صموده تحت الضغط.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →