FA-Seg: A Fast and Accurate Diffusion-Based Method for Open-Vocabulary Segmentation
يُعد FA-Seg إطار عمل للتقسيم مفتوح المفردات، سريع ولا يتطلب تدريباً، يستفيد من عملية انتشار أحادية الخطوة مع آليات مطالبات مزدوجة، وتحسين انتباه هرمي، وقلب الاختبار لتحقيق دقة وكفاءة تبلغ أحدث ما توصل إليه العلم دون الحاجة إلى تعليقات توضيحية كثيفة.
تخيل أن لديك ألبوم صور سحري وعملاق (نموذج انتشار - diffusion model) تم تدريبه على ملايين الصور والأوصاف. هذا الألبوم ذكي للغاية، فإذا طلبت منه "رسم قطة"، سيعرف تماماً كيف تبدو القطة. لكن هناك عقبة، فعادةً ما يعرف هذا الألبوم كيفية إنشاء صور جديدة فقط، وليس كيفية إيجاد أشياء محددة داخل صورة موجودة تقدمها له.
يقدم بحث FA-Seg حيلة ذكية تحول هذا الألبوم من "مبدع" إلى أداة "باحثة" دون الحاجة لتعليمه أي شيء جديد. الأمر يشبه أخذ طاهٍ ماهر لا يعرف سوى الطبخ، ثم تطلب منه تحديد كل المكونات في طبق أحضرته إليه للتو، وبشكل فوري.
إليك كيف يعمل FA-Seg، مقسماً إلى خطوات بسيطة:
1. حيلة "الاسترجاع السريع" (Fast Inversion)
عادةً، لإيجاد أشياء في صورة باستخدام هذا الألبوم السحري، يتعين عليك القيام بعملية معقدة وبطيئة لعكس هندسة الصورة وإعادتها إلى "فضاء الأحلام" الخاص بالألبوم. وهذا يستغرق وقتاً طويلاً عادةً.
ابتكار FA-Seg: لقد وجدوا طريقاً مختصراً. فبدلاً من القيام بـ 20 أو 50 خطوة بطيئة لعكس العملية، استخدموا زر "تقديم سريع" خاص (يسمى 2-Rectified Flow) يقوم بذلك في خطوتين فقط (خطوة للأمام وخطوة للخلف).
التشبيه: تخيل أنك تحاول "إلغاء خبز" كعكة. عادةً، عليك تفكيكها بعناً طبقة تلو الأخرى. FA-Seg يشبه امتلاك آلة زمن تحول الكعكة فوراً إلى دقيق وبيض وسكر في طرفة عين.
2. "الطلب المزدوج" (Dual-Prompt)
لإخبار الألبوم بما يجب أن يبحث عنه، عادةً ما تقول فقط: "هذه صورة لشارع". لكن الألبوم قد يرتبك بشأن الأجزاء المهمة في هذا الشارع.
ابتكـار FA-Seg: يستخدمون وصفين في وقت واحد:
وصف القصة (The Story Prompt): وصف عام للصورة (مثل: "شارع مزدحم بالسيارات"). هذا يساعد الألبوم على فهم المشهد.
وصف القائمة (The List Prompt): قائمة محددة بالأشياء التي تريد إيجادها (مثل: "حافلة، دراجة نارية، خروف").
التشبيه: فكر في الأمر كأنك تعطي مرشداً سياحياً تعليمات مزدوجة: "هذه هي المدينة التي نحن فيها" (القصة) وَ "هذه قائمة المعالم المحددة التي يجب عليك الإشارة إليها" (القائمة). هذا يمنع المرشد من التشتت بأشياء لا تهمك.
3. "عدسة الزووم" للتحسين (HARD)
عندما ينظر الألبوم إلى الصورة، فإنه يراها من خلال "عدسات" أو مستويات زووم مختلفة.
الزووم المنخفض: يرى الصورة الكبيرة (هناك حافلة)، لكن الحواف تكون ضبابية.
الزووم العالي: يرى التفاصيل الدقيقة (نسيج الحافلة)، لكنه قد يرتبك بشأن مكان بدء الحافلة ونهايتها بالضبط.
ابتكار FA-Seg: لديهم طريقة تسمى HARD (التحسين الهيكلي للانتباه). تعمل مثل محرر ذكي يأخذ رؤية "الصورة الكبيرة" ورؤية "التفاصيل الدقيقة" ويمزجهما معاً بشكل مثالي. إنها تستخدم "هيكل" الصورة لتوضيح "معنى" الصورة.
التشبيه: الأمر يشبه النظر إلى خريطة. شخص يخبرك "المنتزه في الشمال"، وآخر يخبرك "المنتزه يحتوي على نافورة". يقوم FA-Seg بدمج هذين الوصفين لرسم حدود حادة ومثالية للمنتزه على خريطتك.
4. "اختبار المرآة" (Test-Time Flipping)
أحياناً، قد يرتبك النموذج إذا كانت الصورة موجهة بطريقة معينة.
ابتكار FA-Seg: يقوم بتشغيل العملية مرتين: مرة على الصورة الأصلية، ومرة على نسخة معكوسة (مرآتية) من الصورة. ثم يقوم بمتوسط النتائج.
التشبيه: الأمر يشبه التحقق من انعكاسك في المرآة للتأكد من عدم وجود بقايا طعام بين أسنانك. إذا اتفق "أنت الحقيقي" و"أنت في المرآة" على موقع الطعام، يمكنك التأكد بنسبة 100% من وجوده. هذا يجعل النتيجة النهائية أكثر موثوقية.
لماذا يعد هذا أمراً هاماً؟
السرعة: لأن العملية تتطلب خطوتين فقط وتتم معالجة جميع العناصر في "وصف القائمة" في وقت واحد، فهي سريعة للغاية. يمكنها إيجاد حافلة، ودراجة نارية، وخروف في ثانية واحدة.
لا حاجة للتدريب: معظم الطرق الأخرى تتطلب منك تغذية الكمبيوتر بآلاف الصور المصنفة لتعليمه كيف يبدو "الخروف" أو "الحافلة". أما FA-Seg فيستخدم المعرفة التي يمتلكها النموذج بالفعل من تدريبه على الإنترنت. إنه "خالٍ من التدريب" (Training-free).
الدقة: هو لا يخمن فحسب؛ بل يرسم حدوداً دقيقة جداً حول الأشياء، حتى لو كانت مخفية خلف أشياء أخرى أو تبدو كأنها جزء من الخلفية (تمويه).
الخلاصة
FA-Seg هو طريقة سريعة، مجانية، ودقيقة لإخبار الكمبيوتر: "ابحث عن كل الكلاب والسيارات والأشجار في هذه الصورة"، دون الحاجة لتعليم الكمبيوتر أي شيء جديد. يفعل ذلك باستخدام "آلة زمن" لعكس هندسة الصورة، و"وصف مزدوج" لتركيز الانتباه، و"محرر ذكي" لتوضيح الحواف، كل ذلك مع التحقق من عمله في المرآة لضمان المثالية.
إليك ملخص تقني مفصل لورقة البحث بعنوان "FA-Seg: طريقة تعتمد على الانتشار (Diffusion) سريعة ودقيقة للتجزئة مفتوحة المفردات (Open-Vocabulary Segmentation)."
1. بيان المشكلة
تهدف التجزئة الدلالية مفتوحة المفردات (OVSS) إلى تجزئة الكائنات في الصور بناءً على فئات نصية عشوائية دون الحاجة إلى تسميات دقيقة على مستوى البكسل لكل فئة ممكنة.
محدودية الطرق الحالية:
نماذج الرؤية واللغة (مثل CLIP): رغم فعاليتها في التعرف بأسلوب "التعلم الصفري" (zero-shot)، إلا أنها تعتمد على تضمينات (embeddings) عالمية للصورة والنص، مما يؤدي غالباً إلى دقة مكانية ضعيفة وحدود ضبابية على مستوى البكسل.
النماذج القائمة على الانتشار (Diffusion-Based Models): بينما تقوم هذه النماذج بتشفير الميزات المكانية الدقيقة بشكل طبيعي عبر آليات الانتباه (attention mechanisms)، إلا أن الطرق الحالية تعاني غالباً من تكاليف حوسبة عالية. تتطلب العديد منها عمليات استنتاج متعددة لكل فئة، أو تحسيناً مكثفاً، أو توليد بيانات اصطناعية، مما يخلق مقايضة بين جودة التجزئة وكفاءة الاستنتاج.
الفجوة: هناك حاجة ماسة لطريقة OVSS خالية من التدريب (training-free) تحقق دقة تجزئة عالية (دقة مكانية دقيقة) مع الحفاظ على كفاءة حوسبية مناسبة للنشر في العالم الحقيقي.
2. المنهجية: FA-Seg
إن FA-Seg هو إطار عمل خالٍ من التدريب يستفيد من نماذج الانتشار (Text-to-Image) المدربة مسبقاً (تحديداً Stable Diffusion) لإجراء التجزئة في عملية استنتاج واحدة. يتكون خط الإنتاج من ثلاث مراحل رئيسية:
أ. بناء المطالبات المزدوجة (Dual-Prompt Construction)
لتمكين كل من إعادة بناء الصورة بدقة واستخراج الانتباه الخاص بالفئة، يقوم FA-Seg ببناء مطالبتين متكاملتين:
مطالبة الوصف (Caption Prompt - P): يتم إنشاؤها بواسطة نموذج وصف صور (مثل BLIP) لتوجيه عملية العكس (DDIM inversion) لإعادة بناء الصورة المدخلة.
مطالبة الفئة (Class Prompt - P′): قائمة من فئات الكائنات المرشحة (يتم إنشاؤها عبر TagCLIP + BLIP) تُلحق بالوصف.
الآلية: يستخدم نموذج الانتشار P لإعادة البناء، ولكنه يستخدم P′ لتوليد خرائط انتباه متقاطع (cross-attention maps) مخصصة للفئات المرشحة. هذا يسمح للنموذج بالتركيز على مفاهيم دلالية محددة دون الحاجة لإعادة استنتاج تكراري.
ب. العكس السريع واستخراج الانتباه
العكس السريع (Fast Inversion): بدلاً من عملية DDIM inversion متعددة الخطوات القياسية، يستخدم FA-Seg نموذج 2-Rectified Flow (2-RF) المقطر. يسمح هذا النموذج المقطر بإعادة بناء دقيق للصورة في عملية (1+1)-step (خطوة واحدة للأمام وخطوة واحدة للخلف)، مما يقلل وقت الاستنتاج بشكل كبير.
استخراج الانتباه: خلال عملية إزالة الضجيج (denoising)، تستخرج الطريقة:
خرائط الانتباه المتقاطع (Cross-Attention Maps): التي تربط الرموز النصية (من مطالبة الفئة) بمناطق الصورة.
خرائط الانتباه الذاتي (Self-Attention Maps): التي تلتقط البنية المكانية الداخلية والتشابهات الزوجية للصورة.
يتم استخراج هذه الخرائط عبر دقات (resolutions) متعددة (r∈{8,16,32,64}).
ج. طريقة صقل الانتباه الهرمي (HARD)
لإنتاج أقنعة (masks) عالية الجودة، يقوم FA-Seg بدمج خرائط الانتباه من دقات مختلفة:
دمج الانتباه المتقاطع: يتم رفع دقة خرائط الانتباه المتقاطع من الدقات المختلفة وتجميعها باستخدام مجموع مرجح (weighted sum). يتم إعطاء وزن أعلى للدقات المنخفضة (مثل 16) للسياق الدلالي، بينما يتم خفض وزن الدقات الأعلى لتقليل الضجيج.
صقل الانتباه الذاتي: يتم صقل خريطة الانتباه المتقاطع المدمجة باستخدام مصفوفات التقارب في الانتباه الذاتي (self-attention affinity matrices). توفر خرائط الانتباه الذاتي التفاصيل الهيكلية (الحدود والأشكال) التي يفتقر إليها الانتباه المتقاطع. تقوم الطريقة بتحويل تنسيرات (tensors) الانتباه الذاتي لتتطابق مع دقة خريطة الانتباه المتقاطع وتطبقها كأوزان ضربية لزيប حدة حدود الكائنات.
قلب الاختبار (Test-Time Flipping - TTF): لتحسين الاتساق المكاني، تُكرر العملية على نسخة مقلوبة أفقياً من الصورة المدخلة. يتم إعادة محاذاة خرائط الانتباه الناتجة ومتوسطها مع الخرائط الأصلية لتقليل الضجيذ وتحسين المتانة.
3. المساهمات الرئيسية
استنتاج موحد في دورة واحدة: على عكس الطرق السابقة التي تتطلب عمليات استنتاج منفصلة لكل فئة، يقوم FA-Seg بتوليد أقنعة التجزئة لـ جميع الفئات المرشحة في وقت واحد في عملية استنتاج واحدة (1+1)-step.
آلية المطالبة المزدوجة: استراتيجية مبتكرة تفصل بين مطالبة إعادة البناء ومطالبة الوعي بالفئة، مما يمكن نموذج الانتشار من استخراج خرائط انتباه تمييزية لفئات محددة دون فقدان دقة الصورة.
الصقل الهرمي للانتباه (HARD): استراتيجية دمج متعددة المقاييس تجمع بين الانتباه المتقاطع (للتحديد الدلالي) والانتباه الذاتي (للصقل الهيكلي) عبر دقات مختلفة لتحقيق حدود دقيقة للكائنات.
كفاءة خالية من التدريب: لا تتطلب الطريقة أي ضبط دقيق (fine-tuning)، ولا توليد بيانات اصطناعية، وتستهلك موارد حوسبية ضئيلة، محققة أداءً يضاهي أحدث ما توصل إليه العلم (SOTA) في أقل من ثانية واحدة من الاستنتاج.
4. النتائج التجريبية
قام المؤلفون بتقييم FA-Seg على ثلاث مجموعات بيانات قياسية: PASCAL VOC، و PASCAL Context، و COCO Object.
الأداء (mIoU):
حقق FA-Seg متوسط mIoU قدره 43.8% عبر جميع مجموعات البيانات الثلاث.
حقق رقماً قياسياً جديداً (SOTA) للطرق القائمة على الانتشار الخالية من التدريب، متفوقاً على المنافسين مثل InvSeg (42.4%)، و DiffSegmentor (41.8%)، والعديد من طرق CLIP.
وقت الاستنتاج:0.36 ثانية لكل صورة على وحدة معالجة رسومات RTX 4090. وهذا أسرع بكثير من InvSeg (7.9 ثانية على H100) و DiffSegmentor (الذي يتناسب وقته مع عدد الفئات).
الذاكرة: يستهلك 13.4 جيجابايت فقط من ذاكرة الفيديو (VRAM)، مقارنة بـ 32.4 جيجابايت لـ InvSeg.
دراسات الاستئصال (Ablation Studies):
أدى إزالة صقل الانتباه الذاتي إلى أكبر انخفاض في الأداء (-15.1%)، مما يثبت دوره الحاسم في الدقة المكانية.
تفوق الدمج المرجح لخرائط الدقات المتعددة على الدمج المتوسط البسيط.
أثبت مزيج TagCLIP+BLIP لتوليد الفئات المرشحة أنه الأكثر متانة.
5. الأهمية والتأثير
سد الفجوة: نجح FA-Seg في سد الفجوة بين جودة التجزئة وكفاءة الاستنتاج، مبرهناً على أن التجزئة عالية الدقة مفتوحة المفردات لا تتطلب تدريباً ثقيلاً أو تحسيناً متعدد الخطوات.
النشر العملي: من خلال تقليل وقت الاستنتاج إلى أقل من ثانية وتقليل استخدام الذاكرة إلى حوالي 13 جيجابايت، يجعل FA-Seg التجزئة مفتوحة المفردات في الوقت الفعلي ممكناً للتطبيقات الواقعية (مثل الروبوتات، والقيادة الذاتية، والأدوات التفاعلية).
أساس للأعمال المستقبلية: تضع ورقة البحث حجر أساس قوي لتجزئة الانتشار الخالية من التدريب، مما يشير إلى أن التحسينات المستقبلية يمكن أن تركز على التوليد التكيفي للمرشحين والتجزئة على مستوى المثيل (instance-level).
في الختام، يمثل FA-Seg تقدماً كبيراً في مجال التجزئة مفتوحة المفردات من خلال الاستفادة من القدرات المكانية المتأصلة في نماذج الانتشار عبر إطار عمل عالي التحسين، وخالٍ من التدريب، وفعال حوسبياً للغاية.