← أحدث الأبحاث
💻 computer science

RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models

يقدم RADSeg إطار عمل لتقسيم الصور مفتوح المفردات بنمط الصفر (zero-shot) يتميز بالكفاءة في المعلمات والحوسبة، وذلك عبر الاستفادة من نموذج RADIO التأسيسي مع آليات انتباه وتحسين مبتكرة، محققاً دقة هي الأفضل في فئتها تتجاوز النماذج الأكبر حجماً بكثير مع تقليل زمن الاستجابة وتكاليف الذاكرة بشكل كبير.

المؤلفون الأصليون: Omar Alama, Darshil Jariwala, Avigyan Bhattacharya, Seungchan Kim, Wenshan Wang, Sebastian Scherer

نُشر 2026-04-13
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Omar Alama, Darshil Jariwala, Avigyan Bhattacharya, Seungchan Kim, Wenshan Wang, Sebastian Scherer

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً (روبوت) فائق الذكاء يمكنه النظر إلى صورة وإخبارك بكل ما فيها. إذا سألته: "أين هي طاولة القهوة؟" سيشير إلى الطاولة. إذا سألته: "أين هو 'الكرسي الخشبي المغبر'؟" سيجده هو أيضاً. يسمى هذا التجزئة مفتوحة المفردات (Open-Vocabulary Segmentation).

ومع ذلك، فإن معظم الروبوتات الحالية تشبه أمين مكتبة مثقل بالأعباء. لكي يجد كتاباً معيناً (أو جسماً ما)، يتعين عليه:

  1. التحقق من موسوعة ضخمة وثقيلة (نموذج ذكاء اصطناعي هائل).
  2. النظر إلى صفحات الكتاب صفحة تلو الأخرى، وتمزيقها لقراءتها كلمة بكلمة (معالجة الصورة في أجزاء صغيرة وبطيئة).
  3. دمج كل تلك الملاحظات للوصول إلى تخمين.

هذا الأمر بطيء، ويستهلك الكثير من الذاكرة، وغالباً ما يتطلب حاسوباً خارقاً لتشغيله.

RADSeg هو المتدرب الذكي والبارع الذي يحل كل هذه المشكلات. إليك كيف يعمل، باستخدام تشبيهات بسيية:

1. صندوق الأدوات "الكل في واحد" (نموذج RADIO)

تستخدم معظم الروبوتات أدوات منفصلة لوظائف مختلفة: أداة للتعرف على الأشياء، وأخرى لفهم اللغة، وثالثة لتحديد الحواف. وعليها حمل كل هذه الأدوات الثقيلة معها.

يستخدم RADSeg نموذجاً يسمى RADIO. فكر في RADIO كأنه سكين سويسري متعدد الاستخدامات تم تدريبه بالفعل من قبل أفضل الخبراء في العالم. فهو يجمع بين معرفة:

  • أفضل متعرف على الأشياء (DINOv2).
  • أفضل قارئ للغة (CLIP/SigLIP).
  • أفضل محدد للحواف (SAM).

بدلاً من حمل ثلاث حقائب ظهر ثقيلة، يحمل RADSeg أداة واحدة خفيفة الوزن وعالية الكفاءة. وهذا هو سبب استخدامه لـ عدد أقل من المعلمات (ذاكرة أقل) وتشغيله بشكل أسرع.

2. "العناق الجماعي" (الانتباه التكراري ذاتي الارتباط - SCRA)

عندما ينظر الروبوت إلى صورة، فإنه غالباً ما يرى قطعة من "الخشب" وقطعة أخرى من "الخشب" ولا يدرك أنهما جزء من نفس الطاولة. يعاملهما كغرباء.

يستخدم RADSeg حيلة تسمى SCRA (الانتباه التكراري ذاتي الارتباط). تخيل الروبوت وهو ينظر إلى الصورة ويقول: "مهلاً، أنت تبدو وكأنك تنتمي لتلك القطعة الأخرى هناك! لنمسك بأيدي بعضنا البعض ونتفق على هويتنا."

إنه يجبر الأجزاء المتشابهة من الصورة على التحدث مع بعضها البعض والاتفاق على هويتها. وهذا يجعل الروبوت أفضل بكثير في رسم خطوط نظيفة حول الأشياء دون الحاجة لإعادة تدريبه.

3. "سماعات إلغاء الضجيج" (التجميع العالمي ذاتي الارتباط - SCGA)

لأن RADSeg ينظر إلى الصورة من خلال نوافذ صغيرة (مثل النظر من ثقب مفتاح)، فإنه قد يرتبك أحياناً عند الحواف حيث تلتقي النوافذ. قد يرى "شجرة" على اليس و"شجيرة" على اليمين، رغم أنها شجرة واحدة كبيرة.

يستخدم RADSeg تقنية SCGA (التجميع العالمي ذاتي الارتباط). فكر في هذا كأنه سماعات إلغاء الضوضاء. إنه يستمع إلى جميع النوافذ المختلفة، ويدرك أنها جميعاً تتحدث عن الشيء نفسه، ثم يقوم بتنعيم الارتباك. إنه يزيل "التشويش" ويجعل الصورة النهائية واضحة ومتسقة.

4. "لمسة الصقل والضبط الدقيق" (RADSeg+)

أحياناً، يحصل الروبوت على الشكل العام بشكل صحيح ولكن الحواف تكون غير دقيقة قليلاً. يمتلك RADSeg ترقية اختيارية تسمى +RADSeg.

هذا يشبه توظيف محرر محترف لمدة 5 دقائق فقط. فهو يستخدم جزءاً صغيراً ومتخصصاً من نموذج "Segment Anything" الشهير لشحذ وتوضيح حواف الأشياء. إنه فعال للغاية لدرجة أنه لا يضيف سوى وزن ضئيل جداً إلى حقيبة الظهر ولكنه يجعل النتيجة النهائية تبدو احترافية.

لماذا يعد هذا أمراً مهماً؟

  • السرعة: إنه أسرع بـ 4 مرات تقريباً من أفضل الطرق الحالية.
  • الحجم: هو أصغر بـ 2.5 مرة (أخف وزناً على هاتفك أو روبوتك).
  • الذكاء: إنه في الواقع يحقق نتائج أفضل من الطرق التي تستخدم نماذج حواسيب فائقة ضخمة وثقيلة.

الخلاصة:
يثبت RADSeg أنك لست بحاجة إلى عقل ضخم وبطيء لفهم العالم. من خلال استخدام أداة موحدة وذكية (RADIO) وتعليمه "التحدث إلى نفسه" للاتفاق على ما يراه، يمكنك بناء روبوت سريع، صغير، وذكي للغاية في فهم الأوصاف المفتوحة للعالم. إنه الفرق بين العملاق المتثاقل والمستطلع حاد البصر والرشيق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →