← أحدث الأبحاث
💻 computer science

PicoSAM3: Real-Time In-Sensor Region-of-Interest Segmentation

تقدم الورقة البحثية PicoSAM3، وهو نموذج تقسيم قابل للتحفيز خفيف الوزن بـ 1.3 مليون معلمة، مُحسَّن للتنفيذ في الوقت الفعلي على المستشعر في أجهزة مثل Sony IMX500، والذي يحقق دقة هي الأفضل في فئته من خلال تقطير المعرفة من SAM2/SAM3 مع الحفاظ على زمن انتقال منخفض والامتثال الصارم للأجهزة.

المؤلفون الأصليون: Pietro Bonazzi, Nicola Farronato, Stefan Zihlmann, Haotong Qin, Michele Magno

نُشر 2026-03-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Pietro Bonazzi, Nicola Farronato, Stefan Zihlmann, Haotong Qin, Michele Magno

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك ترتدي نظارات ذكية. تريد منها أن تتعرف فوراً على كوب القهوة الذي تمسكه أو الشخص الذي يمشي باتجاهك، وتبرزه لك دون أي تأخير. عادةً، لكي تفعل النظارات ذلك، يتعين عليها التقاط صورة، وإرسالها عبر الإنترنت إلى كمبيوتر ضخم وقوي في "السحابة"، والانتظار حتى يعالج الصورة، ثم إرسال الإجابة مرة أخرى. هذا يستغرق وقتاً (زمن انتقال/Latency) ويخاطر بخصوصيتك لأن بياناتك تغادر جهازك.

PicoSAM3 هو "عقل" صغير جديد صُمم ليعيش داخل عدسة الكاميرا نفسها. يتيح للنظارات الذكية وأجهزة إنترنت الأشياء (IoT) الصغيرة فهم وتقسيم الصور (قص الأجسام) فوراً، في نفس مكان التقاط الصورة، دون الحاجة للإنترنت.

إليك كيف يشرح البحث هذا الاختراق، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: "الفيل في الغرفة"

أشهر نموذج ذكاء اصطنا_عي لهذه المهمة يسمى SAM (نموذج تقسيم كل شيء). فكر في SAM كفيل عبقري ولكنه ضخم؛ يمكنه تحديد أي شيء في الصورة بدقة مثالية، لكنه ثقيل جداً (جيجابايت من البيانات) ويتطلب الكثير من الطاقة بحيث لا يمكنه التواجد داخل كاميرا صغيرة تعمل بالبطارية. الأمر يشبه محاولة ركن شاحنة ضخمة في مرآب سيارة صغيرة.

المحاولات السابقة لتقليص هذا الفيل (مثل "TinySAM") تركت النموذج لا يزال كبيراً جداً أو بطيئاً جداً بالنسبة للمستشعرات الأكثر تطرفاً، مثل مستشعر Sony IMX500. هذا المستشعر هو شريحة كاميرا تحتوي على كمبيوتر صغير مدمج بداخلها، لكن لديه قواعد صارمة للغاية: لديه ذاكرة قليلة جداً (مثل حقيبة ظهر صغيرة) ويمكنه فقط إجراء عمليات حسابية بسيطة.

2. الحل: PicoSAM3 (المحقق بحجم الجيب)

ابتكر الباحثون PicoSAM3، وهو يشبه تقليص ذلك الفيل ليصبح بحجم الهامستر، مع الحفاظ على ذكاء عقله.

  • الحجم: هو صغير بشكل مذهل (1.3 مليون معلمة فقط). إذا كان نموذج SAM الأصلي عبارة عن مكتبة، فإن PicoSAM3 هو مجرد دفتر ملاحظات واحد منظم جيداً.
  • السرعة: يعمل في 11.82 مللي ثانية. هذا أسرع من رمشة العين البشرية. يحدث الأمر بسرعة كبيرة لدرجة أنك لن تلاحظ التأخير.
  • الموقع: يعمل داخل مستشعر الكاميرا نفسه. لا تخرج أي بيانات من الجهاز، مما يعني أن خصوصيتك آمنة بنسبة 100%.

3. كيف يعمل: الخدع السحرية

لجعل هذا المحقق الصغير ذكياً جداً، استخدم الفريق ثلاث حيل ذكية:

أ. تقنية "القص والتركيز" (التلقين الضمني)

عادةً، لإخبار الذكاء الاصطناعي "ابحث عن القطة"، عليك رسم مربع حولها. لكن مستشعر الكاميرا الصغير لا يملك الذاكرة للتعامل مع تعليمات "الرسم" الإضافية.

  • التشبيه: تخيل أنك تبحث عن شخص معين في حشد. بدلاً من الإشارة إليه وقول "ذلك الشخص"، تقوم ببساطة بتقريب الكاميرا (Zoom) حتى يصبح هو الشيء الوحيد في الإطار.
  • التقنية: لا يحتاج PicoSAM3 إلى تعليمات "مربع" منفصلة. هو فقط ينظر إلى صورة مقصوصة حيث يكون الجسم متمركزاً بالفعل. إنه يتعلم أن "كل ما هو في منتصف هذه الصورة هو ما أحتاج للعثور عليه". هذا يوفر قدراً هائلاً من الذاكرة.

ب. "الأستاذ والمتدرب" (تقطير المعرفة)

كيف تعلم هامستراً صغيراً أن يفكر كفيل؟ لا تبدأ من الصفر؛ بل تجد معلماً بارعاً.

  • التشبيه: تخيل طباخاً ماهراً (نموذج SAM3 الضخم) يعلم متدرباً شاباً (PicoSAM3). المعلم لا يعطي المتدرب الوصفة فحسب؛ بل يراقب المتدرب المعلم وهو يطبخ، ويتذوق الطبق، ويتعلم "إحساس" المكونات.
  • التقنية: استخدم الباحثون نموذج SAM3 الضخم والقوي لتوليد إجابات "مثالية" لآلاف الصور. ثم قاموا بتدريب PicoSAM3 لتقليد تلك الإجابات. سمح هذا للنموذج الصغير بالتعلم من خبرة النموذج الضخم دون الحاجة لأن يكون كبيراً مثله.

ج. "صندوق الأدوات المتخصص" (البنية الهيكلية)

النماذج الضخمة تستخدم رياضيات معقدة (Transformers) لا يستطيع المستشعر الصغير التعامل معها.

  • التشبيه: النماذج الضخمة تستخدم سويسرياً (Swiss Army Knife) يحتوي على 50 أداة، لكن المستشعر الصغير لا يملك سوى مفك براغي. PicoSAM3 مبني باستخدام المفك فقط، لكنه "مفك براغي خارق" مصمم خصرياً لهذه المهمة.
  • التقنية: استبدلوا الرياضيات المعقدة بـ "شبكات عصبية تلافيفية" (CNNs) أبسط وأسرع تحبها أجهزة المستشعر. كما أضافوا خطوة "ضغط" (Quantization) تحول عقل النموذج إلى أصفار وآحاد بسيطة (INT8)، مما جعله أصغر بـ 4 مرات دون فقدان ذكائه.

4. النتائج: لماذا يهم هذا؟

  • الدقة: على الرغم من صغره، إلا أن PicoSAM3 في الواقع أفضل في العثيد على الأجسام في الاختبارات القياسية (COCO و LVIS) من العديد من النماذج "الصغيرة" الأخرى. إنه يتفوق على المحاولات السابقة بفارق كبير.
  • الاستخدام في العالم الحقيقي: نجحوا في وضعه على مستشعر Sony IMX500. إنه يعمل في الوقت الفعلي، مما يعني أنه يمكنك امتلاك نظارات ذكية تسلط الضوء على لافتة شارع أو وجه شخص فوراً، حتى لو كنت في قبو بدون إنترنت.
  • الخصوصية: نظرًا لأن المعالجة تتم داخل شريحة الكاميرا، فإن الفيديو الخاص بك لا يغادر الجهاز أبداً.

ملخص

PicoSAM3 هو اختراق لأنه يثبت أنك لا تحتاج إلى كمبيوتر خارق لامتلاك رؤية ذكية. من خلال تصغير النموذج، وتعليمه بواسطة "معلم بارع"، وتصميمه خصيصاً للأجهزة الصغيرة، وضع الباحثون "الذكاء الخارق" مباشرة في عين الكاميرا. إنه الفرق بين إرسال رسالة إلى مكتب البريد لقراءتها وبين وجود أمين مكتبة يعيش داخل صندوق بريدك ويقرأها في اللحظة التي تصل فيها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →