← أحدث الأبحاث
💻 computer science

X2SAM: Any Segmentation in Images and Videos

يُعد X2SAM نموذجاً لغوياً لغوياً ضخماً موحداً متعدد الوسائط يوسع قدرات أي نوع من أنواع التجزئة من الصور إلى الفيديوهات عبر ربط نموذج لغوي كبير بوحدة ذاكرة قناعية، مما يتيح توليد أقنعة عالية الجودة ومتسقة زمنياً من التعليمات الحوارية والمحفزات البصرية عبر مهام تجزئة متنوعة.

المؤلفون الأصليون: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

نُشر 2026-05-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً فائق الذكاء يمكنه النظر إلى صورة أو فيديو وإخبارك بدقة بما يحدث. لفترة طويلة، كان هؤلاء المساعدون بارعين في وصف "الصورة الكبيرة" (مثل "كلب يلعب في حديقة") ولكنهم كانوا سيئين جداً في تحديد التفاصيل الدقيقة (مثل "ارسم دائرة حول مخلب الكلب الأيسر").

من ناحية أخرى، هناك أدوات متخصصة رائعة في رسم تلك الدوائر الدقيقة (الأقنعة/الماسكات) حول الأشياء، لكنها تشبه الروبوتات التي لا تفهم سوى الأوامر البسيطة مثل "انقر هنا" أو "ارسم مربعاً". وهي لا تفهم الجمل المعقدة مثل "ابحث عن الكلب الذي يطارد الكرة الحمراء وارسم حوله".

X2SAM هو "الموصل الفائق الجديد" الذي يسد هذه الفجوة. فهو يجمع بين عقل الذكاء الاصطناعي الحواري وبين يدي أداة الرسم الدقيقة، وهو يعمل لكل من الصور الثابتة ومقاطع الفيديو المتحركة.

إليك تفصيل لكيفية عمله، باستخدام بعض التشبيهات من الحياة اليومية:

1. "المترجم العالمي" للصور والفيديوهات

فكر في X2SAM كمترجم عالمي يتحدث كل من "لغة البشر" و"لغة البكسل".

  • الطريقة القديمة: إذا كنت تريد العثور على كائن معين في فيديو، فقد تضطر لاستخدام أداة واحدة لفهم الفيديو وأداة أخرى لرسم الخطوط العريضة. لم يكنا يتواصلان مع بعضهما البعض بشكل جيد.
  • طريقة X2SAM: يمكنك التحدث إليه بشكل طبيعي. يمكنك أن تقول: "أرني الشخص الذي يمشي ذهاباً وإياباً بالقرب من الحائط الأبيض"، أو حتى تشير إلى نقطة على شاشتك وتقول: "جد ما يوجد في هذه المنطقة". يفهم X2SAM التعليمات ويرسم الخطوط العريضة لك فوراً، سواء كانت صورة واحدة أو مقطع فيديو مدته 10 ثوانٍ.

2. "بنك الذاكرة" للصور المتحركة

هذا هو السر الذي يجعل X2SAM مميزاً بالنسبة للفيديوهات.

  • المشكلة: إذا طلبت من ذكاء اصطناği قياسي تتبع شخص في فيديو، فغالباً ما ينظر إلى كل إطار (كل صورة في جزء من الثانية) كما لو كانت جديدة تماماً. قد يفقد تتبع الشخص عندما يمشي خلف شجرة أو عندما تهتز الكاميرا.
  • حل X2SAM: يمتلك X2SAM وحدة ذاكرة للقناع (Mask Memory Module). تخيل هذا كنظام "الملاحظات اللاصقة". بينما يعمل الفيديو، يقوم X2SAM بكتابة مكان وجود الكائن في الإطار السابق ويحتفظ بتلك الملاحظة في جيبه. عندما ينظر إلى الإطار التالي، يتحقق من ملاحظاته ليقول: "آه، أنا أعرف أن هذا الشخص كان هنا للتو، لذا فمن المحتمل أنه لا يزال هنا". هذا يسم يسمح له بالحفاظ على الخطوط العريضة للكائن سلسة ومتسقة، حتى لو تحرك الكائن، أو اختفى، أو تغير شكله.

3. "السكين السويسري" للمهام

يدعي البحث أن X2SAM يمكنه التعامل مع مجموعة هائلة من المهام بنظام واحد فقط، بدلاً من الحاجة إلى أداة مختلفة لكل وظيفة. يمكنه القيام بـ:

  • التجزئة العامة (Generic Segmentation): "ارسم الخطوط العريضة لكل شيء في هذه الصورة".
  • التجزئة المرجعية (Referring Segmentation): "ارسم القط الذي يرتدي قبعة".
  • التجزئة الاستنتاجية (Reasoning Segmentation): "ابحث عن الشيء الذي يمكن استخدامه لصب الماء في كوب". (عليه أن يفكر ليعرف أنه إبريق، وليس مجرد البحث عن كلمة "إبريق").
  • التجزئة القائمة على الرؤية (Visual Grounded Segmentation): تشير إلى نقطة على الشاشة، فيقوم برسم الكائن الذي تشير إليه.
  • المحادثة: يمكنه الدردشة معك حول الصورة أو الفيديو أثناء رسم الأقنعة في نفس الوقت.

4. كيف تعلم (التدريب)

لكي يصبح بهذا المستوى من الجودة، لم يقم الباحثون بتعليمه شيئاً واحداً في كل مرة. بل استخدموا استراتيجية "التدريب المشترك الموحد" (Unified Joint Training).

  • التشبيه: تخيل تعليم طالب. بدلاً من تعليمهم الرياضيات يوم الاثنين والتاريخ يوم الثلاثاء، أنت تعلمهم كيفية حل مسائل الرياضيات باستخدام حقائق تاريخية، والعكس صحيح، في نفس الوقت.
  • تم تدريب X2SAM على مزيج ضخم من الصور والفيديوهات في وقت واحد. ساعد هذا في تعلم أن قواعد العثور على "كلب" في صورة تشبه قواعد العثور على "كلب" في فيديو، ولكن مع الإضافة الجديدة المتمثلة في تذكر أين كان الكلب قبل ثانية واحدة.

5. "الاختبار" الجديد (V-VGD)

أنشأ المؤلفون أيضاً اختباراً جديداً يسمى تجزئة الفيديو المرتبط بالرؤية (V-VGD).

  • التشبيه: في السابق، كانت الاختبارات تسأل غالباً: "هل يمكنك العثور على الكلب؟". أما اختبار X2SAM الجديد فيسأل: "أنا أشير إلى نقطة على الشاشة في هذا الفيديو؛ هل يمكنك العثات على الكائن الذي أشير إليه وتتبعه أثناء حركته؟". هذا يختبر ما إذا كان بإمكان الذكاء الاصطناعي حقاً فهم العلاقة بين الإشارة البصرية والكائن المتحرك. وقد اجتاز X2SAM هذا الاختبار ببراعة، متفوقاً على النماذج السابقة.

باختدصار

X2SAM يشبه إعطاء فنان بشري عينين يمكنهما رؤية كل بكسل، وعقلاً يفهم الجمل المعقدة والمنطق، وذاكرة تتذكر أين كانت الأشياء قبل لحظة. إنه يتيح لك إجراء محادثة طبيعية مع الكمبيوتر للعثور على أشياء محددة وتحديد خطوطها العريضة في كل من الصور والفيديوهات، وكل ذلك في خطوة واحدة.

ما لا يفعله (بناءً على الورقة البحثية):
تركز الورقة البحثية بالكامل على القدرة التقنية لتجزئة (تحديد حدود) الكائنات في الصور والفيديوهات. ولا تدعي أنه يمكن استخدامه في التشخيص الطبي، أو السيارات ذاتية القيادة، أو المراقبة الأمنية، رغم أن هذه قد تكون استخدامات مستقبلية محتملة لمثل هذه التكنولوجيا. إنه حصرياً أداة لفهم وتحديد المحتوى المرئي بناءً على التعليمات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →