← أحدث الأبحاث
💻 computer science

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

تقدم هذه الورقة COCOTree، وهي مجموعة بيانات ومعيار ضخم للتفكيك البصري مفتوح الهيكل الشجري الذي يستفيد من خط معالجة مؤتمت يجمع بين نماذج اللغة والرؤية الكبيرة (LVLM) ونموذج SAM 3 لتوليد 1.8 مليون عقدة هرمية عبر 21 ألف صورة، مصحوبة بمقياس تقييم جديد (OTQ) لتقييم دقة القناع، ودقة التسمية، والاتساق الهيكلي.

المؤلفون الأصليون: Junhyub Lee, Seunghun Chae, Hyosu Kim

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junhyub Lee, Seunghun Chae, Hyosu Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تنظر إلى صورة لمطبخ مزدحم.

الطريقة القديمة:
تبحث أدوات الرؤية الحاسوبية التقليدية في تلك الصورة وتقول: "أرى شخصاً، وطاولة، وكرسياً". قد يقومون حتى بتفكيك الشخص قليلاً: "رأس، وجذع، وذراعين". لكنهم يتوقفون عند هذا الحد. إنهم يعاملون الصورة كقائمة مسطحة من العناصر. إذا سألت الكمبيوتر: "ما هي تلك المقبض المتصل بالخزانة؟"، فقد يراه مجرد "مقبض" عائم في الفضاء. هو لا يعرف أن المقبض ينتمي إلى الخزانة، والتي تنتمي بدورها إلى المطبخ، أو أن المقبض مكون من مقبض برغي ومسمار محدد. إنه يفتقر إلى "شجرة العائلة" للأشياء.

الطريقة الجديدة (COCOTREE):
تقدم هذه الورقة البحثية COCOTREE، وهي طريقة جديدة لتعليم الحواسيب رؤية العالم ليس كقائمة مسطحة، بل كـ شجرة عائلة ضخمة ومتفرعة.

فكر في الأمر مثل دمية روسية متداخلة (ماتريوشكا) أو شجرة ذات جذور وفروع:

  1. الجذر: الصورة بأكملة هي الجذع.
  2. الأغصان: ينقسم الجذع إلى أشياء كبيرة (شخص، خزانة).
  3. الأغصان الصغيرة (Twigs): تنقسم تلك الأشياء إلى أجزاء (الخزانة تنقسم إلى باب، ورف، ومقبض).
  4. الأوراق: تنقسم الأجزاء أكثر فأكثر (المقبض ينقسم إلى مقبض دائري ومسمار).

الهدف هو رسم خريطة لكل قطعة مرئية من الشيء، وصولاً إلى أدق التفاصيل، وربطها جميعاً في تسلسل هرمي منطقي.

كيف بنوا هذا؟ (الشيف الآلي)

بناء خريطة كهذه لآلاف الصور يدوياً سيكون أمراً مستحيلاً. سيتطلب الأمر سنوات من البشر لتسمية كل مسمار ومفصلة.

بدلاً من ذلك، بنى المؤلفون "شيفاً آلياً" يعمل بشكل كامل وتلقائي للقيام بالعمل نيابة عنهم. يستخدم هذا الروبوت أداتين قويتين من الذكاء الاصطناعي تعملان معاً:

  1. العقل (LVLM): يعمل نموذج لغوي بصري كبير كطاهٍ فضولي. ينظر إلى الصورة ويقول: "أرى خزانة. ماذا يوجد بداخلها؟ آه، رف ومقبض!". إنه يستخدم "منطقه العام" لتخمين الأجزاء الموجودة.
  2. اليدان (SAM 3): يعمل نموذج تقسيم دقيق كزوج من الأيدي الثابتة. بمجرد أن يخمن العقل وجود "مقبض"، تقوم اليدان برسم تحديد مثالي حول ذلك المقبض المحدد في الصورة.

العملية:
يبدأ الروبوت بالصورة بأكملها. يسأل العقل عن الأجزاء الرئيسية. ترسم اليدان خطوطاً حولها. ثم يأخذ الروبوت جزء "الخزانة" فقط، ويكبر الصورة، ويسأل العقل مرة أخرى: "الآن بعد أن أنظر فقط إلى الخزانة، ماذا أرى؟". يقول العقل: "باب ومقبض". ترسم اليدان ذلك. يتكرر هذا الأمر بشكل متكرلي (Recursive)، حتى لا يستطيع الروبوت العثور على أي قطع أصغر.

النتيجة: مكتبة ضخمة من الأشجار

النتيجة هي COCOTREE، وهي مجموعة بيانات تحتوي على أكثر من 21,000 صورة و 1.8 مليون عقدة هيكلية (قطع من الأشياء).

  • غير مقيدة: على عكس مجموعات البيانات القديمة التي تعرف فقط 80 أو 100 كلمة محددة (مثل "كلب" أو "سيارة")، تستخدم هذه المجموعة "مفردات مفتوحة". يمكنها تسمية كائن غريب وفريد بوصف طويل ومحدد إذا رأته.
  • عميقة: هي تذهب بعمق أكبر بكثير من الطرق السابقة. بينما قد تتوقف مجموعات البيانات القديمة عند "باب"، فإن هذه المجموعة تذهب إلى "باب -> مقبض -> مقبض دائري -> مسمار".
  • موثقة: لم يكتفِ المؤلفون بالوثوق بالروبوت. فقد جعلوا 20 مراجعاً بشرياً يفحصون العمل. وقد أكد البشر أن "أشجار عائلة" الروبوت كانت دقيقة وتتطابق مع كيفية رؤية البشر للعالم.

كيف نقيم الروبوت؟ (درجة OTQ)

كيف تقيم اختباراً تكون إجاباته عبارة عن أشجار معقدة؟ لا يمكنك فقط التحقق مما إذا كان قد أصاب في تحديد "السيارة". عليك التحقق من:

  1. هل رسم تحديد العجلة بشكل صحيح؟ (دقة القناع - Mask Precision)
  2. هل سماها "عجلة" وليس "إطار"؟ (دقة التسمية - Label Accuracy)
  3. هل وضع العجلة تحت السيارة، والإطار تحت العجلة بشكل صحيح؟ (الاتساق الهيكلي - Structural Consistency)

للقيام بذلك، أنشأوا نظام تسجيل جديد يسمى OTQ (جودة الشجرة المفتوحة - Open Tree Quality). إنه يشبه تقرير الدرجات الذي يعطي درجة واحدة بناءً على مدى جودة رسم الروبوت للصورة، وتسمية الأجزاء، وتنظيم شجرة العائلة.

الملخص

باختختصار، COCOTREE هي مكتبة ضخمة تم إنشاؤها تلقائياً لتعليم الحواسيب رؤية العالم في طبقات. إنها تنتقل لما هو أبعد من مجرد "ماذا يوجد في الصورة" إلى "كيف بُنيت الأشياء الموجودة في الصورة وكيف ترتبط ببعضها"، باستخدام فريق من روبوتات الذكاء الاصطناعي لبناء الخريطة، ومراجعين بشريين للتأكد من دقة الخريطة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →