← أحدث الأبحاث
💻 computer science

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

يُعد AgentGrounder إطار عمل للتوطين البصري ثلاثي الأبعاد بنمط "التعلم الصفري" (zero-shot)، يعمل مباشرة على السحب النقطية الملونة من خلال الجمع بين جدول بحث عن الكائنات يتم استخدامه دون اتصال (offline) ووكيل يعمل عبر الإنترنت (online) مدفوع بالأدوات، يقوم باسترجاع المرشحين بشكل انتقائي، وإجراء تقييم هندسي، وتفعيل عملية رندرة الصور عند الطلب لتحقيق توطين قوي مفتوح المفردات دون الحاجة إلى تدريب ثلاثي الأبعاد خاص بالمهام.

المؤلفون الأصليون: Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك في غرفة كبيرة وفوضوية مليئة بمئات الأشياء، لكن لا يمكنك رؤيتها جميعاً في وقت واحد. أنت ترتدي عصبة عين، ويقوم صديق لك بإعطائك أمراً صوتياً: "التقط الكرسي الأبيض الصغير الموجود على اليسار."

مهمتك هي العثور على ذلك الكرسي المحدد دون رؤية الغرفة، باستخدام الوصف وخريطة ذهنية فقط. هذا هو بالضبط ما يفعله AgentGrounder للروبوتات، ولكن بدلاً من عصبة العين، يتعامل الروبوت مع "سحابة نقاط" (سحابة رقمية من النقاط تمثل العالم ثلاثي الأبعاد).

إليك كيف يشرح البحث حلهم، مقسماً إلى مفاهيم بسيطة:

المشكلة: فخ "المعلومات الزائدة عن الحد"

حاولت الأساليب السابقة حل هذه المشكلة عبر عرض صورة لكل شيء في الغرفة على الروبوت، ثم سؤاله نموذج ذكاء اصطناعي ذكي ("نموذج رؤية ولغة") لتخمين أي منها يقصده المستخدم.

  • العيب: الأمر يشبه أن تطلب من أمين مكتبة العثور على كتاب محدد عبر تسليمه كومة من 1000 كتاب وتقول له: "ابحث عن الكتاب الأحمر". سيشعر أمين المكتبة بالإرهاق، ويضيع الوقت في النظر إلى كتب ليست حمراء، وقد يصاب بالارتباك بسبب الحجم الهائل للمعلومات. يؤدي هذا إلى وقوع أخطاء، خاصة عندما يكون هناك العديد من الأشياء المتشابهة (مثل عشرة كراسي).

الحل: "المحقق الذكي" الخاص بـ AgentGrounder

ابتكر المؤلفون نظاماً جديداً يسمى AgentGrounder. بدلاً من أمين مكتبة يغرق في الكتب، تخيل محققاً ذكياً يعمل في مرحلتين متمايزتين.

المرحلة الأولى: "خزانة الملفات" (المرحلة غير المتصلة - Offline)

قبل أن يسمع المحقق الطلب حتى، يقوم بالمرور بالغرفة وإنشاء خزانة ملفات رقمية (تسمى جدول بحث الكائنات أو OLT).

  • هم لا يلتقطون صوراً لكل شيء بعد.
  • هم فقط يكتبون قائمة: "الكائن رقم 1 هو كرسي، يقع في الزاوية، طوله قدمان. الكائن رقم 2 هو طاولة، تقع في المنتصف..."
  • تحتوي هذه القائمة على المعرف (ID)، والاسم، والموقع، والحجم لكل كائن. يحدث هذا مرة واحدة، قبل أن يُطلب من الروبوت القيام بأي شيء.

المرحلة الثانية: "الوكيل مستخدم الأدوات" (المرحلة المتصلة - Online)

الآن، يعطي المستخدم الأمر: "التقط الكرسي الأبيض الصغير الموجود على اليسار."
لا ينظر "الوكيل" إلى الغرفة بأكملها مرة أخرى. بدلاً من ذلك، يتصرف كمحقق يستخدم مجموعة محددة من الأدوات:

  1. المُرشِّح (الاسترجاع): ينظر الوكيل في خزانة ملفاته ويقول: "حسناً، المستخدم يريد كرسياً". يقوم فوراً باستخراج الكراسي فقط من القائمة، متجاهلاً الطاولات، والمصابيح، والأرائك.
  2. المسطرة (التسجيل الهندسي): يتحقق الوكيل من الحسابات. "المستخدم قال 'صغير' و'على اليسار'". يقوم بقياس المسافات والأحجام لتلك الكراسي فقط باستخدام البيانات الموجودة في الخزانة. لا يحتاج لرؤيتها ليعرف أي منها الأصغر أو الأبعد جهة اليسار.
  3. الكاميرا (الرندرة عند الطلب): هذا هو الجزء الذكي. إذا كان الوكيل لا يزال مرتبكاً (مثلاً: "أي واحد هو الأبيض؟")، فإنه لا يلتقط صورة للغرفة بأكملها. بل يستدعي أداة كاميرا لالتقاط صورة للكراسي المحددة التي يدور حولها الجدل. يحصل على مجرد قدر كافٍ من الأدلة البصرية لاتخاذ قرار نهائي.

لماذا هذا العمل أفضل؟

يدعي البحث أن هذا النهج يتفوق للأسباب الثلاثة التالية، باستخدام هذه التشبيهات:

  • لا توجد "أخطاء متتالية": في الأساليب القديمة، إذا خمن الذكاء الاصطناعي "المرجع" الخطأ (على سبيل المثال، اعتقد أن "اليسار" يعني الجانب الأيسر من الطاولة بدلاً من الغرفة)، فإن سلسلة المنطق بأكملها تنكسر. يقوم AgentGrounder بالتحقق من الحسابات أولاً، لذا لا يضيع في سلسلة من التخمينات السيئة.
  • الكفاءة: من خلال النظر فقط في الكائنات ذات الصلة (الكراسي) والتقاط الصور فقط عند الضرورة القصوى، لا "يتعب" الذكاء الاصطناعي أو يرتبك بسبب البيانات غير ذات الصلة. الأمر يشبه قراءة الصفحات ذات الصلة فقط من دليل التعليمات بدلاً من قراءة الكتاب بأكمله.
  • الشفافية: استنتاج الوكيل واضح. فهو يقول: "لقد اخترت هذا الكرسي لأنه الوحيد الذي كان صغيراً، وأبيض، وعلى اليسار". هو لا يخمن فحسب؛ بل يحسب.

النتائج

اختبر الفريق نظامهم على مجموعتي بيانات شهيرتين لـ "الغرف الرقمية" (ScanRefer و Nr3D).

  • الدرجة: تفوق AgentGrounder على أفضل طريقة سابقة (SeeGround) بشكل كبير.
  • التميز: كان بارعاً بشكل خاص في العثور على الكائنات بناءً على موقعها (مثل "على اليسار") دون الحاجة لرؤيتها أولاً، وتعامل مع الغرف التي تحتوي على العديد من الكائنات المتشابهة والمربكة بشكل أفضل بكثير من السابق.

القيود (العقبة)

يعترف البحث بوجود عيبين رئيسيين:

  1. السرعة: التقاط الصور وسؤال الذكاء الاصطناعي يستغرق وقتاً. إنه ليس فورياً، مما قد يمثل مشكلة للروبوتات التي تحتاج للتحرك بسرعة فائقة.
  2. المدخلات الرديئة تؤدي لمخرجات رديئة: يعتمد النظام على تلك "خزانة الملفات" الأولية. إذا كان المسح الأولي للروبوت للغرفة سيئاً (على سبيل المثال، يعتقد أن الكرسي هو طاولة)، فإن المحقق سيبحث في المكان الخطأ وسيفشل. لا يمكن للنظام إصلاح خريطة سيئة.

الملخص

AgentGrounder هو طريقة جديدة للروبوتات للعثور على الكائنات في الفضاء ثلاثي الأبعاد. بدلاً من التخمين الأعمى من بحر من البيانات، يبني قائمة ذكية أولاً، ويستخدم الرياضيات لتضييق الخيارات، وينظر فقط إلى العناصر المحددة عندما يحتاج حقاً لذلك. إنها طريقة أكثر كفاءة، ومنطقية، ودقة لاتباع التعليمات مثل "خذ الكوب الأحمر على اليمين".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →