FOUND-IT: Foundation-model-first Task-driven 3D Scene Graphs with Granularity on Demand
يقدم البحث إطار العمل FOUND-IT، وهو إطار عمل فوري وموجه بالمهام يستفيد من النماذج التأسيسية الهندسية لتوليد رسوم بيانية للمشاهد ثلاثية الأبعاد هرمية ديناميكية ذات دقة قابلة للتعديل لمهام التنقل والتلاعب المتطورة في بيئات أحادية الكاميرا غير معايرة.
المؤلفون الأصليون:Dominic Maggio, Nicolas Gorlo, Luca Carlone
تخيل أنك تقوم بتعليم روبوت كيفية التنقل داخل منزل. معظم الروبوتات اليوم تشبه الطلاب الذين يحفظون خريطة بمستوى واحد ثابت من التفاصيل. إذا احتاجوا للذهول إلى المطبخ، فإنهم يرون الغرفة بأكملها. ولكن إذا احتاجوا لتدوير مقبض معين في الموقد، فإنهم يعلقون لأن خريطتهم ضبابية للغاية بحيث لا يمكنهم رؤية المقبض، أو مزدحمة للغاية بحيث لا يمكنهم رؤية الغرفة بأكملها في وقت واحد. كما أنهم يحتاجون عادةً إلى كاميرات ثلاثية الأبعاد متخصصة وباهظة الثمن لبناء هذه الخريطة.
يقدم البحث نظام FOUND-IT، وهو نظام يعمل كأمين مكتبة ذكي ومتكيف لذاكرة الروبوت. إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
1. ذاكرة "عدسة الزووم" (الدقة عند الطلب)
فكر في FOUND-IT ليس كخريطة ثابتة، بل كـ عدسة كاميرا ذكية تغير تركيزها بناءً على ما يُطلب من الروبوت فعله.
المشكلة: الأنظمة التقليدية تقرر "حجم" الأشياء عند رؤيتها للغرفة لأول مرة. قد تقرر أن الموقد مجرد جسم واحد كبير. لاحقاً، إذا احتاج الروبوت لتدوير مقبض، فلن يتمكن من رؤية المقبض لأن الخريطة بعيدة جداً (Zoomed out).
حل FOUND-IT: يحتفظ بـ "ذاكرة بصرية" لإطارات الفيديو الخام ولكنه لا يحبسها في أحجام أشياء محددة بعد. عندما يتلقى الروبوت مهمة، يقوم بالتقريب أو التبعيد فوراً.
المهمة: "اذهب إلى المطبخ." -> يقوم النظام بالابتعاد (Zoom out) ليرى الغرفة بأكملها كمساحة واحدة كبيرة.
المهمة: "أطفئ الموقد." -> يقوم بالتقريب (Zoom in) لتحديد مقابض معينة على الموقد.
المهمة: "ابحث عن الغلاية." -> يقوم بالتقريب بما يكفي فقط لرؤية الغلاية.
التشبيه: يشبه الأمر امتلاك "خرائط جوجل" التي يمكنها التبديل فوراً بين إظهار المدينة بأكملها، أو حي معين، أو عنوان شارع واحد، دون الحاجة لإعادة رسم الخريطة في كل مرة.
2. الكاميرا "ذات العين الواحدة" (كاميرا أحادية غير معايرة)
تحتاج معظم الروبوتات المتقدمة إلى كاميرتين (رؤية ستيريو) أو مستشعر عمق (مثل ماسح ليزر) لفهم الفضاء ثلاثي الأبعاد. هذا يجعلها ثقيلة، باهظة الثمن، وصعبة الإعداد.
حل FOUND-IT: يستخدم كاميرا واحدة قياسية (مثل تلك الموجودة في هاتفك) و"نموذج تأسيسي" ذكاء اصطناعي قوي (عقل مدرب مسبقاً يعرف بالفعل كيف يعمل الفضاء ثلاثي الأبعاد) لتخمين العمق وهيكل الغرفة.
التشبيه: يشبه الأمر كيف يمكن للبشر المشي في غرفة مظلمة ومعرفة أماكن الأثاث بمجرد النظر بعين واحدة واستخدام خبرة عقولهم. يقوم FOUND-IT بذلك رياضياً باستخدام بث كاميرا واحدة.
3. مولد "مخطط الطوابق" (طبقة الأماكن)
للتنقل، يحتاج الروبوت لمعرفة أين يمكنه السير (المساحات القابلة للعبور) وأين لا يمكنه ذلك (الجدران، الطاولات).
حل FOUND-IT: بدلاً من الحسابات الهندسية المعقدة، يضيف النظام "رأساً" خاصاً (أداة ذكاء اصطناعي إضافية صغيرة) إلى عقل الكاميرا الرئيسي. هذه الأداة تنظر إلى الفيديو وترسم فوراً "مخطط طوابق" على الأرض، وتحدد البلاطات التي يمكن للروبوت السير عليها.
التشبيه: تخيل روبوتاً ينظر إلى فيديو لغرفة معيشة فوضوية. بينما تعاني الأنظمة الأخرى لتحديد أين ينتهي الأرض وينتهي السجاد، يقوم FOUND-IT فوراً بتظليل بلاطات الأرض القابلة للمشي باللون الأخضر، متجاهلاً الجدران والأثاث، مما يخلق مساراً آمناً يتبعه الروبوت.
4. نظام "التجميع الذكي" (المناطق)
غالباً ما تحتاج الروبوتات لفهم مفاهيم مثل "المطبخ" أو "الرواق"، وهي ليست مجرد أشياء مفردة بل مجموعات من الأماكن.
حل FOUND-IT: يأخذ "بلاطات الأرض" التي وجدها ويجمعها في مناطق بناءً على ما يطلبه الروبوت. إذا طلب الروبوت "المطبخ"، يجمع النظام كل بلاطات الأرض التي تبدو كمطبخ ويربطها ببعضها.
التشبيه: إذا سألت بشراً، "أين المطبخ؟"، فقد يشير إلى منطقة معينة. وإذا سألته، "أين منطقة اللعب؟"، فقد يشير إلى ركن مختلف في نفس الغرفة. يقوم FOUND-IT بهذا ديناميكياً، حيث يجمع بلاطات الأرض في "غرف" فقط عند الطلب، بدلاً من فرض تقسيم المنزل إلى غرف ثابتة مسبقاً.
5. "الوكيل" (العقل)
يتضمن النظام "وكيلاً" للذكاء الاصطنا- (مساعد رقمي) يتحدث مع الروبوت.
كيف يعمل: عندما يتلقى الروبوت أمراً (مثلاً: "أحضر لي المنشفة")، لا يقوم الوكيل بمجرد البحث في قائمة معدة مسبقاً. بل يقوم ببناء الخريطة بنشاط أثناء حركته، باحثاً عن المناشف، والتحقق مما إذا كانت موجودة، وإذا لم تكن موجودة، يدرك أن المنشفة ليست هناك وربما يبحث عن شيء آخر.
التشبيه: يشبه الأمر المحقق الذي لا يكتفي بقراءة ملف، بل يحقق بنشاط في مسرح الجريمة، بحثاً عن الأدلة (الأشياء) ذات الصلة بالقضية المحددة (المهمة)، ويقوم بتحديث خريطته الذهنية في الوقت الفعلي.
ما أثبتوه بالفعل
اختبر المؤلفون هذا النظام بعدة طرق لإثبات نجاحه:
الدقة: كان أفضل بكثير (بتحسن قدره 79%) في العثور على الأشياء وفهم المهام مقارنة بالطرق السابقة في الاختبارات القياسية.
السرعة: يعمل في الوقت الفعلي على روبوت (تحديداً الروبوت الكلب "Spot") باستخدام كمبيوتر داخلي قوي (Jetson Thor).
الاستخدام في العالم الحقيقي: نجحوا في بناء هذه الخرائط ثلاثية الأبعاد باستخدام فيديوهات عادية صورها وكلاء عقارات من موقع YouTube، مما يثبت أنه يعمل على فيديوهات غير مثالية وغير منضبطة من الإنترنت، وليس فقط على بيانات مخبرية مثالية.
باختة، FOUND-IT هو نظام يسمح للروبوت ببناء خريطة ثلاثية الأبعاد لغرفة باستخدام كاميرا واحدة فقط، ثم التكبير أو التصغير فوراً ليرى بالضبط ما يحتاجه للقيام بالمهمة، سواء كان ذلك التنقل في ممر أو تدوير مقبض صغير.
ملخص تقني: FOUND-IT
بيان المشكلة تواجه طرق بناء الرسوم البيانية للمشاهد ثلاثية الأبعاد (3D scene graphs) الحالية عائقين أساسيين: الاعتماد على مستشعرات عمق مُعايرة (ستيريو أو RGB-D)، والافتقار إلى المرونة في التدرج الدلالي (semantic granularity). تتطلب الأنظمة الحالية في الوقت الفعلي غالبًا مسارات معقدة وإعدادات مستشعرات ثابتة، مما يحد من إمكانية النشر. علاوة على ذلك، تلتزم هذه الأنظمة عادةً بتدرج محدد للأجسام وقت رسم الخرائط أو تعتمد على قائمة مهام محددة مسبقًا وثابتة. هذا الجمود يمنع الروبوتات من تكييف تمثيلها المكاني ديناميكيًا؛ فعلى سبيل المثال، لا يمكن للروبوت الانتقال بسهولة من التنقل نحو "موقد" (تدرج خشن) إلى التعامل مع "مقبض" معين في ذلك الموقد (تدرج دقيق) دون إعادة رسم الخرائط أو تحديد المهمة مسبقًا. بالإضافة إلى ذلك، تعاني العديد من النهج من صعوبة في تعميم قابلية العبور (الأماكن) وتعريفات المناطق عبر بيئات داخلية وخارجية متنوعة دون الاعتماد على مقدمات هندسية مهيكلة.
المنهجية يقترح المؤلفون نظام FOUND-IT (الرسوم البيانية للمشاهد ثلاثية الأبعاد القائمة على النماذج التأسيسية والمدفوعة بالمهام مع تدرج حسب الطلب)، وهو نظام يبني رسومًا بيانية للمشاهد ثلاثية الأبعاد هرمية ومفتوحة المجموعة باستخدام فيديو أحادي العين غير مُعاير في الوقت الفعلي. يعتمد النظام على النماذج التأسيسية الهندسية (GFMs)، وتحديدًا من خلال الاستفادة من VGGT-SLAM 2.0 كعمود فقري هندسي.
تتكون البنية من أربع طبقات رئيسية:
الرسم الخرائطي الهندسي: يعالج النظام تدفقًا من الصور أحادية العين، ويحدد الإطارات الرئيسية (keyframes) بناءً على التباين (disparity). تُغذى هذه الإطارات في نموذج تأسيسي هندسي (GFM) لتوليد خرائط عمق كثيفة، ووضعيات (poses)، وخصائص داخلية للكاميرا. يتم ربط الخرائط الفرعية (submaps) وتحسينها عالميًا باستخدام مخطط عامل (factor graph) على مجمّع SL(4). ولإدارة الذاكرة، يقوم النظام اختياريًا بتخفيف الخريطة عبر التجزئة الحجمية (voxelization)، مما يحافظ على ندرة الخريطة الإجمالية بينما يسمح بتمثيل الأجسام المستعلم عنها بكثافة.
طبقة الأجسام (الذاكرة البصرية والمخزن المؤقت): بدلاً من استخراج حالات الأجسام مسبقًا، يستخدم FOUND-IT نظام ذاكرة ثنائي المرحلة.
الذاكرة البصرية: تمر الإطارات الرئيسية عبر مشفر إدراكي يعتمد على CLIP لإنشاء تضمينات دلالية (semantic embeddings). يؤدي هذا إلى تأجيل تشكيل الأجسام حتى يتم استقبال استعلام.
تشكيل عند الاستعلام: عند استقبال استعلام نصي، يحسب النظام تشابه جيب التمام (cosine similarity) بين تضمين الاستعلام وتضمينات الإطارات الرئيسية. بعد ذلك، تتم معالجة الإطارات الرئيسية ذات الصلة بواسطة SAM3 لتوليد أقنعة تقسيم ثنائية الأبعاد، والتي يتم إسقاطها عكسيًا إلى ثلاثة أبعاد باستخدام عمق النموذج التأسيسي الهندسي (GFM).
الذاكرة المخزنة مؤقتًا: تُخزن الأجسام التي تم حلها كأطياف نقاط (point clouds) مع صناديق محيطة موجهة ثلاثية الأبعاد. تتحقق الاستعلامات اللاحقة من هذا المخزن أولًا، مما يتيح بناء خرائط تصاعدية مدفوعة بالمهام دون إعادة الحساب.
طبقة الأماكن (قابلية العبور): لرسم خرائط المساحات القابلة للعبور دون تجميع هندسي معقد، يضيف المؤلفون رأس تقسيم الأرضية (ground segmentation head) إلى النموذج التأسيدي الهندسي (GFM). ومن خلال التحليل التجريبي، حددوا أن الطبقات المتوسطة للـ GFM (بدلاً من الطبقة النهائية) توفر أفضل الميزات لتقسيم الأرضية. يتنبأ هذا الرأس بأقنعة الأرضية، والتي تُحول إلى رسم بياني متفرق من البلاطات المربعة. يدعم هذا الرسم البياني إغلاق الحلقة (loop closures) والتشوه الديناميكي.
طبقة المناطق: المناطق (مثل "المطبخ"، "موقف السيارات") ليست مقسمة مسبقًا، بل هي مجموعات فرعية من رسم الأماكن البياني مدفوعة بالاستعلام. يلخص كل عقدة مكان ملاحظاتها باستخدام توزيع فون ميسيس-فيشر (vMF) للتضمينات الدلالية، مما يلتقط كلاً من الاتجاه المتوسط ومعلم التركيز. يتم قياس استعلام مفتوح المفردات مقابل هذه التوزيعات، مع ترجيحها بناءً على ثقة الملاحظة. يعمل انتشار تسمية الرسم البياني الواعي بالثقة على تنعيم الدرجات عبر رسم الأماكن البياني، ويقوم نموذج الخليط الغاوسي (Gaussian mixture model) بفصل الأماكن الموجودة داخل المنطقة عن الأماماكن خارجها.
التكامل الوكيل (Agentic Integration) تم تصميم النظام ليتم توجيهه بواسطة وكيل يعتمد على نماذج اللغة الكبيرة (LLM). على عكس الأنظمة الوكيلية السابقة التي تسترجع البيانات من تمثيل ثابت مبني مسبقًا، يقوم وكيل FOUND-IT ببناء الرسم البياني للمشهد بشكل تصاعدي ونشط. فهو يستعلم من الذاكرة البصرية للحصول على الإطارات ذات الصلة، ويستخرج الأجسام عبر SAM3، ويحدث المخزن المؤقت، مما يبني التمثيل "عند الطلب" بناءً على المهمة.
المساهمات الرئيسية
تدرج مدفوع بالمهام: نهج مبتكر لبناء الرسوم البيانية للمشاهد ثلاثية الأبعاد يحدد تدرج الأجسام والمناطق عند وقت الاستعلام بدلاً من وقت رسم الخرائط، مما يدعم تطور المهام الديناميكي دون قائمة مهام محددة مسبقًا.
أولوية النماذج التأسيسية أحادية العين: أول طريقة لبناء رسوم بيانية للمشاهد ثلاثية الأبعاد هرمية باستخدام كاميرات أحادية العين غير مُعايرة من خلال الاستفادة من النماذج التأسيسية الهندسية (GFMs)، مما يلغي الحاجة إلى مستشعرات العمق أو المعايرة المعقدة.
تقسيم الأرضية عبر الطبقات المتوسطة: عرض يوضح أن الطبقات المتوسطة للنماذج التأسيسية الهندسية (GFMs) هي الأمثل لتقسيم الأرضية، مما يتيح رسم خرائط قوية لقابلية العبور في بيئات داخلية وخارجية متنوعة.
التجميع عند الاستعلام: خوارزمية فعالة لتجميع الأماكن في مناطق مفتوحة المجموعة باستخدام إحصاءات vMF وانتشار الرسم البياني، مما يسمح بتعريفات مرنة للمناطق (مثل "غرفة اللعب" داخل "غرفة المعيشة") بناءً على المهمة المحددة.
البناء الوكيل: تكامل حيث يقوم وكيل LLM ببناء تمثيل الرسم البياني للمشهد بشكل تصاعدي بناءً على الاستعلامات الواردة، بدلاً من الاستعلام من خريطة ثابتة.
النتائج التجريبية قيم المؤلفون FOUND-IT عبر عدة اختبارات وسيناريوهات واقعية:
مجموعة بيانات Clio (استخراج الأجسام مفتوحة المجموعة): حقق FOUND-IT أفضل أداء عبر جميع المشاهد (مكتب عمل، شقة، مكتب) من حيث استدعاء المجموعة المفتوحة و IoU، متفوقًا على كل من النماذج المدفوعة بالمهام (مثل Clio و Bayesian Fields) والأساليب مفتوحة المجموعة غير المرتبطة بالمهام.
اختبار AShiTA SG3D (ربط المهام): أظهر النظام تحسنًا بنسبة 79% في الدقة مقارنة بأفضل النتائج السابقة (ASHiTA) في ربط أوصاف المهام بمواقع الأجسام.
اختبار HOV-SG (تجميع المناطق): حققت الطريقة دقة واستدعاء تنافسي ضد الطرق المخصصة للمساحات الداخلية (HOV-SG, Hydra) وتفوقت عليها في الدقة الدلالية، رغم اعتمادها الأقل على المقدمات الهيكلية الداخلية.
الأداء في الوقت الفعلي: على جهاز NVIDIA Jetson Thor المثبت على روبوت رباعي الأرجل من نوع Spot، يعمل النظام بتردد 4 هرتز باستخدام نموذج تأسيسي هندسي خفيف الوزن (Depth Anything). وعلى وحدة معالجة رسومات مكتبية (RTX 3090)، يعمل المسار الكامل بتردد 6-7 هرتز.
التعميم في العالم الحقيقي: نجح النظام في بناء رسوم بيانية للمشاهد من فيديوهات YouTube الملتقطة بشكل عارض لجولات عقارية في شقق، مما أظهر المتانة تجاه المدخلات ذات الجودة المتغيرة وغير المُعايرة.
الأهمية والادعاءات يزعم البحث أن FOUND-IT يمثل تحولًا جذريًا نحو الذكاء المكاني في الروبوتات من خلال فصل تدرج الخريطة عن عملية رسم الخرائط. ومن خلال استخدام النماذج التأسيسية، يحقق النظام إعادة بناء ثلاثية الأبعاد (plug-and-play) من الفيديو أحادي العين مع دعم الاستدلال المدفوع بالمهام ومفتوح المجموعة. يؤكد المؤلفون أن هذا النهج يسمح للروبوتات بالتعامل مع مهام المناورة والتنقل المعقدة حيث يتطور مستوى التفاصيل المطلوب ديناميكيًا. يسلط العمل الضوء على إمكانية الاستفادة من الميزات المتوسطة للنماذج التأسيسية لمهام لاحقة محددة (مثل تقسيم الأرضية)، ويثبت أن الفهم الهرمي عالي الدقة للمشهد هو أمر ممكن دون الحاجة إلى مجموعات مستشعرات باهظة الثمن أو مخططات مهام صارمة ومحددة مسبقًا.