← أحدث الأبحاث
💻 computer science

VLEM: Real-Time 3D Vision-Language Embedding Mapping

يُعد VLEM إطار عمل في الوقت الفعلي يدمج تمثيلات لغوية-بصرية ثنائية الأبعاد محاذية للبكسلات من تدفقات RGB-D الخام في تمثيل ثلاثي الأبعاد متسق عالمياً ودقيق مترياً، مما يتيح تجزئة فائقة مفتوحة المجموعة ومعالجة روبوتية تفاعلية دون الحاجة إلى أوضاع حقيقية.

المؤلفون الأصليون: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

نُشر 2026-09-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات من أجل فهم العالم كما يفعل البشر. يمكن برمجتها للتعرف على كرسي معين أو باب محدد إذا عُرضت عليها أمثلة كافية، لكنها لا تستطيع بسهولة استيعاب جسم جديد بمجرد سماع وصف مثل "الكوب الأزرق" أو "صندوق الأدوات الثقيل". ينبع هذا القصور من الطريقة التي ترسم بها الروبوتات خرائط محيطها تقليديًا: فهي تبني نماذج هندسية دقيقة للمساحة، لكن هذه النماذج تفتقر إلى المعنى الغني والمرن الذي توفره اللغة. ولكي يتفاعل الروبوت حقًا مع بيئة ديناميكية، فإنه يحتاج إلى خريطة ليست دقيقة في المسافة والشكل فحسب، بل قابلة أيضًا للبحث باستخدام الكلمات التي نستخدمها كل يوم. لقد كان التحدي يكمن في الجمع بين الدقة المترية الحادة لخريطة ثلاثية الأبعاد والفهم الواسع والمفتوح للنماذج اللغوية الحديثة، كل ذلك مع العمل بالسرعة الكافية لكي يتحرك الروبوت ويتفاعل في الوقت الفعلي دون الحاجة إلى حاسوب خارق.

قام فريق من الباحثين في جامعة ليبن التقنية بتطوير نظام جديد يسمى VLEM، وهو اختصار لـ "رسم خرائط التضمين البصري اللغوي" (Vision-Language Embedding Mapping)، لحل هذه المشكلة. يعمل عملهم على سد الفجوة بين الرؤية والفهم من خلال إنشاء خريطة ثلاثية الأبعاد لا تخزن شكل الأشياء فحسب، بل تخزن أيضًا "بصمة رقمية" لما تبدو عليه تلك الأشياء وكيفية ارتباطها باللغة. وعلى عكس المحاولات السابقة التي كانت تتطلب بيانات كاميرا مثالية أو كميات هائلة من الذاكرة، يعمل هذا النظام مع تدفق بسيط من الصور الملونة وصور العمق من كاميرا قياسية. فهو يبني خريطة حية للعالم أثناء تحرك الروبوت، مما يسمح للمستخدم بأن يسأل: "أين آلة صنع القهوة؟" ويجعل الروبوت يشير فورًا إلى الجسم الصحيح، حتى لو لم يسبق له رؤية تلك الآلة المحددة من قبل.

يكمن جوهر النظام في كيفية معالجته للمعلومات المرئية. يمكن لنماذج الذكاء الاصطناعي الحديثة بالفعل فهم العلاقة بين الصور والنصوص عن طريق تحويلها إلى ناقلات رياضية، وهي في الأساس قوائم من الأرقام التي تمثل المعنى. ومع ذلك، تعمل هذه النماذج عادةً على صور مسطحة ثنائية الأبعاد. واجه الباحثون المهمة الصعبة المتمثلة في أخذ هذه المفاهيم ثنائية الأبعاد وإسقاطها في مساحة ثلاثية الأبعاد يمكن للروبوت التنقل فيها. وقد حققوا ذلك من خلال تقسيم رؤية الكاميرا إلى مناطق صغيرة، واستخراج بصمة معنى لكل منطقة، ثم دمج هذه البصمات معًا في سحابة نقاط ثلاثية الأبعاد متسقة. تعمل هذه السحابة كنظير رقمي للغرفة، حيث تحتوي كل نقطة فيها على موقع في الفضاء ومعنى دلالي مستمد من البيانات المرئية.

ما يجعل هذا النهج متميزًا هو كفاءته وقدرته على التعامل مع عدم اليقين. تحاول العديد من الأنظمة الموجودة بناء هذه الخرائط عن طريق تدريب شبكات عصبية معقدة على مجموعات بيانات كاملة، وهي عملية بطيئة وتتطلب معرفة الموقع الدقيق للكاميرا مسبقًا. في المقابل، يعمل VLEM في الوقت الفعلي، حيث يعالج الصور فور وصولها ويقدر موقع الكاميرا أثناء الحركة. وهو يستخدم طريقة ذكية لتنقية البيانات المرئية، عبر حجب الضوضاء الخلفية غير ذات الصلة لضمان أن يكون المعنى المرتبط بجسم ما نقيًا ودقيقًا. فعلى سبيل المثال، عندما ينظر النظام إلى آلة صنع القهوة، فإنه يعزل ذلك الجسم عن الجدار الموجود خلفه، مما يضمن عدم تخفيف "البصمة الرقمية" لآلة صنع القهوة بألوان الجدار. وهذا يسمح للروبوت بالتمييز بين الأشياء المتشابهة بدقة عالية، مثل التفريق بين مثقاب عام ومثقاب "بوش" (Bosch) محدد، وذلك ببساطة من خلال دقة الاستعلام النصي.

اختبر الباحثون نظامهم في بيئات متنوعة، من المطابخ والورش إلى طوابق المكاتب الكبيرة، باستخدام مجموعات بيانات ثابتة وتجارب روبوتية حية. ووجدوا أن طريقتهم أنتجت نتائج أفضل بكثير من الأنظمة الرائدة السابقة في تحديد الأشياء بناءً على الأوصاف النصية. وبينما عانت الأنظمة الأخرى غالبًا من حدود ضبابية أو تطلبت كميات هائلة من ذاكرة الكمبيوتر، تمكن VLEM من إنشاء خريطة مدمجة وعالية الجودة باستخدام أقل من 12 جيجابايت من ذاكرة الفيديو، وهو حجم يناسب بطاقات الرسوميات القياسية الموجودة في العديد من الحواسيب الحديثة. وتعد هذه الكفاءة أمرًا بالغ الأهمية لأنها تسمح للروبوت بتشغيل برنامج رسم الخرائط والتحكم في حركته في آن واحد دون تباطؤ. وفي العروض العملية، نجح النظام في توجيه ذراع روبوتية لالتقاط عناصر محددة ووضعها في أماكن مخصصة، بناءً على تعليمات منطوقة أو مكتوبة بسيطة.

يوحي نجاح VLEM بأن مستقبل التفاعل الروبوتي قد لا يعتمد على تعليم الروبوتات قائمة ثابتة من كل جسم في العالم، بل على منحها طريقة مرنة لفهم العالم من خلال اللغة. لقد أثبت النظام أنه من الممكن الحفاظ على تمثيل متري دقيق ثلاثي الأبعاد يكون أيضًا قابلًا للاستعلام باللغة الطبيعية، دون الحاجة إلى التدريب المسبق على البيئة المحددة أو بيانات كاميرا حقيقية. وأشار الباحثون إلى أنه بينما تعمل طريقتهم الحالية بشكل جيد لتحديد الأجسام الفردية، إلا أنها لا تستوعب بعد العلاقات المعقدة بين العناصر المختلفة، مثل معرفة أن الكوب موضوع على الطاولة. ومع ذلك، من خلال إثبات أن رسم الخرائط الدلالي عالي الجودة في الوقت الفعلي أمر ممكن باستخدام الأجهزة الحالية، فإن هذا العمل يوفر أساسًا متينًا للجيل القادم من الروبوتات التي يمكنها حقًا فهم العالم البشوي والتفاعل معه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →