A Rapid Deployment Pipeline for Autonomous Humanoid Grasping Based on Foundation Models
تقدم هذه الورقة مساراً للنشر السريع من الطرف إلى الطرف يستفيد من النماذج التأسيسية للتعليق التوضيحي التلقائي، وإعادة البناء ثلاثي الأبعاد، وتتبع الوضعية بصفر من الأمثلة (zero-shot)، وذلك لتقليل وقت التهيئة لمهام الإمساك البشرية الجديدة من أيام إلى حوالي 30 دقيقة مع تحقيق دقة عالية وتنفيذ ناجح في العالم الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد تعليم روبوت بشري (مثل خادم مستقبلي) كيفية التقاط جسم جديد، لنقل زجاجة صودا من علامة تجارية معينة.
الطريقة القديمة (طريقة "البطيئة والمكلفة"):
تقليديًا، كان القيام بذلك يشبه استئجار فريق من المهندسين المعماريين والمصورين والمدربين لمدة أسبوع.
- سيتعين عليك التقاط مئات الصور.
- سيتعين على إنسان الجلوس هناك ورسم مربعات حول الزجاجة في كل صورة (مثل لعبة "أين والدو" المملة).
- ستحتاج إلى ماسح ضوئي ثلاثي الأبعاد متخصص وباهظ الثمن لبناء نموذج مثالي للزجاجة.
- أخيرًا، ستقضي أيامًا في تدريب عقل الروبوت للتعرف عليها.
إجمالي الوقت: من يوم إلى يومين لكل جسم. التكلفة: عالية.
الطريقة الجديدة (مسار "النشر السريع"):
تقدم هذه الورقة البحثية "اختصارًا ذكيًا" يجعل الروبوت جاهزًا في حوالي 30 دقيقة. يفعل ذلك من خلال ربط ثلاثة "نماذج تأسيسية" (Foundation Models) — وهي بمثابة عقول ذكاء اصطناعي فائقة الذكاء ومدربة مسبقًا تعرف بالفعل كيف ترى وتفهم العالم.
إليك كيف تسير العملية باستخدام تشبيه بسيط:
1. "الملصق الذكي" (Roboflow + YOLOv8)
- المشكلة: يحتاج الروبوت إلى معرفة ماهية هذا الجسم.
- الحل: بدلًا من قيام إنسان برسم المربعات لساعات، تأخذ حوالي 150 صورة للزجاجة وترفعها إلى أداة تسمى Roboflow. تستخدم هذه الأداة ذكاءً اصطناعيًا يسمى SAM (نموذج التجزئة الشامل - Segment Anything Model) لرسم المربعات تلقائيًا نيابة عنك.
- النتيجة: في دقائق، يمتلك الروبوت "دليل تدريب" (كاشف YOLOv8) يعرف بالضبط كيف تبدو زجاجة الصودا، حتى من زوايا غريبة. إنه يشبه إعطاء الروبوت جلسة مراجعة سريعة للبطاقات التعليمية بدلًا من دورة دراسية كاملة.
2. "الماسح الضوئي السحري ثلاثي الأبعاد" (Meta SAM 3D)
- المشكلة: يحتاج الروبوت إلى معرفة شكل الجسم في الأبعاد الثلاثية ليمسكه دون تحطيمه. عادةً، تحتاج إلى ماسح ليزر بقيمة 50,000 دولار.
- الحل: ما عليك سوى التقاط صورة واحدة للزجاجة بهاتفك أو بكاميرا عادية. تقوم بتغذية هذه الصورة في Meta SAM 3D، وهو ذكاء اصطناعي يمكنه "تخيل" الشكل ثلاثي الأبعاد والملمس للجسم من صورة واحدة فقط.
- النتيجة: في حوالي 5 دقائق، تحصل على نموذج رقمي ثلاثي الأبعاد للزجاجة. الأمر يشبه أخذ صورة مسطحة وطيّها سحريًا لتصبح منحوتة ثلاثية الأبعاد.
3. "المتتبع صفر-الخطوة" (FoundationPose)
- المشكلة: الآن يحتاج الروبوت إلى تتبع الزجاجة أثناء حركتها، لكي يتمكن من التقاطها بينما يتم حملها أو تنزلق على الطاولة.
- الحل: يستخدم الروبوت FoundationPose، وهو ذكاء اصطناعي يعمل كـ "حرباء". فهو لا يحتاج إلى إعادة التدريب لكل جسم جديد؛ بل يأخذ ببساطة النموذج ثلاثي الأبعاد الذي صنعته في الخطوة 2 ومقطع الفيديو المباشر من الكاميرا. هو يحدد فورًا مكان الزجاجة بدقة في الفضاء ثلاثي الأبعاد (الموقع والدوران) بمعدل 30 مرة في الثانية.
- النتيجة: عينا الروبوت مثبتتان على الهدف، وتعرفان بالضبط أين تمتد يدها، حتى لو كانت الزجاجة تدور.
الختام الكبير: "التوأم الافتراضي" والتنفيذ
بمجرد أن يعرف الروبوت ماهية الجسم وأين يوجد، يستخدم النظام محاكاة Unity (محرك ألعاب فيديو) لتخطيط الحركة.
- فكر في هذا كأن الروبوت يتدرب على الحركة في لعبة فيديو أولًا.
- يقوم بحساب المسار المثالي لذراعه وأصابعه.
- ثم يرسل هذه التعليمات إلى الروبوت الحقيقي (Unitree G1) عبر اتصال إنترنت سريع (UDP).
- ينفذ الروبوت الحركة، ويمسك بالزجاجة، ويرفعها.
لماذا يعد هذا أمرًا هامًا
- السرعة: ما كان يستغرق يومين أصبح يستغرق 30 دقيقة.
- التكلفة: لا تحتاج إلى ماسحات ليزر باهظة الثمن؛ كاميرا عادية أو هاتف ذكي يكفيان.
- تعدد الاستخدامات: لم يختبر المؤلفون هذا النظام على زجاجات الصودا فحسب، بل أيضًا على مهمة مختلفة تمامًا: وضع الغراء على نافذة سيارة. لقد قاموا فقط باستبدال "نموذج الجسم" و"صور التدريب"، وعمل نفس النظام بشكل مثالي.
العائق (القيود)
النظام ليس مثاليًا بعد. إذا كان الجسم لامعًا، أو شفافًا، أو عاكسًا (مثل زجاجة زجاجية أو مرآة)، فإن "الماسح الضوئي السحري ثلاثي الأبعاد" قد يرتبك أحيانًا ويصنع شكلًا غريبًا. في هذه الحالات، قد تظل بحاجة إلى تدخل بشري لإصلاح النموذج ثلاثي الأبعاد. أيضًا، إذا اختفى الجسم تمامًا من رؤية الكاميرا لفترة طويلة، يفقد الروبوت تتبعه ويضطر للانتظار حتى يجد "الملصق الذكي" الجسم مرة أخرى.
الخلاصة
تظهر هذه الورقة البحثية أنه من خلال الجمع بين عقول الذكاء الاصطناعي القوية والمدربة مسبقًا وبين الكاميرات العادية، يمكننا تحويل الروبوتات البشرية من آلات جامدة وبطيئة البرمجة إلى مساعدين رشيقين يمكنهم تعلم مهام جديدة بشكل فوري تقريبًا. إنه الفرق بين بناء بدلة مخصصة لكل وظة جديدة، وبين امتلاك روبوت يمكنه "تجربة" أي زي يراه فورًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.