تخيل أنك تعلم روبوتاً كيفية بناء برج من المكعبات. أنت تريد لهذا الروبوت أن يكون ذكياً وقادراً على التكيف تماماً كالبشر.
المشكلة في الروبوتات القديمة أدمغة الروبوتات الحالية (وتحديداً نوع من الذكاء الاصطناعي يسمى "محول الرؤية" - View Transformer) تشبه شخصاً يحاول التنقل في غرفة وهو يرتدي نظارات لا تعرض سوى صور ثابتة ومجمدة.
فهي تنظر إلى صورة للغرفة من اليسار، وصورة من اليمين، وصورة من الأعلى.
وهي بارعة جداً في فهم التخطيط إذا ظل كل شيء ثابتاً.
لكن العيب هنا هو: إذا حركتَ مكعباً فجأة بينما كان الروبوت يمد يده إليه، فلن يلاحظ الروبوت ذلك. سيستمر في مد يده نحو المكان القديم الذي كان فيه المكعب، ليصطدم بالهواء أو يقلب الأشياء. إنه يفتقر إلى "إدراك العمق ثلاثي الأبعاد" و"الاستجابة في الوقت الفعلي".
الحل: "السياسة القشرية" (Cortical Policy) نظر الباحثون في معهد هاربين للتكنولوجيا إلى كيفية حل الدماغ البشري لهذه المشكلة. ووجدوا أن دماغنا يحتوي على طريقين رئيسيين للرؤية يعملان معاً:
طريق "ماذا" (المسار البطني - Ventral Stream): يساعدنا على التعرف على الأشياء وفهم الشكل ثلاثي الأبعاد للغرفة. إنه يشبه الخريطة التفصيلية.
طريق "أين/كيف" (المسار الظهري - Dorsal Stream): يساعدنا على التفاعل مع الحركة. إنه يشبه الرادار الذي يتتبع الأجسام المتحركة ويخبر أيدينا أين تذهب الآن.
نظام الروبوت الجديد، Cortical Policy، ينسخ نظام الطرق السريعة ذو المسارين هذا.
كيف يعمل (التشبيه الإبداعي)
فكر في عقل الروبوت كأنه طاقم بناء يتكون من عاملين متخصصين:
1. المهندس المعماري (مسار الرؤية الثابتة)
الدور: هذا العامل يدرس المخططات والهيكل ثلاثي الأبعاد للغرفة.
كيف يعمل: بدلاً من مجرد النظر إلى صور ثنائية الأبعاد مسطحة، يستخدم هذا العامل "ماسحاً ضوئياً ثلاثي الأبعاد" خاصاً (نموذج ذكاء اصطناعي مدرب مسبقاً يسمى VGGT) لإيجاد نقاط متطابقة على الأشياء من زوايا مختلفة.
السحر: إنه يجبر الروبوت على فهم أن الكوب الذي يُرى من اليسار والكوب الذي يُرى من الأمام هما نفس الجسم ثلاثي الأبعاد. هذا يمنح الروبوت فهماً صلباً لا يتزعزع للمساحة. فهو يعرف بالضبط أين توجد الزجاجات، حتى لو تغيرت الإضاءة.
2. المراقب (مسار الرؤية الديناميكية)
الدور: هذا العامل هو "العين على الأرض". هو يراقب يد الروبوت (القابض) والهدف في الوقت الفعلي.
كيف يعمل: هذا العامل مستوحى من كيفية تتبع البشر لنظرهم. يستخدم الروبوت كاميرا على معصمه (مثل كاميرا GoPro على رأسك) لمراقبة الحدث.
السحر: إذا انزلق المكلب المستهدف إلى اليسار أثناء حركة الروبوت، فإن "المراقب" يراه فوراً. يصرخ قائلاً: "مهلاً، الهدف تحرك! عدّل مسارك!" هذا يسمح للروبوت بإعادة تخطيط حركته فوراً، تماماً مثل الإنسان الذي يمسك كرة ساقطة.
المصافحة (التواصل)
أخيراً، يتحدث المهندس المعماري والمراقب مع بعضهما البعض.
يقول المهندس المعماري: "من المفترض أن يكون المكعب هنا بناءً على الخريطة ثلاثية الأبعاد."
ويقول المراقب: "لكنني أرى أنه تحرك إلى هناك للتو!"
النتيجة: يجمع الروبوت بين الخريطة الصلبة ثلاثية الأبعاد وبيانات الحركة في الوقت الفعلي للقيام بالحركة المثالية.
لماذا هذا مهم (النتائج)
اختبر الباحثون عقل الروبوت الجديد بطريقتين:
في لعبة الفيديو (المحاكاة): ألقوا بآلاف التحديات عليه، بما في ذلك الأجسام المتحركة، وتغير الألوان، والإضاءة الغريبة. سحق الروبوت الجديد جميع المنافسين، ونجح في المواضع التي فشلت فيها الروبوتات القديمة.
في العالم الحقيقي: وضعوه على ذراع روبوت حقيقية. عندما حركنا مكعباً أثناء محاولة الروبوت الوصول إليه، اصطدمت الروبوتات القديمة. أما الروبوت الجديد (Cortical Policy)، فقد عدّل مساره بسلاسة ورصّ المكعب بشكل مثالي.
الخلاصة
الروبوتات السابقة كانت مثل المصورين الذين يحاولون قيادة سيارة عبر النظر فقط إلى صورة للطريق. لم يكن بإمكانهم التفاعل مع حركة المرور. أما Cortical Policy فهو مثل السائق البشري. لديه خريطة ذهنية للطريق (المسار الثابت) وهو أيضاً يراقب باستمرار السيارة التي أمامه ويعدل عجلة القيادة في الوقت الفعلي (المسار الديناميكي).
هذه الفكرة البسيطة والقوية — وهي محاكاة جزأين متميزين ومتصلين من النظام البصري البشري — تجعل الروبوتات أكثر أماناً، وأكثر ذكاءً، وجاهزة للعالم الحقيقي الفوضوي وغير المتوقع.
إليك ملخص تقني مفصل لورقة البحث بعنوان "Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation".
1. بيان المشكلة
تواجه عمليات المناولة الروبوتية في البيئات غير المهيكلة وغير المستقرة تحديين حرجين:
عدم كفاية الاستدلال المكاني ثلاثي الأبعاد: تقوم نماذج "View Transformers" الحالية (مثل RVT وRVT-2) عادةً باستخراج تمثيلات بصرية ثابتة عبر دمج معلومات المنظور ثنائية الأبعاد بشكل سطحي. وهي تفشل في نمذجة العلاقات بين المناظر المختلفة بفعالية، مما يؤدي إلى أخطاء في فهم الهياكل المكانية ثلاثية الأبعاد (مثل وضع جسم ما بين أجسام أخرى). كما أنها حساسة للاضطرابات البيئية مثل التغيرات في الإضاءة والملمس.
الافتقار إلى التكيف الديناميكي: تعتمد الطرق الحالية على تكوينات كاميرا ثابتة وتواجه صعوبة في التكيف عندما تتحرك الأجسام أثناء مرحلة الاقتراب. وغالبًا ما تستمر في مسارات مخططة مسبقًا حتى عندما يتزحزح الجسم المستهدف، مما يؤدي إلى فشل المهمة.
تجادل الورقة بأن هذه القيود تنبع من نقص التكامل بين فهم المشهد الساكن (ماذا وأين) واستدلال الحركة الديناميكي (كيف ومتى)، وهي قدرة يتعامل معها المساران البصريان في الدماغ البشري بشكل طبيعي.
2. المنهجية: Cortical Policy (السياسة القشرية)
مستوحاة من المسارين البطني (الساكن/ما هو الشيء) والظهري (الديناميكي/أين هو الشيء) في النظام البصري البشري، يقترح المؤلفون Cortical Policy، وهو محول منظور ثنائي المسار.
يعمل على تطوير نموذج RVT-2 backbone ولكنه يعززه بقيود هندسية.
الإشراف ثلاثي الأبعاد: يستخدم نموذج أساسي ثلاثي الأبعاد مدرب مسبقًا (VGGT) للتنبؤ بالعمق، والثقة، ومعلمات الكاميرا للمناظر الساكنة.
محاذاة النقاط الرئيسية: يحدد VGGT نقاط رئيسية متسقة هندسيًا عبر وجهات نظر مختلفة. يتم تدريب النموذج على محاذاة الميزات عند هذه المواقع ثلاثية الأبعاد المحددة عبر المناظر المختلفة.
دالة الخسارة: يقدم خسارة الاتساق الهندسي الدوري (Lcgc) باستخدام SmoothAP. وهذا يفرض أن تظل الميزات لنفس النقطة ثلاثية الأبعاد متشابهة عبر حلقة مغلقة من المناظر (v1→v2→⋯→v1)، مما يخلق تمثيلات ثابتة تجاه وجهات النظر.
ب. مسار المنظور الديناميكي (تشبيه المسار الظهري)
الهدف: تحقيق تعديل مسار تكيفي بناءً على إشارات الحركة في الوقت الفعلي.
الآلية:
يعالج إطارات الفيديو الديناميكية من منظور ذاتي (مثبتة على المعصم).
التدريب المسبق المعتمد على الموقع: بدلاً من التدريب من الصفر، قام المؤلفون بتكييف نموذج تقدير نظرة العين (Egocentric Gaze Estimation) مدرب مسبقًا (GLC). حيث قاموا ببناء مجموعة بيانات اصطناعية يكون فيها هدف "النظرة" هو موضع النهاية الطرفية للروبوت.
استخراج الميزات: يستخرج نموذج GLC المدرب مسبقًا (المجمد أثناء تدريب السياسة) خرائط الميزات وخرائط البروز (الخرائط الحرارية) من الإطارات الديناميكية. تسلط هذه الخرائط الضوء على الحركة ذات الصلة بالمهمة ومواقع النهاية الطرفية.
التكامل: يتم دمج هذه الميزات الديناميكية مع ميزات المسار الساكن لتوليد خرائط حرارية موجهة نحو الفعل.
ج. التنبؤ بالفعل
يتم دمج مخرجات كلا المسارين بواسطة رأس الفعل (Action Head).
الترجمة ثلاثية درجات الحرية (3-DoF Translation): يتم تحديدها عن طريق الإسقاط الخلفي لأعلى نقطة حاصلة على درجة من الخرائط الحرارية المدمجة.
الدوران/الحالة/الاصطدام: يتم التنبؤ بها باستخدام الميزات العالمية والمحلية المجمعة من المناظر الساكنة والديناميكية.
إجمالي الخسارة: يجمع بين خسارة التنبؤ بالفعل وخسارة الاتساق الهندسي الدوري (L=Laction+λLcgc).
3. المساهمات الرئيسية
بنية ثنائية المسار: أول محول منظور يدمج صراحةً بين المسارات الساكنة (الهيكل ثلاثي الأبعاد) والديناميكية (الحركة/المنظور الذاتي) لتعزيز التحكم البصري الحركي القوي.
الاتساق الهندسي عبر المناظر: يقدم هدف تعلم مبتكر باستخدام نموذج أساسي ثلاثي الأبعاد (VGGT) لفرض محاذاة الميزات عبر وجهات النظر، مما يحسن الاستدلال المكاني ثلاثي الأبعاد بشكل كبير دون الحاجة إلى إعادة بناء ثلاثية الأبعاد صريحة.
التكيف مع المنظور الديناميكي: صمم مسارًا جديدًا يستفيد من التدريب المسبق المعتمد على الموقع لنموذج تقدير النظرة لتمكين إعادة التخطيط الفوري للمسار عند تحرك الأجسام.
أداء رائد (SOTA): أظهر تحسينات جوهرية على النماذج المرجعية الحالية في كل من المحاكاة والواقع.
4. النتائج التجريبية
الاختبارات المعيارية
RLBench (18 مهمة): حققت Cortical Policy متوسط معدل نجاح بنسبة 81.0%، متفوقة على النموذج المرجعي السابق (RVT-2 بنسبة 77.5%) بمقدار 3.5%. وحققت أفضل أداء (المركز الأول أو الثاني) في 14 من أصل 18 مهمة، مما أظهر قوة خاصة في المهام المكانية متعددة الأجسام (مثل "رص الكؤوس"، "إغلاق البرطمان").
COLOSSEUM (التعميم): تم التقييم تحت اضطرابات شديدة (تغييرات في لون/حجم/ملمس الأجسام، الإضاءة، المشتتات، ووضعية الكاميرا). حققت Cortical Policy متوسط نجاح بنسبة 69.9%، متفوقة على RVT-2 بنسبة 9.4%. أكدت دراسات الاستئصال أن مسار المنظور الديناميكي هو المحرك الرئيسي لهذه القوة.
النشر في العالم الحقيقي: تم الاختبار باستخدام روبوت Franka Panda في أربع مهام، بما في ذلك سيناريوهات الإزاحة الديناميكية.
الاستدلال المكاني: حققت معدل نجاح أعلى بنسبة 30% من RVT/RVT-2 في المهام التي تتطلب وضعاً دقيقاً "بين" الأشياء.
التكيف الديناميكي: حققت نجاحاً بنسبة 80% في المهام التي تحرك فيها الهدف أثناء الاقتراب، بينما فشلت النماذج المرجعية التي تعتمد على المنظور الساكن فقط تماماً (0%).
دراسات الاستئصال (Ablation Studies)
أدى حذف المسار الديناميكي أو حذف خسارة الاتساق الهندسي (Lcgc) إلى انخفاض كبير في الأداء.
وُجد أن التدريب المسبق المعتمد على الموقع لنموذج النظرة كان متفوقاً على التدريب المشترك من البداية للنهاية.
أدى التصميم ثنائي المسار إلى تحسين الأداء دون التضحية بالكفاءة الحسابية مقارنة بالنماذج أحادية المسار الأكثر عمقاً.
5. الأهمية
يقلل هذا العمل الفجوة بين إدراك المشهد الساكن وتنفيذ الحركة الديناميكية في المناولة الروبوتية. من خلال محاكاة المعالجة ثنائية المسار في الدماغ البشري:
حل مشكلة الغموض ثلاثي الأبعاد المتأصلة في محولات المنظور ثنائية الأبعاد من خلال الاتساق الهندسي.
حل مشكلة التكيف الديناميكي من خلال دمج إشارات الحركة من المنظور الذاتي في الوقت الفعلي.
يوفر إطار عمل قابلاً للتوسع لا يعتمد على التمثيلات ثلاثية الأبعاد المكلفة حاسوبياً القائمة على الـ Voxel، بل يستفيد من قوة النماذج الأساسية (VGGT) والنماذج البصرية المدربة مسبقًا (GLC) لتعزيز السياسات الروبوتية.
تخلص الورقة إلى أن Cortical Policy تمثل خطوة هامة نحو مناولة روبوتية قوية تشبه سلوك البشر في البيئات الواقعية غير المتوقعة.