GraphPoint: Semantic Entity Graphs and Point Trajectories for Compositional Robot Manipulation
تقدم هذه الورقة البحثية GraphPoint، وهو إطار عمل يربط الرسوم البيانية للكيانات الدلالية بالتحكم الهندسي عبر مسارات القابض المتوقعة لتحسين التعميم المعتمد على التعليمات في التلاعب الروبوتي، والذي تم التحقق من صحته بواسطة معيار CoMani الجديد المصمم لاختبار إعادة الاستخدام التركيبي عبر المهام الفرعية وداخل المهام الفرعية.
أصبحت الروبوتات التي يمكنها التقاط كوب أو وضع وعاء على طاولة مشاهد شائعة في مختبرات الأبحاث، ومع ذلك، غالباً ما تعاني هذه الآلات عندما تتغير التعليمات قليلاً. فالروبوت الذي تم تدريبه على وضع وعاء فوق طبق قد يفشل إذا طُلب منه وضع الوعاء نفسه إلى يمين الطبق، أو إذا طُلب منه مسحه إلى هناك بدلاً من رفعه. يحدث هذا لأن العديد من الأنظمة الحالية تتعلم مطابقة صورة محددة للمشهد مع حركة معينة، بدلاً من الفهم الحقيقي للكلمات التي تصف ما يجب القيام به. فعندما يبدو المشهد البصري مألوفاً، يعتمد الروبوت على هذا الاختصار البصري ويتجاهل التعليمات الجديدة. ولبناء روبوتات يمكنها التكيف حقاً، يحتاج الباحثون إلى تعليمها كيفية فصل معنى الشيء عن موقعه، وفهم كيفية دمج وخلط الأفعال بطرق جديدة.
قام فريق من الباحثين في جامعة شانغهاي جياو تونغ بتطوير نهج جديد لحل هذه المشكلة، حيث قدموا نظاماً يسمى "GraphPoint". فبدلاً من التعامل مع رؤية الروبوت كصورة واحدة غير منظمة أو سحابة من النقاط، يقوم هذا النظام بتفكيك المشهد إلى خريطة من الأدوار المحددة؛ إذ يحدد يد الروبوت، والشيء المراد تحريكه، والوجهة المستهدفة ككيانات متميزة. ثم يستخدم النظام نموذج لغة ضخماً لقراءة التعليمات البشرية وترجمتها إلى خطة مهيكلة تحدد بدقة كيفية تفاعل هذه الأدوار مع بعضها البعض. على سبيل المثال، إذا قال شخص ما "ضع الوعاء على الطبق"، فإن النظام يفهم أن الوعاء هو الشيء المراد تحريكه، والطبق هو الهدف، والعملية هي "الوضع". ومن الأهمية بمكان أنه يبقي هذه الأدوار منفصلة في منطقه الداخلي، مما يسمح له بتطبيق منطق "الوضع" نفسه على شيء مختلف أو هدف مختلف دون الحاجة إلى إعادة تعلم الحركة بأكملها من البداية.
اختبر الباحثون فكرتهم باستخدام مجموعة جديدة من التحديات التي ابتكروها، والتي أطلقوا عليها اسم "CoMani". صُممت ساحة الاختبار هذه لعزل أنواع محددة من التعلم. ففي مجموعة واحدة من الاختبارات، طُلب من الروبوت تنفيذ نفس الإجراء، مثل وضع شيء ما، ولكن بتعليمات مختلفة حول مكان وضعه، مثل "على الطبق" مقابل "إلى يمين الطبق". وفي مجموعة أخرى، كان على الروبوت استخدام أنواع مختلفة من الحركات، مثل مسح شيء ما بدلاً من رفعه. وأخيراً، اختبروا ما إذا كان بإمكان الروبوت ربط عدة مهام بسيطة في تسلسل أطول لم يره من قبل، مثل تحريك زجاجة، ثم وعاء، ثم قطعة من الجبن، بترتيب محدد. كان الهدف هو معرفة ما إذا كان بإمكان الروبوت الاعتماد على الكلمات التي يسمعها بدلاً من مجرد حفظ الأنماط البصرية للغرفة.
أظهرت النتائج أن "GraphPoint" تفوق بشكل كبير على الأساليب الرائدة الأخرى في هذه الاختبارات. فعندما تغيرت التعليمات لتغيير العلاقة بين الأشياء، مثل طلب وضع عنصر إلى اليمين بدلاً من فوقه، نجح "GraphPoint" في جميع الحالات تقريباً، بينما فشلت الأنظمة الأخرى غالباً لأنها كانت عالقة في التخطيط البصري للمشهد. كما أثبت النظام قدرته على تعلم أنواع جديدة من الأفعال؛ فعندما طُلب منه تدوير مقبض، وهي مهمة لم يسبق له التدرب عليها، نجح في تطبيق مفهوم التدوير على جسم جديد. والأكثر إثارة للإعجاب هو أنه عند مواجهة تسلسل مكون من ثلاث خطوات لم يتدرب عليه كمجموعة كاملة، تمكن النظام من إكمال الخطوتين الأوليين بشكل صحيح في أكثر من 80 بالمائة من المحاولات، وإنهاء الخطوات الثلاث جميعها في حوالي نصف التجارب. وقد أثبت ذلك أن الروبوت يمكنه أخذ مهارات بسيطة تعلمها بشكل فردي ودمجها لاتباع تعليمات معقدة متعددة الخطوات.
يعتمد نجاح هذا النظام على كيفية معالجته للمعلومات. فبدلاً من العمل مع المواقع المطلقة في الغرفة، يصف النظام كل شيء بالنسبة ليد الروبوت نفسها. وهذا يسمح للروبوت بفهم أن تحريك شيء ما "إلى اليمين" يعني الشيء نفسه بغض النظر عن مكان بدء تحرك ذلك الشيء. كما يستخدم النظام تقنية يتم فيها إخفاء الشكل التفصيلي للأشياء مؤقتاً أثناء التدريب، مما يجبره على الانتباه إلى التعليمات اللغوية وأدوار الأشياء بدلاً من مجرد حفظ شكل الأشياء. ومن خلال ترسيخ حركات الروبوت في خريطة دلالية للأدوار والعلاقات، نجح الباحثون في إنشاء سياسة تستجيب للتغيرات اللغوية حتى عندما يظل المشهد البصري كما هو. ويشير هذا العمل إلى أنه لكي تصبح الروبوتات مفيدة حقاً في البيئات الديناميكية، يجب أن تتعلم معاملة التعليمات كدليل أساسي للفعل، بدلاً من معاملة الأنماط البصرية كمصدر وحيد للحقيقة.
ملخص تقني: GraphPoint
بيان المشكلة غالبًا ما تفشل سياسات التحكم في الروبوتات في التعميم خارج نطاق عروض التدريب الخاصة بها، حتى عندما تتضمن التعليمات الجديدة كائنات وسلوكيات مألوفة. فعندما تكون اللغة والمشاهد البصرية مرتبطة بقوة أثناء التدريب، تميل السياسات إلى تعلم خرائط ثابتة (اختصارات) بين الرؤية والفعل بدلاً من الاستجابة للسلوك المطلوب. يتجلى هذا القصور في شكلين من أشكال التعميم التركيبي:
التعميم داخل المهام الفرعية: القدرة على إعادة دمج العوامل الدلالية المألوفة (الكيانات، أنواع الأفعال، والمعدلات) بطرق جديدة ضمن تفاعل ذري واحد.
التعميم عبر المهام الفرعية: القدرة على إعادة استخدام المهام الفرعية الذرية المتعلمة لتنفيذ تعليمات طويلة المدى غير مرئية دون الحاجة إلى عروض توضيحية صريحة على مستوى التسلسل.
تحاول الأساليب الحالية، بما في ذلك السياسات القائمة على الصور، أو نقاط المشهد، أو نقاط الكيانات، تحسين الأداء في المهام التي تم عرضها، لكنها تعاني عندما يتم اقتران الكيانات المألوفة بمعدلات أفعال أو أنواع جديدة، أو عندما يجب إدارة الانتقالات بين المهام الفرعية بشكل ديناميكي.
المنهجية: GraphPoint يقترح المؤلفون GraphPoint، وهو إطار عمل يربط الرسوم البيانية للكيانات الدلالية بالتحكم الهندسي. الفكرة الجوهرية هي تمثيل حالة المناولة الحالية كرسم بياني للكيانات الدلالية، مما يجعل العلاقات الموجهة صريحة بدلاً من الاعتماد على الارتباطات البصرية الضمنية.
بناء المهمة إلى رسم بياني: يقوم نموذج لغوي كبير (LLM) بتحليل تعليمات اللغة الطبيعية إلى رسوم بيانية للمهام الفرعية المرتبة. تحدد كل مهمة فرعية أدواراً دلالية: الفاعل (A)، المفعول به (P)، والهدف (T). يتم تمثيل هذه الأدوار عبر تضمينات متعلمة. كما يتم ترميز أنواع الأفعال ومعدلاتها باستخدام مشفر لغوي مجمد (BGE) وإسقاطها لتهيئة السياسة.
كيانات النقاط المرتكزة: يعمل التحديد البصري (باستخدام VLM) والتتبع الزمني (باستخدام SAM 2) على تحديد الكائنات ذات الصلة بالمهمة. يتم تمثيل هذه الكائنات كسحب نقطية ثلاثية الأبعاد متفرقة (32 نقطة لكل كيان) بالنسبة لنقطة مركز أداة التحكم (TCP) الحالية. ويتم تمثيل الفاعل (المقبض) بست نقاط مفتاحية هندسية.
مشفر الرسم البياني للكيانات ذو الهيكل الدورِي: يعالج المشفر نقاط الكيانات باستخدام MLP مشترك ويتناوب بين الترميز المحلي (داخل كل كيان) والتفاعل العالمي (عبر الكيانات).
الإحداثيات النسبية: يتم التعبير عن جميع النقاط بالنسبة لـ TCP، مما يقلل الاعتماد على التموضع المطلق في المشهد.
الانتباه المشروط: تقوم آلية الانتباه العالمي بتبادل المعلومات بين ملخصات الكيانات المشروطة بأنواع الأفعال والمعدلات. يتم فرض سلسلة تفاعل "وسيطة للمفعول به" محددة (A↔P↔T)، مما يحجب الانتباه المباشر بين الفاعل والهدف لتشجيع التفاعل من خلال الكائن الذي يتم التعامل معه.
انهيار النقاط الواعي بالدور (RPC): أثناء التدريب، يتم انهيار مجموعات النقاط للمفعول به أو الهدف عشوائياً إلى مراكزها (centroids) لمنع النموذج من الاعتماد على الاختصارات القائمة على الشكل، مما يجبره على الاعتماد على الشروط الدلالية.
سياسة تدفق مسار النقاط: تتنبأ السياسة بمسارات نقاط المقبض المستقبلية (10 خطوات) وأوامر المقبض باستخدام مطابقة التدفق الشرطي. يتم التنبؤ بالمسار في إطار TCP النسبي. ويتم استعادة الوضعيات القابلة للتنفيذ عبر محاذاة صلبة بأقل المربعات للنقاط المفتاحية المتوقعة مع هندسة الروبوت.
التركيب طويل المدى: يقدر رأس التقدم اكتمال المهمة الفرعية بناءً على العلاقة بين المفعول به والهدف. وهذا يتيح "التبديل الذاتي" (SS)، حيث ينتقل النظام إلى المهمة الفرعية التالية بناءً على التقدم المتوقع بدلاً من الإشارات الخارجية، مما يسمح بإعادة استخدام سياسة ذرية واحدة عبر تسلسل.
الاختبار المعياري: CoMani لتقييم هذه القدرات بصرامة، قدم المؤلفون CoMani، وهو اختبار معياري بقطاعات محكومة:
CoMani-Mod: يختبر التعميم للمعدلات (مثل "على" مقابل "يمين") مع أنواع أفعال ثابتة. يستخدم مشاهد أولية متطابقة لضمان أن الإخفاقات ناتجة عن فهم العلاقات وليس الاختصارات البصرية.
CoMani-Act: يختبر التعميم لأنواع الأفعال (مثل "ضع" مقابل "اكنس" مقابل "دوّر") مع معدلات ثابتة. يقيم معدل النجاح المتسق مع الفعل (ACSR) لضمان أن الروبوت ينفذ الفعل المطلوب، وليس مجرد الوصول إلى الهدف.
CoMani-Seq: يختبر التركيب التسلسلي عبر ربط مهام فرعية ذرية في تعليمات مكونة من 3 خطوات دون بيانات تدريب على مستوى التسلسل.
النتائج الرئيسية تظهر التجار تجري على CoMani أن GraphPoint يتفوق على النماذج المرجعية المتنوعة (بما في ذلك ACT و Diffusion Policy و DP3 و Point Policy و CbF):
التعميم للمعدلات: يحقق GraphPoint متوسط معدل نجاح (SR) بنسبة 96.4% (80.0% في مهام خارج التوزيع) متفوقاً بشكل كبير على النماذج المرجعية التي غالباً ما تفشل في التعميم للمعدلات المحجوبة.
التعميم للأفعال: يحقق GraphPoint أعلى معدل نجاح متسق مع الفعل (ACSR) على الأفعال المحجوبة، بما في ذلك نقل فعل "التدوير" إلى كيان جديد (جبنة كريمية) حيث فشلت الطرق الأخرى تماماً.
التركيب التسلسلي: GraphPoint هو الطريقة الوحيدة القادرة على تنفيذ تسلسلات من 3 خطوات غير مرئية. باستخدام تبديل البيئة (ES)، حقق 82.5% SR لأول مهمتين فرعيتين و50.8% للتسلسل الكامل. وعند استخدام التبديل الذاتي (SS)، حقق 95.0% SR2 و 67.5% SR3. نادراً ما أكملت النماذج المرجعية حتى الخطوتين الأوليين.
دراسات الاستئصال: أدى إزالة "انهيار النقاط الواعي بالدور" (RPC) أو استخدام الإحداثيات المطلقة إلى خفض أداء خارج التوزيع (OOD) بشكل كبير، مما يؤكد ضرورة التنظيم الدلالي والأطر النسبية. كما أدى حذف التكييف اللغوي إلى خفض النجاح خارج التوزيع من 80% إلى 8.3%.
الأهمية والادعاءات يدعي البحث أن GraphPoint يعالج بنجاح التعميم المعتمد على التعليمات على المستويين الذري والتسلسلي. فمن خلال هيكلة السياسة صراحة حول الأدوار الدلالية وتكييف التفاعلات بناءً على المعدلات وأنواع الأفعال المستمدة من اللغة، يتجنب إطار العمل الاختصارات البصرية التي تعاني منها نماذج التعلم بالتقليد القياسية. إن استخدام الرسم البياني للكيانات الدلالية يسمح للروبوت بتفسير نفس المشهد البصري بشكل مختلف بناءً على التعليمات، وتسمح آلية التقدم المتوقع بتركيب مهارات متعلمة في مهام معقدة وغير مرئية. ويشير المؤلفون إلى أن القيود تكمن حالياً في الإدراك الأمامي (التحليل، التحديد، والتقطيع) والانسداد الشديد، والذي يمكن أن يعطل تتبع نقاط الكيان.