← أحدث الأبحاث
💻 computer science

GraphPoint: Semantic Entity Graphs and Point Trajectories for Compositional Robot Manipulation

تقدم هذه الورقة البحثية GraphPoint، وهو إطار عمل يربط الرسوم البيانية للكيانات الدلالية بالتحكم الهندسي عبر مسارات القابض المتوقعة لتحسين التعميم المعتمد على التعليمات في التلاعب الروبوتي، والذي تم التحقق من صحته بواسطة معيار CoMani الجديد المصمم لاختبار إعادة الاستخدام التركيبي عبر المهام الفرعية وداخل المهام الفرعية.

المؤلفون الأصليون: Kang Luo, Hesheng Wang

نُشر 2026-09-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kang Luo, Hesheng Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

أصبحت الروبوتات التي يمكنها التقاط كوب أو وضع وعاء على طاولة مشاهد شائعة في مختبرات الأبحاث، ومع ذلك، غالباً ما تعاني هذه الآلات عندما تتغير التعليمات قليلاً. فالروبوت الذي تم تدريبه على وضع وعاء فوق طبق قد يفشل إذا طُلب منه وضع الوعاء نفسه إلى يمين الطبق، أو إذا طُلب منه مسحه إلى هناك بدلاً من رفعه. يحدث هذا لأن العديد من الأنظمة الحالية تتعلم مطابقة صورة محددة للمشهد مع حركة معينة، بدلاً من الفهم الحقيقي للكلمات التي تصف ما يجب القيام به. فعندما يبدو المشهد البصري مألوفاً، يعتمد الروبوت على هذا الاختصار البصري ويتجاهل التعليمات الجديدة. ولبناء روبوتات يمكنها التكيف حقاً، يحتاج الباحثون إلى تعليمها كيفية فصل معنى الشيء عن موقعه، وفهم كيفية دمج وخلط الأفعال بطرق جديدة.

قام فريق من الباحثين في جامعة شانغهاي جياو تونغ بتطوير نهج جديد لحل هذه المشكلة، حيث قدموا نظاماً يسمى "GraphPoint". فبدلاً من التعامل مع رؤية الروبوت كصورة واحدة غير منظمة أو سحابة من النقاط، يقوم هذا النظام بتفكيك المشهد إلى خريطة من الأدوار المحددة؛ إذ يحدد يد الروبوت، والشيء المراد تحريكه، والوجهة المستهدفة ككيانات متميزة. ثم يستخدم النظام نموذج لغة ضخماً لقراءة التعليمات البشرية وترجمتها إلى خطة مهيكلة تحدد بدقة كيفية تفاعل هذه الأدوار مع بعضها البعض. على سبيل المثال، إذا قال شخص ما "ضع الوعاء على الطبق"، فإن النظام يفهم أن الوعاء هو الشيء المراد تحريكه، والطبق هو الهدف، والعملية هي "الوضع". ومن الأهمية بمكان أنه يبقي هذه الأدوار منفصلة في منطقه الداخلي، مما يسمح له بتطبيق منطق "الوضع" نفسه على شيء مختلف أو هدف مختلف دون الحاجة إلى إعادة تعلم الحركة بأكملها من البداية.

اختبر الباحثون فكرتهم باستخدام مجموعة جديدة من التحديات التي ابتكروها، والتي أطلقوا عليها اسم "CoMani". صُممت ساحة الاختبار هذه لعزل أنواع محددة من التعلم. ففي مجموعة واحدة من الاختبارات، طُلب من الروبوت تنفيذ نفس الإجراء، مثل وضع شيء ما، ولكن بتعليمات مختلفة حول مكان وضعه، مثل "على الطبق" مقابل "إلى يمين الطبق". وفي مجموعة أخرى، كان على الروبوت استخدام أنواع مختلفة من الحركات، مثل مسح شيء ما بدلاً من رفعه. وأخيراً، اختبروا ما إذا كان بإمكان الروبوت ربط عدة مهام بسيطة في تسلسل أطول لم يره من قبل، مثل تحريك زجاجة، ثم وعاء، ثم قطعة من الجبن، بترتيب محدد. كان الهدف هو معرفة ما إذا كان بإمكان الروبوت الاعتماد على الكلمات التي يسمعها بدلاً من مجرد حفظ الأنماط البصرية للغرفة.

أظهرت النتائج أن "GraphPoint" تفوق بشكل كبير على الأساليب الرائدة الأخرى في هذه الاختبارات. فعندما تغيرت التعليمات لتغيير العلاقة بين الأشياء، مثل طلب وضع عنصر إلى اليمين بدلاً من فوقه، نجح "GraphPoint" في جميع الحالات تقريباً، بينما فشلت الأنظمة الأخرى غالباً لأنها كانت عالقة في التخطيط البصري للمشهد. كما أثبت النظام قدرته على تعلم أنواع جديدة من الأفعال؛ فعندما طُلب منه تدوير مقبض، وهي مهمة لم يسبق له التدرب عليها، نجح في تطبيق مفهوم التدوير على جسم جديد. والأكثر إثارة للإعجاب هو أنه عند مواجهة تسلسل مكون من ثلاث خطوات لم يتدرب عليه كمجموعة كاملة، تمكن النظام من إكمال الخطوتين الأوليين بشكل صحيح في أكثر من 80 بالمائة من المحاولات، وإنهاء الخطوات الثلاث جميعها في حوالي نصف التجارب. وقد أثبت ذلك أن الروبوت يمكنه أخذ مهارات بسيطة تعلمها بشكل فردي ودمجها لاتباع تعليمات معقدة متعددة الخطوات.

يعتمد نجاح هذا النظام على كيفية معالجته للمعلومات. فبدلاً من العمل مع المواقع المطلقة في الغرفة، يصف النظام كل شيء بالنسبة ليد الروبوت نفسها. وهذا يسمح للروبوت بفهم أن تحريك شيء ما "إلى اليمين" يعني الشيء نفسه بغض النظر عن مكان بدء تحرك ذلك الشيء. كما يستخدم النظام تقنية يتم فيها إخفاء الشكل التفصيلي للأشياء مؤقتاً أثناء التدريب، مما يجبره على الانتباه إلى التعليمات اللغوية وأدوار الأشياء بدلاً من مجرد حفظ شكل الأشياء. ومن خلال ترسيخ حركات الروبوت في خريطة دلالية للأدوار والعلاقات، نجح الباحثون في إنشاء سياسة تستجيب للتغيرات اللغوية حتى عندما يظل المشهد البصري كما هو. ويشير هذا العمل إلى أنه لكي تصبح الروبوتات مفيدة حقاً في البيئات الديناميكية، يجب أن تتعلم معاملة التعليمات كدليل أساسي للفعل، بدلاً من معاملة الأنماط البصرية كمصدر وحيد للحقيقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →