← أحدث الأبحاث
🤖 machine learning

Posterior-driven Heuristic Support Adaptation in a Probabilistic Treatment of Real2Sim2Real for Vision-Driven Deformable Linear Object Manipulation

تقترح هذه الورقة طريقة تكيف دعم استدلالي مدفوع بالاحتمال اللاحق (باستخدام استراتيجيات EDGE وMODE وCENTRE) للتغلب على قيود دعامات أخذ العينات الثابتة في الاستدلال الخالي من الاحتمالية، مما يحسن تحديد المعلمات وتعلم السياسات القوي للتحكم في الأجسام الخطية القابلة للتشوه في سيناريوهات Real2Sim2Real.

المؤلفون الأصليون: Georgios Kamaras, Craig Innes, Subramanian Ramamoorthy

نُشر 2026-09-10
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Georgios Kamaras, Craig Innes, Subramanian Ramamoorthy

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

أصبحت الروبوتات بارعة بشكل ملحوظ في التحرك عبر العالم، لكنها لا تزال تعاني مع الأشياء اللينة والطرية التي تشكل جزءاً كبيراً من حياتنا اليومية. فبإمكان ذراع معدنية صلبة التقاط كوب قهوة بسهولة، لكنها غالباً ما تفشل عندما يُطلب منها التعامل مع نودلز مبللة، أو قطعة قماش، أو خرطوم مطاطي. هذه الأجسام، المعروفة في المجتمع العلمي باسم "الأجسام الخطية القابلة للتشوه"، تغير شكلها باستمرار أثناء تحريكها. ولتعليم الروبوت كيفية التعامل معها، يقوم المهندسون عادةً ببناء توأم رقمي لهذا الجسم داخل الكمبيوتر؛ حيث يشغلون آلاف عمليات المحاكاة، تاركين الروبوت يتدرب في عالم افتراضي حتى يتعلم الحركات الصحيحة. وتكمن المشكلة في الفجوة بين ذلك العالم الافتراضي والواقع؛ فإذا افترض نموذج الكمبيوتر أن الخرطوم المطاطي أكثر صلابة أو أطول مما هو عليه في الواقع، فسوف يتعلم الروبوت مجموعة من المهارات التي تعمل بشكل مثالي في المحاكاة ولكنها تفشل تماماً عند محاولة استخدامها على الجسم الحقيقي.

ولسد هذه الفجوة، يستخدم الباحثون طريقة تسمى "الاستدلال الخالي من الاحتمالية" (likelihood-free inference). فكر في هذا الأمر كعملية تخمين مدروسة؛ حيث يراقب الروبوت جسماً حقيقياً، ويحاول الكمبيوتر استنتاج الخصائص الفيزيائية الخفية — مثل الطول والصلابة — التي تجعل النسخة الرقمية تتصرف تماماً مثل النسخة الحقيقية. يقوم الكمبيوتر بتوليد "توزيع لاحق" (posterior)، وهو في الأساس خريطة لأكثر القيم احتمالاً لهذه الخصائص. ومع ذلك، هناك فخ خفي في هذه العملية؛ فقبل أن يبدأ الكمبيوتر في التخمين، يجب على الباحث تحديد نطاق للقيم الممكنة، وهو حدود يجب أن تقع الإجابة ضمنها. وإذا تم تحديد هذا الحد الأولي بشكل غير صحيح، فسيُجبر أفضل تخمين للكمبيوتر على الالتصاق بحافة ذلك الصندوق، مما يؤدي إلى استنتاج واثق ولكنه خاطئ. وقد سعى الباحثون جورجيوس كاماراس، وكريغ إينس، وسوبرامانيان راماتورثي لحل هذه المشكلة تحديداً، متسائلين: كيف يمكن للكمبيوتر أن يدرك متى تكون حدوده الأولية خاطئة ويقوم بتعديلها أثناء العمل؟

ركز الفريق على مهمة تسلط الضل على صعوبة التعامل مع الأجسام اللينة: ذراع روبوت تقوم بضرب خرطوم مرن لضرب الجزء العلوي من مكعب فوق كومة. الهدف بسيط، لكن الفيزياء معقدة؛ إذ يجب أن يكون الخرطوم طويلاً وصلباً بما يكفي لنقل الزخم لضرب المكعب، ولكن ليس صلباً لدرجة تؤدي لكسر الكومة، ولا طويلاً لدرجة تسبب تشابكه. اختبر الباحثون أفكارهم أولاً على نموذج رياضي تجريدي أبسط لمجموعات المفترس والفريسة، وهو نظام معروف بسلوكه الفوضوي والمتذبذب. وفي هذه الاختبارات، أظهروا أنه عندما يُعطى الكمبيوتر نطاقاً من القيم لا يتضمن الإجابة الحقيقية، فإنه سيجمع كل ثقته عند حافة ذلك النطاق مباشرة، مما يخلق شعوراً زائفاً باليقين. ثم طوروا ثلاث استراتيجيات مختلفة لمساعدة الكمبيوتر على ملاحظة هذا الخطأ. الاستراتيجية الأولى، التي أطلقوا عليها اسم "إيدج" (EDGE)، تراقب أين تتراكم ثقة الكمبيوتر؛ فإذا كان الكمبيوتر مقتنعاً بأن الإجابة تقع عند حافة النطاق المسموح به تماماً، فإن استراتيجية "إيدج" تخبر الكمبيوتر بتوسيع ذلك النطاق نحو الخارج في ذلك الاتجاه. أما الاستراتيجيتان الأخريان، "مود" (MODE) و"سنتر" (CENTRE)، فتنظران إلى كيفية تحول أفضل تخمين للكمبيوتر بمرور الوقت أو أين يقع مركز ثقته، لكن نهج "إيدج" أثبت أنه الأكثر موثوقية.

ومع امتلاك هذه الطريقة الجديدة، انتقل الفريق إلى التجربة في العالم الحقيقي مع الروبوت وخراطيم المطاط. لقد صنعوا أربعة خراطيم مختلفة، تختلف في الطول والنعومة، ووضعوا كاميرا لمراقبة الروبوت وهو يحاول ضرب المكعبات من فوق الكومة. أجروا عملية الاستدلال، مما سمح للكمبيوتر بتعلم خصائص كل خرطوم. وعندما استخدموا الطريقة القياسية ذات الحدود الثابتة، غالباً ما كان الكمبيوتر يعلق، عاجزاً عن التمييز بين الخراطيم المختلفة قليلاً. ولكن عندما سمحوا للكمبيوتر باستخدام استراتيجية "إيدج" لتوسيع نطاق البحث الخاص به، تغيرت النتائج. أصبح بإمكان الكمبيوتر الآن التمييز بين خرطوم طوله 200 مليمتر وآخر طوله 290 مليمتر، وكان بإمكانه قياس صلابتهم بدقة. سمح هذا الفهم الأدق لهم بتدريب "سياسة روبوت" (robot policy) جديدة لكل خرطوم على حدما. فبدلاً من تعليم الروبوت طريقة عامة واحدة للتعامل مع جميع الخراطيم، علموه مهارة متخصصة لكل واحد منها.

كانت نتائج هذا التدريب المتخصص مذهلة. فعندما اختبر الباحثون الروبوتات في العالم الحقيقي، أدت الوكلاء (agents) الذين تم تدريبهم باستخدام الحدود الموسعة والمكيفة أداءً أفضل بكثير؛ فقد كانوا أكثر استقراراً، وتحركوا بهدف أوضح، وكانوا أكثر نجاحاً في ضرب المكعبات من فوق الكومة. وبالنسبة للخراطيم التي كانت حدودها الأولية ضيقة جداً، كان التحسن دراماتيكياً. تعلم الروبوت رفع الخرطوم إلى الارتفاع المناسب تماماً وضربة بقوة صحيحة، وهي سلوكيات ظهرت بشكل طبيعي لأن الكمبيوتر فهم أخيراً الحدود الفيزيائية الحقيقية للجسم. في المقابل، كانت الروبوتات المدربة بالحدود القديمة والثابتة تسحب الخرطوم عبر الطاولة أو تضربه بضعف، مما يؤدي للفشل في إزاحة الهدف.

يُظهر هذا العمل أن الطريقة التي نحدد بها مساحة البحث لتعلم الروبوت لا تقل أهمية عن خوارزمية التعلم نفسها. فمن خلال السماح للكمبيوتر بإدراك متى تنفد المساحة المتاحة للتفكير وتوسيع حدوده وفقاً لذلك، نجح الباحثون في إنشاء نظام أكثر صدقاً بشأن ما يعرفه وأكثر قدرة على تعلم ما يحتاج لمعرفته. يعمل نهج "إيدج" كدليل بسيط ولكنه قوي، مما يضمن أن التدريب الرقمي للروبوت يعكس التعقيد الحقيقي للعالم المادي. لا يقتدي هذا النهج بجعل الروبوت أفضل في مهمة محددة فحسب، بل يقدم مساراً عاماً لتعليم الآلات كيفية التفاعل مع المواد اللينة وغير المتوقعة والمتغيرة باستمرار من حولنا. وتشير النتائج إلى أنه في المستقبل، قد لا يحتاج الروبوت إلى إخباره بما يتوقع بالضبط؛ بل يمكن منحهم الأدوات اللاكتشاف حدود فهمهم وتوسيعها مع تقدمهم في التعلم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →