Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?
تقترح الورقة البحثية TFM-S3، وهي طريقة هجينة فعالة في استهلاك العينات تسخر نموذجاً أساسياً جدولياً مُدرباً مسبقاً لتوجيه الاستكشاف العالمي ضمن فضاء فرعي للسياسة يتم تحديثه ديناميكياً، مما يؤدي إلى تسريع التقارب وتحسين الأداء في التحكم الروبوتي المستمر عالي الأبعاد مقارنة بالنماذج المرجعية الحالية.
تخيل أنك تعلم روبوتًا كيف يمشي، أو يركض، أو يحافظ على توازنه. لا يشبه هذا تعليم كلب حيلة ما؛ بل يشبه محاولة إيجاد المزيج المثالي من ملايين الأزرار الصغيرة على لوحة تحكم ضخمة لجعل الروبوت يتحرك بسلاسة. هذا هو تحدي تعلم سياسة الروبوت (Robot Policy Learning).
تقدم الورقة البحثية طريقة جديدة تسمى TFM-S3 لمساعدة الروبوتات على تعلم هذه المهارات بشكل أسرع وبأخطاء أقل. إليك كيف تعمل، مشروحة من خلال تشبيهات بسيطة.
المشكلة: العلوق في الوحل
تعتمد الطرق الحالية لتعليم الروبوتات عادةً على الوقوع في فخين:
"المتنزه المحلي": هذه الطرق تشبه متنزهاً ينظر فقط إلى الأرض تحت قدميه مباشرة. يتخذ خطوات صغيرة لتسلق تلة (لتحسين مهارة الروبوت). لكن إذا بدأ في وادٍ صغير، فقد يعلق هناك، ولا يدرك بوجود جبل أعلى بكثير في مكان قريب. إنه يحتاج إلى الكثير من الوقت والطاقة للعثور على أفضل مسار.
"حفلة البحث العشوائية": ترسل طرق أخرى مئات الروبوتات في وقت واحد لتجربة تركيبات عشوائية من الأزرار. هذا أمر رائع للعثور على قمم جديدة، ولكنه مكلف للغاية. إنه يشبه استئجار جيش لتجربة كل مسار ممكن لمجرد معرفة أي منها يعمل. هذا يهدر الكثير من الموارد.
الحل: الخريطة الذكية والكشاف
يقترح المؤلفون TFM-S3، وهو نهج هجين يعمل مثل كشاف ذكي مع خريطة سحرية. فهو يجمع بين التسلق الدقيق لـ "المتنزه المحلي" والرؤية الواسعة لـ "حفلة البحث"، ولكنه يفعل ذلك بكفاءة عالية.
إليك العملية خطوة بخخوة:
1. إيجاد "الطريق السريع الرئيسي" (الفضاء الجزئي - The Subspace)
لوحة تحكم الروبوت تحتوي على مئات الآلاف من الأزرار. محاولة ضبطها جميعاً في وقت واحد أمر مستحيل.
التشبيه: تخيل عملية تعلم الروبوت كسيارة تقود على سهل شاسع ومسطح. لا تحتاج السيارة للقيادة في كل الاتجاهات؛ بل تحتاج فقط للقيادة على عدد قليل من "الطرق السريعة" المحددة حيث يحدث معظم التقدم.
الأسلوب: ينظر النظام إلى تاريخ تعلم الروبوت الأخير ويستخدم الرياضيات (تسمى SVD) للعثور على هذه "الطرق السريعة". إنه يتجاهل الملايين من الأزرار غير ذات الصلة ويركز فقط على العشرات القليلة التي تهم حقاً في تلك اللحظة. هذا يحول متاهة فوضوية إلى طريق مستقيم وبسيط.
2. "المتنبئ السحري" (النموذج التأسيسي الجدولي - The Tabular Foundation Model)
الآن بعد أن أصبح الروبوت على "الطريق السريع"، فإنه يحتاج إلى تحديد الاتجاه الذي سيسلكه.
التشبيه: عادةً، لمعرفة ما إذا كان المسار جيداً، عليك القيادة فيه فعلياً، لترى ما إذا كان سيؤدي إلى منحدر، ثم تعود أدراجك. هذا بطيء وخطير.
الابتكار: يستخدم المؤلفون "متنبئاً سحرياً" مُدرباً مسبقاً (نموذج تأسيسي جدولي). فكر في هذا كـ متنبئ جوي ذكي للغاية. بدلاً من قيادة السيارة للتحقق من الطقس، ينظر المتنبئ إلى بعض نقاط البيانات الأخيرة (مجموعة السياق) ويتنبأ بحالة الطف في مئات المسارات المحتملة الأخرى فوراً.
النتيجة: يمكن للنظام "محاكاة" القيادة في 256 مساراً مختلفاً في عقله، والتنبؤ بأيها سيؤدي إلى أفضل مكافأة، ومن ثم القيادة فعلياً في المسار الواحد الأفضل للتأكد. هذا يوفر قدراً هائلاً من الوقت والطاقة.
3. الحلقة: تسلق، امسح، كرر
تعمل الطريقة في دورة:
تسلق: يتخذ الروبوت خطوات صغيرة وحذرة (تحديثات محلية) ليصبح أفضل.
امسح: بين الحين والآخر، يتوقف النظام. يبني خريطة "طريقه السريع"، ويطلب من "المتنبئ السحري" فحص مئات التحركات المحتملة، ويختار الفائز، ثم يختبره.
كرر: يستخدم الروبوت هذا الموقع الجديد والأفضل لمواصلة التسلق.
لماذا هي أفضل؟
اختبر المؤلفون هذه الطريقة على ألعاب محاكاة الروبوتات القياسية (مثل جعل فهد افتراضي يركض أو إنسان يمشي).
السرعة: تعلم الروبوت الأساسيات بشكل أسرع بكثير من الطرق التقليدية.
الجودة: بنهاية التدريب، كان الروبوت أفضل في المهمة من أولئك الذين استخدموا الطرق القياسية، على الرغم من أنهم جميعاً استخدموا نفس القدر من "وقت الممارسة" (rollouts).
الموثوقية: كانت الطريقة أكثر اتساقاً. لم يكن يهم أي نقطة بداية عشوائية بدأ منها الروبوت؛ فقد وجد دائماً حلاً رائعاً تقريباً.
الخلاصة
TFM-S3 يشبه إعطاء الروبوت نظام GPS ينظر فقط إلى الطرق الأكثر أهمية و كرة بلورية تتنبأ بحركة المرور قبل أن تقود. إنه يمنع الروبوت من التسكع بلا هدف في حقل واسع من الخيارات ويمنعه من العلوق في وديان صغيرة. من خلال استخدام "عقل" مُدرب مسبقاً للتنبؤ بالنتائج، فإنه يجد أفضل التحركات بأقل قدر من التجربة والخطأ، مما يجعل تعلم الروبوت أسرع، وأرخص، وأكثر فعالية.
إليك ملخص تقني مفصل للورقة البحثية بعنوان: "هل يمكن لنماذج التأسيس الجدولية توجيه الاستكشاف في تعلم سياسات الروبوت؟"
1. بيان المشكلة
تتناول الورقة البحثية تحدي كفاءة العينات واستقرار التحسين في التحكم المستمر عالي الأبعاد للروبوتات باستخدام التعلم التعزيزي العميق (RL).
المقايضة بين المحلي والعالمي: تعمل الطرق القائمة على التدرج (مثل TD3 وSAC) تحديثات محلية في فضاءات المعلمات عالية الأبعاد. ورغم قابليتها للتوسع، إلا أنها غالبًا ما تقع في مناطق فرعية غير مثالية أو تتقارب ببطء بسبب التضاريس غير المحدبة. وفي المقابل، تستكشف طرق البحث العالمي (مثل استراتيجيات التطور أو التدريب القائم على السكان) مناطق أوسع ولكنها تتسبب في تكاليف تشغيل (rollout costs) باهظة (تفاعلات مع البيئة) بسبب "لعنة الأبعاد".
محددات النمذجة البديلة: يحاول التحسين البايزي (BO) تقليل تكاليف التشغيل باستخدام نماذج بديلة. ومع ذلك، يفشل الـ BO التقليدي في الفضاءات عالية الأبعاد (عشرات إلى مئات الآلاف من المعلمات) بسبب ندرة البيانات. علاوة على ذلك، فإن تضاريس السياسة في التعلم التعزيزي هي غير مستقرة (تتطور أثناء التدريب)، مما ينتهك افتراضات النطاق الثابت للـ BO التقليدي.
الفجوة: هناك حاجة إلى طريقة تجمع بين كفاءة العينات للبحث الموجه بالنموذج البديل وبين القدرة على التكيف المطلوبة لسياسات التعلم التعزيزي عالية الأبعاد والمتطورة، دون الحاجة إلى ميزانيات تفاعل ضخمة.
2. المنهجية: TFM-S3
يقترح المؤلفون إطار عمل TFM-S3 (البحث في الفضاء الفرعي الموجه بنموذج تأسيسي جدولي)، وهو إطار هجين يدمج التحديثات المحلية القائمة على التدرج مع جولات بحث عالمي دورية موجهة بالنموذج البديل.
أ. بناء فضاء فرعي دينامي منخفض الأبعاد
بدلاً من البحث في فضاء المعلمات الكامل عالي الأبعاد (RD)، يقيد TFM-S3 البحث العالمي في فضاء فرعي منخفض الأبعاد يتم تحديثه ديناميكيًا (Rr).
أساس مستوحى من التدرج: في كل جولة بحث t، تجمع الطريقة أحدث Q من لقطات تدرج السياسة (G(t)).
تحلل القيم المفردة (SVD): تقوم الطريقة بإجراء تحليل قيم مفردة مبتور (SVD) على G(t) لاستخراج أفضل r من المتجهات المفردة اليسرى (Ur). تشكل هذه المتجهات أساسًا متعامدًا A(t) يلتقط اتجاهات التحديث المهيمنة الملاحظة خلال التدريب الأخير.
التكيف: يتطور الفضاء الفرعي مع تقدم التدريب، مما يضمن تكيف هندسة البحث مع تغير تضاريس السياسة بدلاً من الاعتماد على إسقاطات عشوائية ثابتة.
ب. البحث العالمي الموجه بالنموذج البديل
داخل الفضاء الفرعي منخفض الأبعاد، يقوم TFM-S3 بعملية بحث تكرارية لإيجاد مرشحات السياسة عالية الأداء بأقل عدد من عمليات التشغيل (rollouts).
تهيئة السياق: يتم أخذ عينة من مجموعة صغيرة من السياسات المرشحة في الفضاء الفرعي وتقييمها عبر عمليات تشغيل حقيقية في البيئة لتكوين مجموعة سياقية (C).
النموذج التأسيسي الجدولي (TFM): يُستخدم نموذج تأسيسي جدولي مدرب مسبقًا (تحديدًا TabPFN-v2) كنموذج بديل. وخلافًا لعمليات غاوس (Gaussian Processes) التقليدية، فإن النماذج التأسيسية الجدولية (TFMs) مدربة مسبقًا على مهام انحدار متنوعة، مما يوفر انحيازات استقرائية قوية وتعميمًا قويًا من أحجام عينات صغيرة جدًا (مثل K=16).
حلقة التحسين التكرارية:
يتنبأ الـ TFM بالعوائد لمجموعة كبيرة من المرشحات الجديدة (N=256) التي تم أخذ عينات منها حول أفضل مرشح حالي.
يتم اختيار المرشح صاحب أعلى عائد متوقع.
يتم تقييم هذا المرشح الأفضل الوحيد فقط عبر تشغيل حقيقي (real rollout).
تُضاف النتيجة إلى المجموعة السياقية، مما يحدث شرط النموذج (conditioning) للـ TFM في التكرار التالي.
تتكرر هذه الحلقة T من المرات (مثلاً 16 تكرارًا) لكل جولة بحث.
تحديث السياسة: يتم إسقاط أفضل مرشح تم العثؤ عليه خلال جولة البحث مرة أخرى إلى الفضاء عالي الأبعاد ويُستخدم لتهيئة المرحلة التالية من التدريب المحلي القائم على التدرج.
3. المساهمات الرئيسية
البحث في الفضاء الفرعي الدينامي: قدم المؤلفون إجراء SVD مستوحى من التدرج لبناء فضاءات سياسة فرعية منخفضة الأبعاد تتكيف مع مسار التحسين المتطور، مما يحل مشكلة عدم الاستقرار المتأصلة في التعلم التعزيزي.
النماذج البديلة التأسيسية: أثبتوا أن النماذج التأسيسية الجدولية المدربة مسبقًا يمكن أن تعمل كنماذج بديلة فعالة وخالية من الضبط لتوقع العوائد في التعلم التعزيزي، مما يسمح بفحص المرشحين بدقة باستخدام بيانات محدودة للغاية (التعميم من عينات صغيرة).
إطار عمل هجين عالي الكفاءة: نجح TFM-S3 في سد الفجوة بين التعلم التعزيزي القائم على التدرج والبحث العالمي، محققًا تقاربًا أسرع وأداءً نهائيًا أفضل مقارنة بالنماذج المرجعية تحت نفس ميزانية التشغيل.
4. النتائج التجريبية
تم تقييم الطريقة على ثلاث اختبارات تحكم مستمر من MuJoCo وهي: HalfCheetah-v5، وAnt-v5، وHumanoid-v5، باستخدام TD3 كخوارزمية أساسية.
الأداء: حقق TFM-S3 تسارعًا في التقارب في المراحل المبكرة بشكل مستمر وحقق عوائد نهائية أعلى مقارنة بـ TD3 التقليدي، والبحث العشوائي في نفس الفضاء الفرعي، ونسخة "المرة الواحدة" (One-Shot) (بدون تحسين تكراري).
الكفاءة: تحت ميزانية ثابتة قدرها مليون خطوة بيئة، وصل TFM-S3 إلى عتبات الأداء المستهدفة بشكل أسرع بكثير (على سبيل المثال، الوصول إلى 90% من الأداء النهائي في حوالي 38% من الخطوات لـ Humanoid مقابل 48% لـ TD3 التقليدي).
الاستقرار: قللت الطريقة من التباين عبر البذور العشوائية (random seeds)، مما يشير إلى تحديثات أكثر استقرارًا للسياسة.
الديناميكيات الداخلية:
اتساق التصنيف: أظهر الـ TFM ارتباط سبيرمان (Spearman rank correlation) عاليًا (يصل إلى 0.97) بين العوائد المتوقة والحقيقية بعد مرحلة الإحماء الأولية.
جودة الاختيار: وقع المرشح الأول الذي اختاره الـ TFM ضمن أفضل 20% من العوائد الحقيقية في 63.5% من الحالات، مقارنة بـ 20% فقط للاختيار العشوائي.
فائدة التكرار: كان أداء نسخة "المرة الواحدة" (One-Shot) أقل من النسخة التكرارية الكاملة، مما يثبت أن التحسين المتسلسل (تحديث النموذج البديل ببيانات حقيقية جديدة) أمر بالغ الأهمية للنجاح.
5. الأهمية
نموذج جديد للتعلم التعزيزي: يرسخ هذا العمل النماذج التأسيسية الجدولية كأدوات قوية لتعلم سياسات الروبوت، متجاوزة استخدامها التقليدي في البيانات الجدولية الثابتة إلى مشاكل التحكم الديناميكي عالي الأبعاد.
سد الفجوة: يقدم حلاً عمليًا لعنق زجاجة "كفاءة العينات" في الروبوتات. فمن خلال الجمع بين تقليل الأبعاد (SVD) والتحيزات المسبقة عالية الكفاءة في البيانات (TFM)، فإنه يتيح الاستكشاف العالمي دون التكلفة الحسابية الهائلة للطرق القائمة على السكان.
النمطية (Modularity): إطار العمل مستقل عن خوارزمية التعلم التعزيزي الأساسية (كما ظهر مع TD3 ولكنه قابل للتطبيق على SAC وPPO، إلخ.)، مما يجعله تعزيزًا متعدد الاستخدامات لخطوط أنابيب تحسين السياسة الحالية.
في الختام، يوضح TFM-S3 أن الاستفادة من النماذج التأسيسية المدربة مسبقًا داخل مجمعات (manifolds) منخفضة الأبعاد يتم إعادة بناؤها ديناميكيًا يمكن أن يحسن بشكل كبير من كفاءة العينات ومتانة تعلم سياسة الروبوت.