Topological Necessities: Mechanism-Invariant Strategic Subgoals for Cross-Embodiment Goal-Conditioned Control
تقدم هذه الورقة "الضرورات الطوبولوجية"، وهو إطار عمل غير مرتبط بآلية محددة يستخلص أهدافاً فرعية لا يمكن تخطيها من المسارات غير المتصلة (offline trajectories) باستخدام الهومولوجيا (homology) لتمكين التحكم الموجه بالأهداف عالي الأداء وعابر التجسيد دون الحاجة لإعادة التدريب.
في عالم الذكاء الاصطناعي، يبرز تحدٍ كبير يتمثل في تعليم الآلات كيفية التخطيط لتسلسلات طويلة ومعقدة من الأفعال بناءً على التجارب السابقة. تخيل روبوتاً لم يسبق له رؤية غرفة معينة من قبل، لكنه شاهد آلاف الفيديوهات لروبوتات أخرى تتنقل في مساحات مماثلة. الهدف هو أن يتعلم هذا الروبوت الجديد كيفية الوصول إلى وجهة ما في تلك الغرفة غير المعهودة دون الحاجة إلى التجربة والخطأ في الواقع. هذا المجال، المعروف باسم التعلم المعزز غير المتصل (offline reinforcement learning)، يعتمد على تحليل البيانات الثابتة لبناء استراتيجية. ومع ذلك، كانت هناك مشكلة مستمرة تتمثل في أن الاستراتيجيات المتعلمة غالباً ما تكون مرتبطة ارتباطاً وثيقاً بجسم أو "تجسيد" (embodiment) الروبوت المحدد الذي ولّد البيانات. فالخطة المصممة لروبوت ذي عجلات قد تفشل تماماً عند إعطائها لروبوت ذي أرجل، لأن الخطة بُنيت حول حركات وعيوب العجلات المحددة، بدلاً من البنية الأساسية للمهمة نفسها.
لطال مجهود الباحثين لإيجاد وسيلة للفصل بين "ماذا" تفعل المهمة وبين "كيف" يؤديها الروبوت. إنهم يسعون لإيجاد الخطوات العالمية التي يجب أن يتخذها أي وكيل ناجح، بغض النظر عما إذا كان يمشي، أو يتدحرج، أو يطير. تقدم هذه الورقة طريقة جديدة لإيجاد هذه الخطوات العالمية من خلال التعامل مع المسار نحو الهدف ليس كسلسلة من الإحداثيات، بل كرحلة طوبولوجية. بعبارة بسيطة، الطوبولوجيا هي دراسة الأشكال والمساحات التي تركز على ما لا يمكن تغييره دون تمزيق أو كسر البنية. يجادل الباحثون بأن كل مسار ناجح عبر متاهة أو مطبخ يجب أن يمر عبر نقاط معينة لا يمكن تجنبها، وهي "نقاط الاختناق" أو الممرات الضيقة. هذه النقاط ليست مجرد اختصارات مريحة؛ بل هي ضرورات هيكلية. إذا حاولت تخطيها، فلن تتمكن من الوصول إلى الهدف. ومن خلال تحديد نقاط الاختناق هذه، يمكن للباحثين إنشاء خريطة عالية المستوى للمهمة تظل صالحة حتى عندما يتغير جسم الروبوت تماماً.
قام الفريق بتطوير نظام يقرأ تاريخ المحاولات الناجحة المسجلة في مجموعة بيانات لبناء "حامل" (carrier)، وهو في الأساس خريطة للمساحة التي يكون فيها التحرك ممكناً. هم لا ينظرون إلى الإحداثيات الخام لمفاصل الروبوت أو عجلاته، والتي قد تكون مضللة بسبب الطريقة المحددة التي يتحرك بها الروبوت. بدلاً من ذلك، يقومون ببناء رسم بياني موزون يحترم التدفق الفعلي للبيانات، ويقوم بتصفية الضوضاء والحركات غير ذات الصلة. على هذه الخريطة، يقيسون "عرض" المسار عند كل نقطة بالنسبة للهدف. في المناطق الضيقة حيث يضيق المسار، تظهر البيانات انخفاضاً واضحاً في المساحة المتاحة. تمثل هذه الانخفاضات نقاط الاختناق. يستخدم الباحثون تقنية رياضية تسمى "الهومولوجيا المستمرة" (persistent homology) للتمييز بين التضيقات الطفيفة المؤقتة ونقاط الاختناق الحقيقية وغير القابلة للتجنب التي تحدد بنية المهمة. وقد وجدوا أن نقاط الاختناق الحرجة هذه تعمل كـ "بوابات" يجب على كل مسار ناجح عبورها.
ما يجعل هذا الاكتشاف قوياً هو أن هذه البوابات هي خصائص للمهمة، وليست للروبوت. اختبر الباحثون ذلك من خلال أخذ مجموعة من البوابات المكتشفة من بيانات ناتجة عن روبوت بسيط يتحرك في متاهة نقطية، وتطبيقها على روبوت مختلف تماماً ذي جسم معقد متعدد الأرجل. ودون أي إعادة تدريب أو تعديل، استخدم الروبوت الجديد نفس البوابات للتنقل في بيئته الخاصة. عمل النظام بشكل جيد لدرجة أن الروبوت ذي الأرجل حقق معدل نجاح بنسبة 96.1 بالمائة عبر واجهة موحدة، متفوقاً على الأساليب التي تعتمد على الخرائط أو خصائص الروبوت المحددة. وفي مهمة معقدة متعددة المسارات، حسنت الطريقة الجديدة معدل النجاح بمقدار 36 نقطة مئوية مقارنة بالنهج القياسي الذي لديه وصول إلى الخريطة. يشير هذا إلى أن النظام نجح في عزل البنية الاستراتيجية الجوهرية للمهمة، مجرداً إياها من ضجيج حركة الروبوت المحددة.
كما أظهر الباحثون أن هذه البوابات ليست مجرد حوادث إحصائية بل هي مرتبطة سببياً بالنجاح. في تجارب محكومة، وجدوا أنه إذا قاموا بسد بوابة معينة، فلن يتمكن الروبوت من الوصول إلى الهدف، حتى لو كان بقية المسار مفتوحاً. وعلى العكس من ذلك، إذا أجبروا الروبوت على المرور عبر البوابة الصحيحة، فيمكنه الوصول إلى الهدف حتى لو تغير أسلوب حركة الروبوت. أكد هذا أن البوابات تمثل الترتيب الفعلي والضروري للمراحل المطلوبة لإكمال المهمة. يتضمن النظام أيضاً طبقة تكرارية تقسم الرحلة بين البوابات إلى أجزاء أصغر يمكن إدارتها، مما يضمن بقاء الروبوت على المسار الصحيح وقدرته على التعافي إذا انحرف عن المسار. وهذا يخلق تسلسلاً هرمياً للأهداف يتسم بالمتانة والقدرة على التكيف.
للنتائج تداعيات كبيرة على كيفية بناء أنظمة ذكية يمكنها نقل المعرفة عبر أجسام وبيئات مختلفة. فمن خلال التركيز على الضرورات الطوبولوجية للمهمة — وهي المراحل التي لا يمكن تجنبها والتي يجب على كل وكيل ناجح اجتيازها — نجح الباحثون في ابتكار طريقة مستقلة عن المنفذ المحدد. وهذا يعني أن الاستراتيجية المتعلمة من نوع واحد من الروبوتات يمكن تطبيقها مباشرة على نوع آخر، بشرما بقيت البنية الأساسية للبيئة كما هي. يوضح العمل أنه من الممكن استخراج خطة عالمية، ثابتة في آلياتها، من البيانات الخام، مما يوفر طريقة لحل المشكلات طويلة الأمد حيث يجب على الوكيل تنفيذ مهام لم يسبق له تنفيذها من قبل. إن نجاح هذا النهج في اختبارات متنوعة، من المتاهات البسيطة إلى المطابخ الروبوتية المعقدة، يشير إلى أن الطريق نحو ذكاء اصطناعي أكثر قدرة على التكيف يكمن في فهم شكل المشكلة نفسها، وليس في الحركات المحددة المستخدمة لحلها.
بيان المشكلة يهدف التعلم المعزز الموجه بالأهداف (GCRL) غير المتصل (Offline) إلى تعلم سياسات المهام من مجموعات بيانات ثابتة سجلتها وكلاء آخرون، غالبًا بتجسيدات مختلفة (على سبيل المثال، وكيل في متاهة نقطية مقابل روبوت بشري). تُعرّف النهج الحالية الأهداف الفرعية عادةً كمنتجات ثانوية ضمنية لدوال القيمة، أو أفعال كامنة، أو مخرجات سياسة خاصة بالمنفذ الذي أنشأ البيانات. نتيجة لذلك، تمتص هذه الأهداف الفرعية الاختلافات الخاصة بالمنفذ (الضجيج)، مما يؤدي إلى تدهور أداء النقل عند تغيير المنفذ أو التجسيد. تفترض الورقة وجود بنية مستقلة عن المهمة: ترتيب مرتبط بالمسار لمراحل لا يمكن تجنبها يجب على كل منفذ ناجح اجتيازها، بغضًا عن ديناميكياته الخاصة. التحدي يكمن في استعادة هذه البنية من البيانات غير المتصلة دون الاعتماد على معاملات المنفذ اللاحق.
المنهجية يقترح المؤلفون إطار عمل يعامل مجموعات البيانات غير المتصلة كأنها تستحث تمثيلاً هندسيًا-طوبولوجيًا لفضاء الاستراتيجية. الكائن الجوهري هو "الحامل المستحث بالبيانات" (Data-induced carrier)، وهو رسم بياني مبني على أوزان النقل من المسارات الناجحة، ومجهز بهندسة مرتبطة بالهدف.
بناء الحامل (Carrier Construction):
يتم بناء رسم بياني لـ k-أقرب جار (kNN) فوق المسارات الناجحة (D+).
يتم تطبيق مقياس مرجح بالنقل (Transport-weighted metric)، حيث تُوزن الأبعاد بناءً على درجة "الاستقامة" (الإزاحة الصافية على إجمالي التباين) لتصفية الحركة غير المرغوب فيها (مثل تذبذبات المشية).
يتم تعلم تضمين التصحيح (ψθ) لرسم الخرائط من الملاحظات الخام إلى فضاء تتطابق فيه المسافات المحلية مع أطوال حواف الرسم البياني وتتطابق فيه المعايير مع إحداثي شعاعي (r) مرتبط بالهدف.
القراءة الطوبولوجية (اكتشاف "البوابة"):
الهندسة المرتبطة بالهدف: خوارزمية Dijkstra متعددة المصادر تعين لكل عقدة إحداثيًا شعاعيًا r(u) يمثل مسافة الجيوديسيا في الرسم البياني إلى مجموعة الهدف.
ملف قياس القشرة (Shell-Measure Profile): يتم تصنيف حالات الحامل إلى قشور ذات r ثابت. يتم حساب مقياس مقطعي (الحجم أو الإنتروبيا) لكل قشرة، مما ينتج ملفًا أحادي البعد μ(r).
الهومولوجيا المستمرة (H0): يتم تطبيق ترشيح المجموعات الفرعية (Sublevel-set filtration). يتم تحديد الوديان المستمرة (الاختناقات) حيث ينخفض القياس بشكل كبير.
الشهادة (Certification): تحت افتراضات محددة لأخذ العينات وانتظام الشكل، تقابل الوديان الناجية مجموعات فاصلة (Theorem T3). هذه هي "الضرورات الطوبولوجية": مناطق عنق ضيقة يجب على كل مسار مقبول عبورها. يوفر الإطار شهادة (فجوة الاستمرار) بأن هذه البوابات هيكلية وليست مجرد نواتج عرضية.
تفرع المسار (H1): للمهام التي تحتوي على حلقات في الفضاء الحر، تقوم قراءة الهومولوجيا المستمرة المكعبة متعددة المقاييس (H1) باكتشاف الثقوب المحصورة. هذا يخصص توقيع رقم التفاف (Winding-number signature) لفئات المسارات، مما يسم يسمح للمخطط بالالتزام بمسار دون التبديل في منتصف التنفيذ.
التسلسل الهرمي للبوابات المتكرر:
هذه البوابات المعتمدة ليست أهدافًا مباشرة منخفضة المستوى (والتي قد تكون خارج نطاق التوزيع للمنفذ). بدلاً من ذلك، يقوم الإطار بتقسيم القطاعات بين البوابات بشكل متكرر باستخدام نفس ترشيح قياس القشرة.
هذا يخلق تسلسلاً هرميًا من "الأعناق الفرعية"، مما يكثف المسار إلى نقاط طريق (Waypoints) داخل نطاق التوزيع يمكن للمنفذ منخفض المستوى تتبعها.
النشر (Deployment):
يعمل سلسلة البوابات المعتمدة كعمود فقري استراتيجي. يراقب المخطط التقدم عبر الإحداثي الشعاعي ويعيد التمركز في حال حدوث توقف أو انحراف.
الأهم من ذلك، يتم اكتشاف مجموعة البوابات مرة واحدة على بيانات المصدر وتجميدها للنشر على تجسيد مختلف، مما يتطلب عدم الحاجة لإعادة التدريب أو التكيف.
المساهمات الرئيسية
الأهداف الفرعية على مستوى المهمة: تعريف الأهداف الفرعية كـ "ضرورات طوبولوجية"—وهي ترتيب للمراحل التي لا يمكن تجنبها مستمد من دعم المسارات الناجحة بدلاً من سياسة محددة. هذه البنية قابلة للتفنيد وتصمد أمام استبدال المنفذ.
البناء المعتمد (Certified Construction): حامل مرجح بالنقل وهومولوجيا مستمرة دنيا (على مقاييس القشرة) مع ضمانات عددية، وشهادات فصل، وثبات الآلية. توفر النظريات T1–T6 ضمانات عدد العينات والخطوات المحدودة.
التفكيك المتوافق مع الأبعاد: يفكك الإطار بنية المهمة حسب بعد الهومولوجيا: H0 للاختناقات (المجموعات الفاصلة) وH1 لتفرع المسارات (أرقام الالتفاف).
سلسلة الأدلة: تقدم الورقة تحققًا سببيًا لظهور الأهداف الفرعية، وثبات الآلية عبر أربعة أنظمة، ونقلًا ناجحًا عبر التجسيدات بدون تسميات (Zero-label transfer).
النتائج التجريبية تم تقييم الطريقة على مجموعة OGBench (PointMaze, AntMaze, Kitchen) وD4RL FrankaKitchen.
PointMaze: حققت الطريقة نجاحًا بنسبة 100% (100±0) عبر جميع الأحجام (متوسط، كبير، عملاق)، متفوقة على النماذج المرجعية القوية (QRL, HIQL) بهوامش تتراوح بين +14 إلى +32.
AntMaze:
متوسط: حققت توازنًا مع أقوى نموذج مرجعي (HIQL) عند التساوي (+0.5).
كبير: تفوقت على HIQL بمقدار +3.4.
عملاق: تفوقت على أقوى نموذج مرجعي (CFHRL) بمقدار +22.9 (90.9 مقابل 68.0).
Kitchen: تفوقت على HIQL بمقدار +15.8 (جزئي) و +12.6 (مختلط). والجدير بالذكر أن الأعناق التي اكتشفتها الهومولوجيا المستمرة (PH) غير الخاضعة للإشراف طابقت أداء الحد الأعلى للنماذج الخاضعة للإشراف بملصقات الأحداث (96.5 مقابل 94.3) مع صفر ملصقات.
النقل عبر التجسيدات (المجمد - Frozen):
مجموعة بوابات تم اكتشافها على بيانات PointMaze وتم نقلها مجمدًا إلى منفذين من نوع Humanoid و Ant دون إعادة تدريب.
في Humanoid، حققت أعلى معدل نجاح إجمالي (96.1) بين جميع الطرق، بما في ذلك المرجع المباشر المتميز بالخريطة (85.3).
كان الهامش الأكثر أهمية في المهام متعددة المسارات (+36.0 على المرجع المباشر، p=1.4×10−5).
البوابات المكتشفة في بيانات Ant انتقلت أيضًا إلى Humanoid (91.0% إجمالي)، مما يثبت أن البنية مستقلة عن تجسيد المصدر.
المتانة: أدت اضطرابات التخطيط التي أبطلت البيانات إلى فشل التسلسل المجمد (7.3% نجاح)، ولكن إعادة تحديد البوابات على البيانات المتبقية استعادت الأداء (92.0%)، مما يؤكد أن البوابات هي وظيفة لطوبولوجيا البيانات، وليس للخريطة.
الأهمية والادعاءات تدعي الورقة أن "البنية الجديرة بالاستعادة" من البيانات غير نمط أفعال المنفذ أو دالة القيمة، بل هي ترتيب مراحل المسار المرتبط بالمهمة المتأصل في طوبولوجيا المهمة.
ثبات الآلية: يثبت الإطار أن بنية الاختناق الاستراتيجية مستقرة عبر تجسيدات متباينة ديناميكيًا (PointMaze → Humanoid) طالما ظلت هندسة الفضاء الحر (تخطيط المتاهة) ثابتة.
كفاية الصفر-ملصق (Zero-Label Sufficiency): يمكن للقراءة الطوبولوجية أن تحل محل ملصقات الأحداث الخاضعة للإشراف لتعريف الأهداف الفرعية، محققة أداءً يضاهي أو يتجاوز النماذج الخ la خاضعة للإشراف.
قابلية النقل المشروطة بالمهمة: تدعي الورقة "قابلية النقل المشروطة بالمهمة" بدلاً من "الثبات غير المقيد". تظل بنية الاختناق مستقرة عندما تظل هندسة المتاهة ثابتة، لكن الإطار لا يدعي التعامل مع التغييرات العشوائية في طوبولوجيا البيئة دون إعادة تحديد.
الهيكلي مقابل الإحصائي: تجادل الورقة بأن الاختناقات المكتشفة هي "حقائق دلالية" للمهمة (مثل لحظات الالتزام بالاتصال في Kitchen) وليست مجرد نواتج إحصائية، وهو ما تم التحقق منه من خلال دورها السببي في إكمال المهمة وثباتها تحت تغير الآلية.
يؤسس هذا العمل أن نهج "الضرورة الطوبولوجية" يمكنه استخراج معرفة المهمة المستقلة عن المنفذ من البيانات غير المتصلة، مما يتيح نقلًا قويًا عبر التجسيدات دون الحاجة إلى تكيف أو إعادة تدريب.