Quantifying Aleatoric and Epistemic Dynamics Uncertainty via Local Conformal Calibration
تقدم هذه الورقة البحثية طريقة المعايرة المحلية لعدم اليقين (LUCCa)، وهي طريقة تعتمد على التنبؤ المطابق (conformal prediction) وغير تقاربية، تعمل على معايرة تقديرات عدم اليقين العشوائي (aleatoric uncertainty) محلياً لتوليد مناطق تنبؤ صالحة احتماليًا تأخذ في الاعتبار كلاً من عدم اليقين العشوائي وعدم اليقين المعرفي (epistemic uncertainty) في ديناميكيات الروبوت، مما يتيح التخطيط الآمن في البيئات الجديدة.
تتحرك الروبوتات عبر العالم من خلال التنبؤ بما سيحدث لاحقاً. فإذا عرف الروبوت بدقة كيف تتماسك عجلاته مع الأرض أو كيف تدفع مراوحه الهواء، يمكنه حساب مسار مثالي للوصول إلى وجهة ما. لكن العالم الحقيقي فوضوي؛ فالأسطح تصبح زلقة، والرياح تتغير، وفيزياء الآلة يمكن أن تتغير بطرق لم يتوقعها مصمموها. عندما يواجه الروبوت موقفاً لم يره من قبل، يصبح تنبؤه الداخلي بالمستقبل مجرد تخمين. وللتحرك بأمان، يجب على الروبوت ألا يفهم فقط أين يعتقد أنه سيكون، بل مدى عدم اليقين في هذا التخمين. عليه أن يميز بين نوعين من الشك: النوع الأول هو الضجيج العشوائي، مثل انزلاق عجلة على بقعة من الجليد؛ وهو أمر غير قابل للتنبؤ ولكنه يحدث ضمن حدود معروفة. أما النوع الآخر فهو الجهل، مثل محاولة روبوت القيادة على سطح لم يلمسه من قبل؛ هنا، يفتقر الروبوت ببساطة إلى المعلومات اللازمة لمعرفة ما سيحدث. لسنوات، كافح المهندسون لقياس هذا النوع الثاني من عدم اليقين بطريقة تضمن السلامة، معتمدين غالباً على افتراضات تنهار عندما تتغير البيئة.
لقد طور فريق من الباحثين في جامعة ميشيغان طريقة جديدة لحل هذه المشكلة، مما يسمح للروبوتات ببناء شبكة أمان حول تنبؤاتها حتى عندما تكون في مناطق غير مألوفة تماماً. وقد أطلقوا على نهجهم اسم "المعايرة المتوافقة الموضعية لعدم اليقين" (Local Uncertainty Conformal Calibration). الفكرة الجوية هي أخذ أفضل تخمين للروبوت حول حركته المستقبلية، ثم تعديل حجم "فقاعة الأمان" الخاصة به بناءً على بيانات العالم الحقيقي. تخيل روبوتاً لديه نموذج لكيفية حركته، ولكن هذا النموذج قد يكون خاطئاً في مناطق معينة. قبل أن يبدأ الروبوت مهمة جديدة، جعل الباحثين يمر بمرحلة معايرة قصيرة. خلال هذه المرحلة، يختبر الروبوت نموذجه مقابل مجموعة صغيرة من الحركات الفعلية التي يؤديها على الأرض. ومن خلال مقارنة ما تنبأ به النموذج مع ما حدث بالفعل، يتعلم النظام مقدار توسيع فقاعة الأمان الخاصة به في أجزاء مختلفة من الغرفة. إذا كان النموذج دقيقاً عادةً في زاوية معينة، تظل الفقاعة ضيقة. وإذا كان النموذج مهتزاً في زاوية أخرى، ربما بسبب انزلاق الأرض، تتوسع الفقاعة بشكل كبير لتغطي جميع النت possible الممكنة.
اختبر الباحثون هذه الطريقة على روبوت محاكى يتحرك مثل السيارة، وقادر على التسارع والدوران. وضعوا هذا الروبوت في بيئات تتغير فيها الفيزياء فجأة، مثل قسم من الأرض ذو احتكاك أقل بكثير من بقية الأرض. في هذه المناطق الصعبة، سيفترض نموذج الروبوت القياسي أنه يستطيع التوقف أو الدوران بسهولة، مما يؤدي به إلى تخطيط مسارات تنتهي بالاصطدام. ومع ذلك، أدرك الأسلوب الجديد أن النموذج غير موثوق في تلك البقع المحددة؛ حيث استخدم بيانات المعايرة لتضخيم عدم اليقين لتلك المناطق، مما أجبر خوارزمية التخطيط على اختيار طرق أبطأ وأكثر أماناً تتجنب المناطق الخطرة تماماً. في سلسلة من الاختبارات عبر أربع بيئات مختلفة، وصل الروبوت الذي يستخدم طريقة المعايرة الجديدة إلى هدفه دون الاصطدام بالعوائق في معظم التجارب، رغم أنه تعرض لعدد قليل من الاصطدامات في سيناريوهات أكثر تعقيداً مثل المنعطفات الحادة. في المقابل، اصطدم الروبوت الذي يستخدم النموذج القياسي غير المعاير في ما يصل إلى 80 بالمائة من المحاولات، لأنه فشل في مراعاة حقيقة أن فهمه للعالم كان ناقصاً.
ما يجعل هذا النهج قوياً بشكل خاص هو أنه لا يتطلب من الروبوت معرفة كيفية تغير الفيزياء بدقة. فهو لا يحتاج إلى تحديد ما إذا كانت الأرض مبللة أو أن الهواء كثيف؛ بل يكتفي بمراقبة عدم التطابق بين تنبؤه والواقع ويعدل ثقته وفقاً لذلك. لقد أثبت الباحثون رياضياً أن هذه الطريقة تضمن أن فقاعة أمان الروبوت ستحتوي على الموضع المستقبلي الحقيقي للروبوت بنسبة 90 بالمائة على الأقل للخطوة الأولى من الخطة، حتى مع وجود كمية صغيرة جداً من بيانات المعايرة. وهذا الضمان يظل قائماً بغض النظر عما إذا كان الروبوت يتحرك عبر ممر مألوف أو مساحة فوضوية وغير متوقعة. ومن خلال تقسيم المشكلة إلى مناطق صغيرة ومحلية، يتجنب النظام الوقوع في الفخ الشائع المتمثل في الحذر المفرط في كل مكان؛ فبدلاً من افتراض السيناريو الأسوأ للرحلة بأكملها، فإنه يوسع هامش الأمان فقط حيث تظهر البيانات أن ذلك ضروري حقاً.
كما بحثت الدراسة أيضاً في كيفية أداء هذه الطريقة بمرور الوقت بينما يخطط الروبوت لسلسلة من التحركات. وبينما يظل الإثبات الرياضي أقوى للخطوة الأولى من الخطة، أظهرت التجارب أن الطريقة ظلت فعالة حتى عندما نظر الروبوت إلى المستقبل البعيد. نجح النظام في إدارة عدم اليقين التراكمي الذي عادة ما يعيق التخطيط طويل الأمد. وفي عمليات المحاكاة، استغرق الروبوت الذي يستخدم هذه الطريقة وقتاً أطول قليلاً للوصول إلى وجهته مقارنة بالروبوت الذي يتجاهل عدم اليقين والذي كان يصطدم، لكنه وصل بأمان. كانت التكلفة الحسابية لإضافة فحص السلامة هذا ضئيلة، حيث استغرقت أقل من مللي ثانية لكل خطوة تخطيط على معالج كمبيوتر قياسي. وهذا يشير إلى إمكانية تنفيذ الطريقة على روبوتات حقيقية دون إبطائها. إن هذا العمل يثبت أنه من خلال الجمع بين النموذج الداخلي للروبوت وفحص بسيط يعتمد على البيانات، يمكننا منح الآلات القدرة على إدراك جهلها والتصرف بحذر مناسب، مما يحول التخمين الذي قد يكون خطيراً إلى خطة آمنة ومثبتة.
ملخص تقني: تكميم ديناميكيات عدم اليقين الأليتوريك (Aleatoric) والإبستيميك (Epistemic) عبر المعايرة التشكيلية المحلية
1. بيان المشكلة
غالبًا ما تعتمد أنظمة التحكم الروبوتية على تقريبات لديناميكيات (تحليلية، أو محاكاة، أو متعلمة) قد تكون غير دقيقة عند النشر في بيئات جديدة. وبينما توجد طرق عديدة لتقدير عدم اليقين الأليتوريك (العشوائية المتأصلة في النظام)، فإن هذه التقديرات تظل غير كافية للبيئات الجديدة حيث تتغير التفاعلات الفيزيائية الأساسية، مما يؤدي إلى ظهور عدم اليقين الإبستيميك (عدم اليقين الناتج عن نقص البيانات أو عدم تطابق النموذج).
يتمثل التحدي الجوه lack في توفير ضمانات سلامة مثبتة وغير تقاربية للتخطيط الحركي عندما:
تكون دالة الديناميكيات الحقيقية f غير معروفة ومن المحتمل أن تكون غير مستمرة.
قد يكون النموذج التقريبي f~ خاطئًا بشكل تعسفي في نطاق النشر (Ptest) مقارنة بنطاق التدريب (Ptrain).
يجب أن يستوفي النظام قيد السلامة P(Yτ∈C)≥1−α عبر أفق تخطيطي، حيث C هي المجموعة الآمنة.
تعتمد النهج الحالية غالبًا على افتراضات قوية (مثل توزيعات الخطأ الغاوسية)، وتوفر فقط حدودًا تقاربية، أو تستخدم عوامل معايرة عالمية مفرطة في التحفظ وغير معلوماتية لمساحات الحالة-الفعل عالية الأبعاد.
2. المنهجية: المعايرة التشكيلية المحلية (LUCCa)
يقترح المؤلفون LUCCa، وهو إطار عمل قائم على التنبؤ التشكلي (Conformal Prediction) يعمل على معايرة تقديرات عدم اليقين الأليتوريك لنموذج التنبؤ بالديناميكيات لمراعاة عدم اليقين الإبستيميك. تعمل الطريقة في مرحلتين: مرحلة معايرة خارج الخط (offline) ومرحلة تخطيط عبر الخط (online).
2.1 المفاهيم الجوهرية
التنبؤ التشكلي المنقسم (SplitCP): تستخدم الطريقة SplitCP لبناء مناطق تنبؤ صالحة من الناحية التكرارية دون افتراض بنية المتنبئ أو توزيع البيانات.
مسافة ماهالانوبيس كدرجة عدم تطابق: بما أن متنبئ الديناميكيات f~ يخرج توزيعًا طبيعيًا متعدد المتغيرات (MVN) N(μ^,Σ^)، فإن درجة عدم التطابق r تُعرف بمسافة ماهالانوبيس بين التوزيع المتنبأ به والحالة الحقيقية المرصودة: R(i)=dM(f~(Xˉ(i)),Y(i))=(Y(i)−μ^)⊤Σ^−1(Y(i)−μ^) تظهر التحليلات النظرية أنه إذا كان النموذج مثاليًا، فإن مسافة ماهالانوبيس المربعة تتبع توزيع "كا مربع" (χdim(S)2).
المعايرة المحلية (LOCART): بدلاً من تطبيق عامل قياس عالمي واحد (الذي يؤدي إلى مناطق تنبؤ واسعة ومفرطة في التحفظ)، تستخدم LUCCa طريقة LOCART. وهي تقوم بتقسيم مساحة الحالة-الفعل باستخدام نموذج انحدار شجرة القرار المدرب على بقايا المعايرة.
التقسيم: يتم تقسيم مجموعة بيانات المعايرة. يستخدم الجزء الأول لتدريب شجرة قرار لرسم خريطة لأزواج الحالة-الفعل (s,u) إلى عقد ورقية تمثل مناطق ذات خطأ نموذج متشابه.
القياس المحلي: لكل عقدة ورقية k، يتم حساب عامل قياس تشكلي محدد ξk بناءً على بقايا نقاط البيانات التي تقع في ذلك التقسيم.
المعايرة: أثناء التخطيط عبر الخط، يتم قياس التباين المتنبأ به Σ^ محليًا: Σ^cal=ξkΣ^. وهذا ينشئ مناطق تنبؤ بيضاوية (hyperellipsoidal) تتكيف مع الصعوبة المحلية للديناميكيات.
2.2 تدفق الخوارزمية
المعايرة خارج الخط (Offline Calibration):
جمع مجموعة بيانات معايرة Dcal من الانتقالات (st,ut,st+1) من بيئة النشر (أو نموذج بديل).
حساب البقايا R(i) لجميع نقاط المعايرة.
ملاءمة شجرة قرار (LOCART) لتقسيم مساحة الحالة-الفعل وحساب عوامل القياس المحلية ξk لكل تقسيم.
التخطيط عبر الخط (MPC):
بالنظر إلى الحالة الحالية، يقوم المخطط (مثل MPPI) بأخذ عينات من المسارات.
لكل خطوة في التمرير (rollout)، تقوم الديناميكيات التقريبية f~ بنشر توزيع الحالة.
يتم تطبيق عامل القياس المحلي ξk (الذي يتم تحديده بواسطة موقع زوج الحالة-الفعل الحالي في شجرة القرار) على التباين المنشور.
يقوم المخطط بتحسين دالة التكلفة التي تتضمن عقوبة على أثر (trace) عدم اليقين المُعاير (مما يشجع المسارات عبر المناطق ذات خطأ النموذج المنخفض) والتحقق من تجنب الاصطدام مع مناطق التنبؤ المُعايرة.
3. المساهمات الرئيسية
اقتراح الخوارزمية: تقديم LUCCa، وهي خوارزمية توفر مناطق تنبؤ صالحة احتماليًا للحالات المستقبلية للروبوت من خلال معايرة تقديرات عدم اليقين الأليتوريك لمراعاة عدم اليقين الإبستيميك.
الضمانات النظرية:
إثبات الصلاحية لأي مجموعة محدودة من بيانات المعايرة، ولأي متنبئ يخرج توزيعًا طبيعيًا متعدد المتغيرات، ولأي دالة ديناميكيات حقيقية غير معروفة.
إظهار أن الطريقة تحقق تغطية محلية (مشروطة بتقسيمات الحالة-الفعل) مع عينات محدودة، وتحقق تغطية شرطية تقاربية تحت افتراضات مخففة.
إثبات أنه بالنسبة لـ خطوة التخطيط الأولى، تحتوي المنطقة المُعايرة على الحالة الحقيقية باحتمالية ≥1−α. بالنسبة للخطوات اللاحقة، تظل الضمانات قائمة إذا كانت الديناميكيات التقريبية خطية وتم استيفاء افتراضات محددة حول المتحكم.
التكيف المحلي: استخدام عوامل قياس تعتمد على الحالة-الفعل يتجنب التحفظ المفرط للمعايرة العالمية، مما يسمح للمخطط بالتمييز بين المناطق ذات دقة النموذج العالية والمنخفضة.
التحقق التجريبي: إظبات فعالية الطريقة على نظام "المكامل المزدوج" (double-integrator) مع تغيرات ديناميكية كبيرة (مثل تغيرات الاحتكاك)، مما أظهر تحسنًا في السلامة ومعدلات النجاح مقارنة بالنماذج المرجعية غير المعايرة.
4. النتائج التجريبية
قيم المؤلفون LUCCa على نظام مكامل مزدوج في أربع بيئات تحتوي على مناطق ذات ديناميكيات دقيقة ومناطق ذات عدم تطابق كبير في النموذج (محاكاة لاحتكاك أقل).
التغطية التجريبية: في بيئة "الممر" (Corridor)، حافظت LUCCa على تغطية تجريبية فوق عتبة 90% (لـ α=0.1) عبر جميع الخطوات الزمنية، حتى في المناطق ذات خطأ النموذج العالي. في المقابل، قللت النماذج المرجعية غير المعايرة من تقدير عدم اليقين بشكل كبير في المناطق غير المتطابقة، مما أدى إلى انخفاض التغطية بشكل كبير عن 90% مع امتداد الأفق الزمني.
أداء التخطيط الحركي: باستخدام التحكم التنبئي بالنماذج (MPC) مع MPPI:
السلامة: حققت LUCCa نسبة تصادم 0% في بيئتي "الممر" و"الممر الضيق" (Passage) و3% في "المنعطف على شكل حرف L" (L-Turn)، مقارنة بـ 30% و83% و80% على التوالي للنموذج المرجعي غير المعاير.
معدل النجاح: حققت LUCCा 100% نجاح في "الممر" و"الممر الضيق"، مقارنة بـ 70% و17% للنموذج المرجعي.
الكفاءة: بينما قد تصل النماذج المرجعية إلى الأهداف بشكل أسرع أحيانًا (من خلال تجاهل عدم اليقين واتخاذ مسارات محفوفة بالمخاطر)، إلا أنها تصطدم كثيرًا. تسببت دالة التكلفة في LUCCa، التي عاقبت عدم اليقين العالي، في إبطاء الروبوت في المناطق ذات الخطأ العالي، مما جنب التصادمات.
الأعباء الحسابية: أضافت خطوة المعايرة المحلية (الاستعلام في شجرة القرار وقياس التباين) حوالي 0.3 مللي ثانية لكل خطوة تخطيط (زيادة قدرها 32% في مدة الخطوة)، وهو ما اعتبره المؤلفون ضئيلاً ويمكن تجاهله في النشر العملي.
5. الأهمية والادعاءات
يدعي البحث أن LUCCa تعالج قيدًا جوهريًا في الروبوتات القائمة على البيانات: عدم القدرة على النشر الآمن للنماذج المتعلمة أو التحليلية في بيئات جديدة حيث قد تتغير الديناميكيات.
الدقة النظرية: على عكس طرق تقدير عدم اليقين الاستدلالية، توفر LUCCa ضمانات غير تقاربية وعينات محدودة دون افتراض شكل الديناميكيات الحقيقية أو توزيع الأخطاء.
الفائدة العملية: من خلال الانتقال من المعايرة العالمية إلى المعايرة المحلية، تولد الطريقة مناطق تنبؤ "حادة" (دقيقة) في المناطق ذات دقة النموذج العالية و"متكيفة" (أكبر) في مناطق عدم اليقين الإبستيميك العالي. وهذا يسمح للمخططين بإجراء مقايضات مدروسة بين الاستكشاف والسلامة.
التخطيط الحرج للسلامة: تمكن الطريقة من بناء خطط آمنة احتماليًا للأنظمة ذات الديناميكيات العشوائية غير المعروفة، مما يضمن بقاء المسارات ضمن المجموعات الآمنة باحتمالية يحددها المستخدم، حتى عندما يكون النموذج خاطئًا تمامًا في النطاقات غير الموصوفة.
يخلص المؤلفون إلى أنه بينما تم إثبات ضمانات السلامة متعددة الخطوات نظريًا للديناميكيات الخطية تحت افتراضات محددة للمتحكم، فإن النتائج التجريبية تشير إلى أن الطريقة توفر تغطية محلية قوية حتى لسيناريوهات التخطيط الأكثر تعقيدًا.