Toward Learning POMDPs Beyond Full-Rank Actions and State Observability
تقدم هذه الورقة طريقة لتعلم مصفوفات الانتقال والملاحظة الصريحة لعمليات ماركوف لاتخاذ القرار خفية الملاحظة (POMDPs) من البيانات المتسلسلة عبر الاستفادة من النهج الطيفي وتحلل التنسور تحت افتراضات رتبة مخففة، مما يمكّن الوكيل من التخطيط لوظائف مكافأة متنوعة مع وضع حدود نظرية لقابلية تحديد الحالة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تواجه الآلات الذكية التي يمكنها التنقل في العالم الحقيقي تحديًا جوهريًا: فهي غالبًا لا تستطيع رؤية الصورة الكاملة. تخيل روبوتًا يحاول فتح باب خزانة؛ يمكنه دفع المقبض والشعور بالمقاومة، أو يمكنه سماع نقرة، لكنه لا يستطيع رؤية المسامير الداخلية للقفل مباشرة. إن الحالة الحقيقية للآلية — الموقع الدقيق لكل مسمار داخل القفل — هي حالة مخفية. ولكي يعمل بفعالية، يجب على الروبوت بناء نموذج ذهني لهذا العالم غير المرئي بناءً فقط على تسلسل الأشياء التي يفعلها والأشياء التي يستشعرها. في مجال الذكاء الاصطناعي، يُعرف هذا باسم تعلم نظام يمكن ملاحظته جزئيًا. والهدف هو أن تتمكن الآلة من أخذ تدفق من الأفعال والتغذية الراجعة الحسية، ومن خلال ذلك، إعادة بناء القواعد الخفية التي تحكم كيفية تغير العالم. إذا استطاعت الآلة فعل ذلك، فيمكنها التخطيط مسبقًا، والتكيف مع الأهداف الجديدة، والعمل بأمان في البيئات المعقدة حيث لا يمكنها الاعتماد على معلومات مثالية.
لسنوات، طور الباحثون طرقًا لمساعدة الآلات على تعلم هذه القواعد الخفية، لكن العديد من هذه النهج اصطدم بحائط مسدود. فبعض التقنيات تنشئ نموذجًا "صندوقًا أسود" يمكنه التنبؤ بما سيحدث بعد ذلك بناءً على التجارب الماضية، لكنه لا يستطيع شرح لماذا يحدث ذلك أو كيف تتغير الحالة الداخلية. وهذا يجعل من الصعب تغيير أهداف الروبوت لاحقًا؛ فإذا تغيرت المهمة، غالبًا ما يتعين إعادة تعلم الصندوق الأسود من الصفر. أما الطرق الأخرى فيمكنها بناء خريطة كاملة للعالم الخفي، لكنها لا تعمل إلا عندما يكون النظام بسيطًا جدًا أو عندما ينتج كل حالة خفية إشارة فريدة تمامًا. ومع ذلك، في العالم الحقيقي، غالبًا ما تبدو حالات خفية مختلفة متشابهة بالنسبة للمستشعر. فقد لا يستطيع الروبوت التمييز بين وضعين مختلفين لدرج ما إذا كان الاحتكاك يبدو متماثلاً في كليهما. وغالبًا ما تفشل الطرق الموجودة في هذه المواقف، حيث تعجز عن التمييز بين الحالات التي تُعد "مبهمة" أو غير قابلو للتمييز من الخارج.
في دراسة جديدة، طور باحثون في معهد ماساتشوستس للتكنولوجيا (MIT) ومختبر أبحاث الجيش طريقة تسمح للآلات بتعلم هذه الأنظمة الخفية حتى عندما لا تكون الحالات متميزة تمامًا. يركز نهجهم على نوع محدد من البنية الرياضية التي تربط الأفعال الماضية بالملاحظات المستقبلية. ومن خلال تحليل تسلسلات طويلة من البيانات التي تم جمعها أثناء استكشاف الروبوت لبيئته بشكل عشوائي، أظهر الفريق أنه من الممكن إعادة بناء قواعد الانتقال الخفية واحتمالية النتائج الحسية المختلفة. والأهم من ذلك، أن طريقتهم تعمل حتى عندما لا يستطيع الروبوت التمييز بين كل حالة وأخرى. فبدلاً من فرض التمييز حيث لا يوجد، يقوم الخوارزمي بتجميع الحالات غير القابلة للتمييز في "تقسيمات". ثم يتعلم كيفية انتقال النظام بين هذه المجموعات. وهذا يسمح للآلة ببناء نموذج قابل للاستخدام للعالم، يكون دقيقًا بما يكفي للتخطيط لمهام جديدة، حتى لو لم يكن النموذج يعرف الهوية الدقيقة لكل حالة خفية.
اختبر الباحثون فكرتهم في عدة بيئات محاكية، بما في ذلك لغز كلاسيكي يتضمن نمرًا خلف باب ومتاهة ذات ممر واحد. كما أنشأوا سيناريو مخصصًا يتضمن جسمًا عائمًا يمكن إعادة ضبطه أو استشعاره، صُمم ليكون له حالات تبدو متطابقة لمستشعرات الروبوت. وفي هذه التجارب، نجحت الطريقة الجديدة في تعلم البنية الأساسية للعالم. لقد تمكنت من استعادة احتمالات الانتقال من حالة إلى أخرى وفرص رؤية نتيجة معينة، وصولاً إلى النقطة التي تصبح فيها الحالات غير قابلة للتمييز حقًا. وعندما قارن الباحثون نتائجهم بتقنيات التعلم الأخرى، وجدوا أن طريقتهم أنتجت نماذج كانت أقرب بكثير إلى الواقع الحقيقي والخفي للنظام. وبينما كانت الطرق الأخرى تتنبأ بالملاحظات المستقبلية بشكل صحيح، إلا أنها غالبًا ما فشلت في التقاط الديناميكيات الداخلية الصحيحة، مما أدى إلى أخطاء عند تغير المهمة.
إن أحد النتائج الرئيسية للدراسة هو أن هذا القصور — تجميع الحالات معًا — ليس خللًا في الخوارزمية، بل هو حقيقة جوهرية حول التعلم من البيانات المتسلسلة. فقد أثبت الباحثون أنه إذا أنتج عالمان مختلفان تمامًا نفس نمط الملاحظات لكل تسلسل ممكن من الأفعال، فلا يمكن لأي كمية من البيانات التمييز بينهما. وفي مثل هذه الحالات، فإن أفضل ما يمكن للآلة فعله هو تعلم سلوك مجموعات الحالات، وليس الحالات الفردية نفسها. هذه الرؤية حيوية لأنها تضع حدودًا واضحة لما هو ممكن. فهي تخبرنا أنه بينما لا يمكننا دائمًا معرفة الحالة الداخلية الدقيقة، يمكننا مع ذلك تعلم نموذج كافٍ للتخطيط واتخاذ القرار. وتوضح الدراسة أنه من خلال قبول هذه الحدود، يمكن للآلات أيضًا اكتساب نماذج صريحة وقوية للعالم تسمح لها بالتفكير في الآليات الخفية، مثل أنظمة القفل، والتكيف مع أهداف جديدة دون الحاجة إلى البدء من جديد.
تكمن القيمة العملية لهذا العمل في المرونة التي يوفرها. فبمجرد أن تتعلم الآلة القواعد الصريحة لكيفية تغير العالم، يمكن للإنسان ببساطة إخبارها بهدف جديد، ويمكن للآلة استخدام ذلك النموذج لمعرفة كيفية تحقيقه. في التجارب، أظهر الباحثون أنه بعد تعلم النموذج، تمكنوا من تعيين مكافأة جديدة لحالة خفية معينة، وسينجح الروبوت في الانتقال إلى تلك الحالة. وسيكون هذا مستحيلاً مع نموذج "الصندوق الأسود" الذي يتنبأ بالملاحظات فقط، لأنه لن يعرف أي حالة داخلية تقابل الهدف الجديد. إن القدرة على تعلم احتمالات الانتقال والملاحظة الصريحة تعني أن الوكلاء المستقلين يمكن أن يصبحوا أكثر قوة وتكيفًا، وقادرين على التعامل مع الواقع المادي الفوضوي والغامض حيث تكون المستشعرات غير مثالية والحالات الخفية شائعة.
يقر الباحثون بأن طريقتهم لها حدود؛ فهي تتطلب قدرًا معينًا من البيانات وتعمل بشكل أفضل عندما يمتلك النظام تنوعًا كافيًا في أفعاله للكشف عن بنيته. كما أنها تفترض أن الروبوت يستكشف البيئة عشوائيًا في البداية، وهو مطلب عملي لجمع المعلومات اللازمة. ومع ذلك، تشير النتائج إلى أن هذا النهج يفتح الباب أمام فئة جديدة من خوارزميات التعلم التي يمكنها التعامل مع تعقيد الروبوتات في العالم الحقيقي. ومن خلال تجاوز الحاجة إلى التمييز المثالي بين الحالات، يقربنا هذا العمل من إنشاء أنظمة مستقلة يمكنها حقًا فهم والتفكير في الآليات الخفية من حولها، وتحويل تسلسل من الأفعال التخمينية والعمياء إلى خريطة متماسكة وقابلة للاستخدام للواقع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.