Learning Lifted Action Models from Traces with Minimal Information About Actions and States
تقدم هذه الورقة خوارزميات ونتائج اكتمال لتعلم مجالات أفعال STRIPS+ من آثار تتضمن معلومات جزئية عن كل من الأفعال والحالات، معالجةً بذلك القيود السابقة عبر مراعاة سيناريوهات تتراوح من عدم إمكانية ملاحظة الحالة إلى الملاحظة الكاملة أو المحلية لمسندات حالة محددة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول فهم قواعد لعبة لوحية معقدة، مثل الشطرنج أو لغز تحريك المربعات، ولكن لديك مشكلة غريبة جداً: لا يمكنك رؤية اللوحة.
يمكنك فقط رؤية الحركات التي يقوم بها اللاعبون. ترى قطعة تنتقل من "أ" إلى "ب"، أو لاعباً يلتقط رمزاً. لكنك لا تعرف أي قطعة تحركت، أو أين بدأت، أو كيف كان شكل اللوحة قبل أو بعد الحركة. أنت تحاول استنتاج كتاب قواعد اللعبة عبر مراقبة سلسلة من الأفعال.
هذا هو التحدي الجوهري الذي تعالجه ورقة بحثية بعنوان "تعلم نماذج الأفعال المرفوعة من الآثار بأقل قدر من المعلومات" (Learning Lifted Action Models from Traces with Minimal Information).
إليك تفصيل لما فعله المؤلفون، باستخدام تشبيهات بسيطة.
المشكلة: فخ "المعلومات الزائدة"
في الماضي، حاول علماء الكمبيوتر تعليم الذكاء الاصطناعي هذه القواعد. وقد اتبعوا نهجين أساسيين، لكن كلاهما كان به عيوب:
- نهج "اللوحة الكاملة": كان يُعطى للذكاء الاصطناٍ م حالة اللوحة بالكامل (موقع كل قطعة) والحركة.
- العيب: في العالم الحقيقي، نادراً ما نرى اللوحة كاملة. أيضاً، غالباً ما تطلب القواعد تفاصيل كثودة. على سبيل المثال، لتحريك مربع في لغز ما، كانت القواعد القديمة تتطلب منك تحديد مكان المربع الحالي، ومكانه الجديد، والمكان الفارغ. لكن لكي تقرر الحركة، فأنت تحتاج فقط لمعرفة "تحرك يساراً". التفاصيل الإضافية ليست سوى ضجيج بالنسبة لمتخذ القرار.
- نهج "الأكشن فقط": كان يُعطى للذكاء الاصطناعي فقط قائمة الحركات (مثل "تحرك يساراً"، "التقط").
- العيب: بدون رؤية اللوحة، لم يكن بإمكان الذكاء الاصطناعي معرفة ماذا يحرك. لم يكن يعرف ما إذا كان "تحرك يساراً" يعني تحريك روبوت، أو سيارة، أو صندوق.
الحل: لغة جديدة (STRIPS+)
قدم المؤلفون حلاً وسطاً يسمى STRIPS+. فكر في هذا كطريقة أذكى لكتابة القواعد.
في الطريقة القديمة (STRIPS)، قد تبدو القاعدة كصيغة صارمة:
Move(Robot, CurrentCell, NextCell)
في الطريقة الجديدة (STRIPS+)، تكون القاعدة أشبه بلغز:
Move()
تقول القاعدة: "إذا كان هناك روبوت في خلية، وهناك خلية على اليمين، يمكنك التحرك". على الكمبيوتر أن يكتشف أي روبوت وأي خلايا تنطبق عليها هذه المواصفات. الأمر يشبه المحقق الذي يحل جريمة حيث يوصف المشتبه به فقط بأنه "الشخص الذي يرتدي قبعة حمراء"، بدلاً من تسميته "جون سميث".
الخوارزميات الجديدة: SIFT+ و SYNTH+
تقدم الورقة البحثية "محققين" جديدين (خوارزميات) لحل هذا الغموض عند فقدان المعلومات.
1. SIFT+ (المحقق "المهتم بالأكشن فقط")
- ماذا يفعل: يتعلم القواعد بمجرد مراقبة قائمة من الحركات، مع صفر رؤية للوحة.
- كيف يعمل: يستخدم خدعة تسمى "سمات التعارض" (Mutex Features).
- التشبيه: تخيل أنك ترى لاعباً يلتقط كوباً. أنت لا ترى الكوب، لكنك تعلم أن اللاعب لا يمكنه حمل أكثر من كوب واحد في المرة الواحدة. إذا التقط اللاعب كوباً، فلا بد أنه وضع الكوب الذي كان يحمله.
- يبحث SIFT+ عن هذه الأنماط "المتعارضة". يدرك قائلاً: "آه، كلما حدث هذا الفعل، لا بد أن شيئاً ما صحيح بشأن الشيء الذي يتم حمله". ثم يبتكر "مُسندات" (predicates) جديدة (مفاهيم مثل
is_holding) لملء الفجوات المفقودة.
- النتيجة: يمكنه تعلم كتاب القواعد الكامل حتى لو جُرّدت أسماء الأفعال من معظم تفاصيلها.
2. SYNTH+ (المحقق "المهتم بالرؤية الجزئية")
- ماذا يفعل: يتعلم عندما يستطيع رؤية بعض أجزاء اللوحة، ولكن ليس كلها.
- كيف يعمل: يجمع بين "حل الألغاز" في لغة STRIPS+ الجديدة ومهارات "الابتكار" في SFT+.
- التشبيه: تخيل أنك تراقب سائق توصيل. يمكنك رؤية موقع السائق (الجزء "القابل للملاحظة بالكامل")، لكن لا يمكنك رؤية الطرود داخل الشاحنة. ومع ذلك، تعلم أن السائق لا يمكنه حمل طرد واحد في المرة الواحدة.
- يستخدم SYNTH+ الموقع المرئي لاستنتاج الطرد غير المرئي. يتساءل: "إذا كان السائق عند الباب، وقام للتو بـ 'إسقاط' شيء ما، فماذا كان في يده؟"
- التحول: تقدم الورقة مفهوم "القابلية للملاحظة المحلية" (Local Observability). وهذا يعني أنك لست بحاجة لرؤية اللوحة بأكملها. أنت بحاجة فقط لرؤية الأجزاء ذات الصلة بالفعل الحالي.
- مثال: إذا تحرك روبوت "يساراً"، فأنت بحاجة فقط لرؤية الخلية التي على يساره. لست بحاجة لرؤية الخلية الموجودة في الطرف الآخر من الخريطة. هذا يجعل عملية التعلم أكثر واقعية.
(مخطط التبعية) (الخريطة الطريقية)
للتأكد من أن هؤلاء المحققين لن يعلقوا في حلقة مفرغة، أنشأ المؤلفون خريطة تسمى "مخطط التبعية" (Dependency Graph).
- فكر في هذا كمخطط انسيابي. لتعلم "القاعدة أ"، قد تحتاج لمعرفة "الحقيقة ب". لتعلم "الحقيقة ب"، قد تحتاج لـ "القاعدة ج".
- تثبت الورقة أنه طالما أن هذا المخطط لا يحتوي على حلقة دائرية (حيث أ تحتاج إلى ب، وب تحتاج إلى ج، وج تحتاج إلى أ)، فيمكن للخوارزمية تعلم القواعد خطوة بخفض، بدءاً من الأشياء التي يمكنك رؤيتها والعمل بشكل عكسي نحو الأشياء التي لا يمكنك رؤيتها.
النتائج: هل نجح الأمر؟
اختبر المؤلفون هؤلاء المحققين على ألغاز كلاسيكية مثل Blocksworld (رص الكتل)، و Delivery (التوصيل)، و Sokoban (دفع الصناديق).
- الاختبار: قاموا بتغذية الخوارزميات بآثار حيث تم إخفاء 50% إلى 90% من المعلومات.
- النتيجة:
- SIFT+ نجح في تعلم القواعد من قوائم الأفعال وحدها، مستعيداً التفاصيل المفقودة (مثل "أي كتلة فوق الأخرى") بمجرد ملاحظة الأنماط.
- SYNTH+ تعلم القواعد حتى عندما كانت "اللوحة" مخفية في معظمها، طالما أن القطع الحرجة (مثل موقع الوكيل) كانت مرئية.
- في كل اختبار تقريباً، حققت الخوارزميات دقة بنسبة 100%، حيث أعادت بناء كتب القواعد المخفية بشكل صحيح.
الملخص
تتعلق هذه الورقة بتعليم الحواسيب كيفية تعلم "قواعد اللعبة" عندما تُعطى معلومات قليلة جداً.
- الطريقة القديمة: "إليك اللوحة، وإليك الحركة. تعلم القواعد." (تتطلب الكثير من المعلومات).
- الطريقة الجديدة: "إليك قائمة من الحركات. يمكنك رؤية موقع اللاعب، ولكن ليس الأشياء. استنتج القواعد."
- السبق العلمي: من خلال استخدام لغة أذكى (STRIPS+) وطريقة مبتكرة لـ "ابتكار" الحقائق المفقودة بناءً على ما "يجب" أن يكون صحيحاً (سمات التعارض)، يمكن للذكاء الاصطناعي ملء الفراغات وتعلم المنطق الكامل لمجال ما دون الحاجة لرؤية كاملة للعالم.
تزعم الورقة أن هذا يمثل خطوة كبيرة نحو جعل الذكاء الاصطناعي قادراً على التعلم من الملاحظات الطبيعية وغير الكاملة، تماماً كما يتعلم البشر من خلال مراقبة الآخرين، بدلاً من الحاجة إلى دليل مثالي وغني بالبيانات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.