← أحدث الأبحاث
💻 computer science

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

تقدم هذه الورقة ActSWM، وهو نموذج عالم كامن حساس للأفعال يعالج نمط الفشل المتمثل في "انهيار السياق" عبر فرض مبدأ فصل الانتقالات لضمان بقاء عمليات التمرير طويلة المدى قابلة للتمييز عبر تسلسلات الأفعال المختلفة، مما يحسن أداء التخطيط في ألعاب العالم المفتوح ويُمكّن من استعادة الأفعال من مقاطع الفيديو غير المتصلة بالإنترنت.

المؤلفون الأصليون: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

نُشر 2026-07-30
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت لعب لعبة فيديو، لكن لا يمكنك السماح له بلمس وحدة التحكم في كل حركة. بدلاً من ذلك، تريد من الروبوت أن يبني "حلماً" للعبة في رأسه. ينظر إلى الشاشة، ويتخيل ماذا سيحدث لو قفز، ثم ماذا سيحدث لو ركض، ثم يختار المسار الأفضل للأمام دون أن يصطدم فعلياً بجدار. هذا هو عالم "نماذج العالم" (World Models)، وهو فرع من فروع الذكاء الاصطناعي حيث تتعلم الآلات التنبؤ بالمستقبل عن طريق محاكاته داخل "فضاء حلم" رياضي مضغوط.

لكي يعمل هذا، يجب أن يكون حلم الروبوت حساساً لخياراته. إذا تخيل الروبوت القفز، يجب أن يظهره الحلم وهو يطير للأعلى. إذا تخيل الركض، يجب أن يظهره وهو يندفع للأمام. المشكلة الكبيرة التي واجهها العلماء هي أن هذه الأحلام غالباً ما تصبح "كسولة". قد يتنبأ الروبوت بمستقبل يبدو مثالياً، لكنه لا يتغير فعلياً بناءً على ما يقرر الروبوت فعله. إنه يشبه مشاهدة فيلم حيث الحبكة مكتوبة مسبقاً؛ مهما حاول الشخصية الانعطاف يساراً، فإن الكاميرا ستستمر في التحرك يميناً على أي حال. يتناول هذا البحث تلك الثغرة تحديداً، متسائلاً: هل يمكننا تعليم الروبوت أن يحلم بطريقة تجعل المستقبل يستمع لأفعاله بالفعل؟


مشكلة "الحلم الكسول"

تعرف على ActSWM، وهو نوع جديد من أدمغة الذكاء الاصطناعي المصممة لمنع الروبوتات من امتلاك "أحلام كسولة". في عالم الألعاب المفتوحة مثل Minecraft، يحتاج الوكلاء (الروبوتات) إلى التخطيط للمستقبل البعيد. عليهم معرفة: "إذا قمت بتعدين هذا الحجر الآن، فهل يمكنني بناء منزل لاحقاً؟". للقيام بذلك، يستخدمون نموذج عالم كامن (Latent World Model). فكر في هذا النموذج كأنه محاكي فائق السرعة يعمل في الخلفية. فبدلاً من معالجة كل بكسل من شاشة اللعبة، يقوم بضغط العالم في رمز "كامن" مبسط—وهو بمثابة اختصار ذهني.

الهدف هو أن يقوم الوكيل بتشغيل آلاف عمليات المحاكاة الذهنية هذه في جزء من الثانية للعثور على أفضل حركة. ولكن إليك العقبة: تعاني العديد من المحاكيات الموجود المثالية من خطأ يسميه المؤلفون انهيار السياق (Context Collapse).

تخيل أنك تروي قصة لصديق. إذا قلت: "ذهبت إلى الحديقة"، فقد يتخيل صديقك يوماً مشمساً. إذا قلت: "ذهبت إلى الحديقة وأمطرت"، فسيشبه يوماً ممطراً. هذا جيد. لكن انهيار السياق يشبه صديقاً يتخيل دائماً نفس اليوم المشمس، بغض النظر عما تقوله له. إنه يركز بشدة على الفكرة العامة لـ "الحديقة" لدرجة أنه يتوقف عن الاستماع إلى تفاصيلك المحددة حول المطر. في عالم الذكاء الاصطناعي، يعني هذا أن المحاكي يتنبأ بمستقبل معقول (حديقة مشمسة) ولكنه يفشل في التغيير بناءً على الإجراءات المحددة التي يتخذها الروبوت (المطر). يفكر الروبوت: "يمكنني القفز أو يمكنني الركض، والمستقبل يبدو نفسه في كلتا الحالتين"، مما يجعل التخطيط مستحيلاً.

الحل: "محقق الأفعال" المجمد

يقترح المؤلفون ActSWM (نموذج العالم الحساس للأفعال) لإصلاح هذا الخلل. سر نجاحهم هو مبدأ يسمونه فصل الانتقال (Transition Separation). يريدون التأكد من أنه إذا سلك الروبوت مسارين مختلفين، فإن النتائج الحلمية يجب أن تبدو مختلفة.

ولفرض ذلك، قدموا حيلة ذكية وهي قراءة الأفعال الثابتة (Fixed Action Readout). تخيل أن لديك محققاً وظيفته هي النظر إلى مشهد وتخمين الفعل الذي حدث للتو. عادةً، إذا كان المحقق يتعلم جنباً إلى جنب مع المشهد، فقد يغش. إذا بدا المشهد متشابهاً جداً لفعلين مختلفين، فقد يقوم المحقق ببساطة بتغيير تعريفه لـ "القفز" ليتناسب مع المشهد، بدلاً من إجبار المشهد على أن يكون مختلفاً.

يمنع ActSWM هذا الغش عن طريق تجميد المحقق. إنهم يعطون الذكاء الاصطناعي محققاً بقواعد ثابتة وغير قابلة للتغيير. يتم بعد ذلك إجبار الذكاء الاصطناعي على جعل "أحلامه" (الانتقالات الكامنة) متميزة للغاية بحيث يمكن لهذا المحقق المجمد تمييزها بدقة. إذا حاول الذكاء الاصطناعي جعل حلم "القفز" وحلم "الركض" يبدوان متشابهين، فسيفشل المحقق المجمد في تخمين الفعل، وسيتعرض الذكاء الاصطناعي لعقوبة. هذا يجبر الذكاء الاصطناعي على إبقاء توقعاته المستقبلية حادة ومستجيبة لكل ضغطة زر محددة.

ما وجدوه

اختبر الفريق هذا الدماغ الجديد في عالم Minecraft الفوضوي والمكعب، وعبر ثلاث ألعاب أخرى (Counter-Strike 2، GTA V، و Apex Legends).

1. وقف الانهيار:
عندما قارنوا ActSWM بالنماذج القديمة، كان الفرق صارخاً. في اختبار طلبوا فيه من الذكاء الاصطناعي تخيل مستقبل بأفعال حقيقية مقابل مستقبل لا يفعل فيه الروبوت شيئاً (أفعال صفرية)، أنتجت النماذج القديمة مستقبلاً متطابقاً تقريباً. ومع ذلك، خلق ActSWM الجديد فجوة هائلة. قاس المؤلفون هذه "فجوة الفعل" ووجدوا أن ActSWM أنتج انفصالاً أكبر بنحو 380 مرة من أقوى النماذج السابقة. لقد أصبحت أحلام الروبوت أخيراً تستمع لوحدة التحكم.

2. تخطيط أفضل:
لأن الأحلام كانت أكثر دقة، أصبح الروبوت أفضل في اللعب. في Minecraft، عندما طُلب منه تنفيذ مهام مثل وضع شعلة، أو تعدين كتلة حجر، أو بناء عمود، حسن ActSWM معدلات النجاح بشكل كبير. على سبيل المثال، حسن معدل النجاح في تعدين كتلة حجر بنسبة 90.0% وفي بناء عمود بنسبة 54.5% مقارنة بالنموذج الأساسي. أصبح بإمكان الروبوت الآن التمييز بشكل موثوق بين المسار الذي يؤدي إلى منزل والمسار الذي يؤدي إلى منحدر.

3. قراءة العقل من الفيديو:
أخيراً، اختبروا ما إذا كان بإمكان الذكاء الاصطناعي النظر إلى فيديو لشخص يلعب وتخمين الأزرار التي يضغط عليها. هذا يشبه مشاهدة فيلم وتخمين حركات الممثل. باستخدام طريقة تسمى تقليل الإنتروبيا المتقاطعة (CEM)، استطاع ActSWM استعادة الأفعال الصحيحة من الفيديوهات المسجلة بشكل أفضل بكثير من التخمين العشوائي. في GTA V، حسن "تكلفة" العثور على الفعل الصحيح بمقدار 252.38 مقارنة بالبحث العشوائي، وحدد ضغطات المفاتيح النشطة (مثل عندما يضغط اللاعب بالفعل على زر) بدقة زادت بنسبة تصل إلى 0.711.

الخلاصة

يشير البحث إلى أنه لكي يتمكن وكلاء الذكاء الاصطناعي من إتقان الألعاب المعقدة والمفتوحة حقاً، فإنهم يحتاجون إلى أكثر من مجرد توقعات دقيقة للمستقبل؛ إنهم بحاجة إلى توقعات حساسة للفعل. إذا لم يتغير المستقبل عندما تغير رأيك، فلن تتمكن من التخطيط. من خلال تجميد "محقق أفعال" بسيط وإجبار الذكاء الاصطناعي على إبقاء سيناريوهات المستقبل الخاصة به متميزة، يثبت ActSWM أنه يمكننا بناء نماذج عالم لا تكتفي فقط بأحلام اليقظة، بل تستمع فعلياً للاعب. هذا ليس مجرد تعديل بسيط؛ إنه تحول جوهري في كيفية تعليم الآلات تخيل عواقب خياراتها الخاصة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →