Why Do LLM Agents Fail in Exploring New Environments? A World-Modeling Perspective
تحدد هذه الورقة "انهيار الاستكشاف" كنمط فشل رئيسي حيث تفقد وكلاء النماذج اللغوية الكبيرة القدرة على اكتشاف حلول جديدة في البيئات غير المألوفة أثناء التعلم التعزيزي، وتقترح طريقة SPA، وهي طريقة تعمل على تحسين الأداء من خلال ترسيخ الوكيل أولاً في التنبؤ بالحالة والانتقال عبر الضبط الدقيق الخاضع للإشراف من خلال الخبرة الذاتية قبل التحسين من أجل المكافأة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل برنامج حاسوب مصممًا ليفكر ويتصرف كالبشر، قادر على حل الألغاز، أو التنقل في عوالم افتراضية، أو حتى استخدام متصفح الويب للبحث عن المعلومات. هذه البرامج، المعروفة باسم النماذج اللغوية الكبيرة، يتم تدريبها على كميات هائلة من النصوص من الإنترنت، حيث تتعلم التنبؤ بالكلمة التالية في الجملة. وعندما يطلب الباحثون من هذه النماذج أن تعمل كوكلاء —أي اتخاذ خطوات لتحقيق هدف ما— فإنهم غالبًا ما يستخدمون طريقة تسمى "التعلم التعزيزي". وهي عملية يحاول فيها النموذج تجربة أفعال مختلفة، ويتلقى تغذية راجعة حول ما إذا كان قد نجح أم فشل، ويتعلم تدريجيًا تكرار الأفعال التي تؤدي إلى النجاح. إنها طريقة قوية لتعليم الآلة كيفية القيام بأشياء لم تُبرمج عليها صراحةً. ومع ذلك، تبرز مشكلة حرجة عندما توضع هذه الوكلاء في مواقف جديدة وغير مألوفة؛ فبينما قد تتعلم حل لغز محدد رأته من قبل، فإنها غالبًا ما تكافح لفهم كيفية استكشاف بيئة جديدة تمامًا، حيث تقع في فخ التفكير الضيق الذي يمنعها من إيجاد الحل الأمثل.
لقد وضع فريق من الباحثين هدفًا لفهم سبب فشل هؤلاء الوكلاء الأذكياء عند مواجهة المجهول. واكتشفوا ظاهرة محددة أطلقوا عليها اسم "انهيار الاستكشاف" (Exploration Collapse). وببساو لغة بسيطة، عندما يتم تدريب وكيل على مهمة جديدة، فإنه غالبًا ما يتعلم إيجاد مسار واحد محدد للنجاح ثم يتجاهل جميع الاحتمالات الأخرى. يصبح مركزًا جدًا على ذلك المسار الوحيد لدرجة أنه يفقد القدرة على تجربة مقاربات مختلفة. وقد قاس الباحثون ذلك من خلال النظر في درجتين مختلفتين: إحداهما تتبع ما إذا كان أفضل تخمين للوكيل ناجحًا، والأخرى تتبع ما إذا كان أي من تخميناته المتعددة المختلفة ناجحًا. في المهام المألوفة، تتحسن كلتا الدرجتين مع تعلم الوكيل. ولكن في البيئات الجديدة والصعبة، مثل لغز يعتمد على الشبكات حيث يجب دفع الصناديق إلى أهداف محددة، ترتفع درجة التخمين الأفضل الوحيد قليلاً، بينما تنخفض الدرجة التي تتبع تجربة مسارات متعددة ومختلفة. إن الوكيل يتعلم كيف يكون أكثر ثقة في عادة سيئة بدلاً من أن يتعلم كيف يكون أكثر مرونة. يحدث هذا لأن الوكيل لا يفهم حقًا قواعد العالم الجديد الذي يتواجد فيه؛ فهو يخمن دون أساس متين.
ولإصلاح ذلك، طور الباحثون طريقة تدريب جديدة تسمى SPA، والتي ترمز إلى "الوكيل ذو الخبرة الذاتية" (Self-Experience Agent). فبدلاً من محاولة تعليم الوكيل كيفية الحصول على المكافآت فورًا، علموه أولاً كيفية فهم العالم من حوله. لقد منحوا الوكيل فرصة لاستكشاف البيئة بمفرده، دون ضغط تسجيل النقاط. وخلال هذه المرحلة، طُلب من الوكيل وصف ما يراه والتنبؤ بما سيحدث بعد ذلك إذا اتخذ إجراءً معينًا. على سبيل المثال، إذا رأى الوكيل صندوقًا في مكان محدد وقرر دفعه، فعليه أولاً أن يذكر أين كان الصندوق ثم يتنبأ أين سينتهي به المطاف. استخدم الباحثون النتائج الفعلية الصحيحة من البيئة لتصحيح تنبؤات الوكيل، مما علمه فعليًا قوانين الفيزياء الخاصة بتلك اللعبة المحددة. خلقت هذه العملية نوعًا من الخريطة الداخلية أو "نموذج عالم" داخل عقل الوكيل، مما جعل فهمه مرتكزًا على الواقع بدلاً من التخمينات الغامضة.
بمجرد أن بنى الوكيل هذا الفهم الداخلي لكيفية عمل العالم، بدأ الباحثون عملية التدريب القياسية لتعليمه كيفية الفوز. كانت النتائج مذهلة. ففي الاختبارات على لعبة لغز تسمى "سوكوبان" (Sokoban)، حيث كان على الوكيل دفع الصناديق إلى الأهداف، سمحت طريقة التدريب القياسية للوكيل بالنجاح بنسبة 25 بالمائة فقط. أما مع الطريقة الجديدة، فقد قفز معدل النجاح إلى ما يقرب من 60 بالمائة. وفي لغز آخر يتضمن بحيرة متجمدة، تحسن معدل النجاح من حوالي 22 بالمائ^ة إلى أكثر من 70 بالمائة. ولعل الأمر الأكثر إثارة للدهشة هو أن نموذجًا حاسوبيًا صغيرًا جدًا تم تدريبه بهذه الطريقة استطاع التفوق على نموذج أكبر بكثير وأكثر قوة تم تدريبه باستخدام الطرق القياسية القديمة. فالنموذج الصغير، بفضل تعلمه لقواعد اللعبة أولاً، استطاع التنقل في الألغاز المعقدة بفعالية أكبر من النموذج العملاق الذي كان يحاول فقط التخمين للوصول إلى مكافأة.
اختبر الباحثون أيضًا ما إذا كان هذا النهج يعمل على أنواع أخرى من المهام، مثل لغز منطقي يسمى "سودوكو" وبيئة محاكاة لمهام منزلية. وفي كل حالة، أدت الطريقة التي تعلمت الوكيل هيكل العالم أولاً إلى نتائج أفضل. لقد وجدوا أن مفتاح النجاح لم يكن مجرد امتلاك المزيد من البيانات أو حاسوب أكبر، بل كان في ترتيب عملية التعلم. فمن خلال إجبار الوكيل على تعلم بنية البيئة أولًا، تجنب الوقوع في فخ الانهيار إلى استراتيجية واحدة هشة. تعلم الوكيل الحفاظ على خياراته مفتوحة، واستكشاف مسارات متعددة لأنه فهم عواقب أفعاله. يشير هذا النهج إلى أنه لكي تتمكن الذكاء الاصطناعي من التكيف حقًا مع المواقف الجديدة والمعقدة، فإنه يحتاج إلى بناء فهم موثوق للواقع قبل أن يحاول تحقيق النجاح الأمثل. وتظهر الدراسة أنه عندما يكون الوكيل مرتكزًا على الآليات الفعلية لبيئته، يمكنه التعلم باستكشاف أكثر فعالية وحل المشكلات التي كانت بعيدة المنال سابقًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.