What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
تقدم هذه الورقة SERL، وهو إطار عمل للتعلم بإعادة وزن البيئة الانتقائي يعزز وكلاء النماذج اللغوية الكبيرة متعددي الأدوار من خلال تقطير ملاحظات بيئية محددة وذات صلة بالأفعال استراتيجياً لمعالجة تحديات تخصيص الائتمان طويلة الأمد، محققاً أداءً هو الأفضل في حالته على معايير ALFWorld وWebShop.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا يعمل كخادم ليقوم بتنظيف منزل فوضوي. يتعين على الروبوت القيام بقائمة طويلة من المهام: المشي إلى المطبخ، البحث عن وعاء، التقاطه، غسله، تجفيفه، ثم وضعه على الرف.
المشكلة: قضية "الدرجة الواحدة الكبيرة"
في التدريب التقليدي، يحصل الروبوت على درجة واحدة فقط في نهاية اليوم.
- إذا انتهى الأمر بالوعاء نظيفًا على الرف، يحصل الروبوت على A+.
- إذا انكسر الوعاء، يحصل على F.
المشكلة هي أن الروبوت لا يعرف أي إجراء محدد هو الذي استحق الدرجة. هل حصل على A+ لأنه التقط الوعاء بشكل صحيح؟ أم لأنه مشى إلى الحوض؟ أم أنه كان مجرد حظ؟
في قائمة طويلة مكونة من 20 خطوة، ربما كانت 3 خطوات فقط مهمة حقًا (الالتقاط، الغسل، الوضع). أما الخطوات الـ 17 الأخرى، فكانت مجرد مشي في دوائر أو تفقد الثلاجة. إذا أعطيت الروبوت A+ عن اليوم بأكمله، فقد يعتقد: "رائع! يجب أن أستمر في المشي في دوائر لأن هذا ما منحني الدرجة!" وهذا ما يسمى بـ مشكلة تخصيص الائتمان (Credit Assignment Problem).
الحل القديم: المعلم "شديد الانتباه"
حاول بعض الباحثين إصلاح ذلك بتعيين معلم ذكي للغاية يراقب الروبوت. المعلم يرى كل شيء: أفعال الروبوت، النتيجة الفورية (مثل: "الوعاء مبلل")، وحتى المستقبل (مثل: "الوعاء الآن على الرف"). ثم يخبر المعلم الروبوت: "افعل تمامًا ما أراه أنا".
- العيب: المعلم يرى أشياء لا يستطيع الروبوت رؤيتها أثناء اتخاذ القرار. على سبيل المثال، المعلم يعرف أن الوعاء سينكسر إذا سقط، لكن الروبوت لا يعرف ذلك بعد. إذا قام الروبوت بتقليد المعلم بشكل أعمى، فسوف يتعلم الاعتماد على "المعرفة السحرية" التي لا يمتلكها فعليًا. وعندما يحاول الروبوت أداء المهمة بمفرده لاحقًا، سيفشل لأنه كان يغش بالنظر إلى نموذج الإجابة.
الحل الجديد: SERL (التعلم الانتقائي بإعادة وزن البيئة)
يقدم هذا البحث SERL، وهو طريقة أذكى لاستخدام ذلك المعلم. فكر في SERL كمدرب يستخدم مجموعة محددة جدًا من القواعد:
المدرب يحدد الاتجاه (المكافأة):
الدرجة النهائية (A+ أو F) هي الشيء الوحيد الذي يحدد الاتجاه الذي يجب أن يسلكه الروبوت. إذا كانت المهمة ناجحة، يعرف الروبوت أنه يجب أن يستمر فيما كان يفعله. وإذا فشلت، يعرف أنه يجب أن يتوقف. هذا يضمن أن الروبوت يحاول دائمًا حل المشكلة الفعلية، وليس مجرد تقليد المعلم.المعلم يضبط مستوى الصوت (التقطير/Distillation):
المعلم لا يخبر الروبوت ماذا يفعل. بدلاً من ذلك، يعمل المعلم مثل مفتاح التحكم في مستوى الصوت.
- إذا قام الروبوت بحركة يرى المعلم أنها تؤدي إلى نتيجة جيدة (بناءً على التغذية الراجعة الفورية مثل "الوعاء مبلل")، يقوم المعلم برفع مستوى الصوت لهذا الإجراء المحدد. "نعم! افعل ذلك مجددًا!"
- إذا قام الروبوت بحركة تؤدي إلى فوضى، يقوم المعلم بخفض مستوى الصوت. "لا، لا تفعل ذلك".
- والأهم من ذلك، أن المعلم يتجاهل خطوات "التفكير" الخاصة بالروبوت (مثل "ممم، أين الوعاء؟") ويركز فقط على ضبط مستوى الصوت في خطوات الإجراء (مثل "التقاط الوعاء").
- الجزء "الانتقائي":
وجد الباحثون أنك لست بحاجة لأن يرى المعلم المستقبل بأك«مله ليكون مفيدًا. في الواقع، رؤية الكثير من معلومات المستقبل تشتت الروبوت.
- أفضل تغذية راجعة: الإشارة الأكثر فائدة هي النتيجة الفورية للإجراء (مثل: "لقد التقطت الوعاء، ولم يسقط").
- الموضع: لست بحاجة لتصحيح الروبوت بعد كل كلمة يكتبها. أنت تحتاج فقط لتصحيحه عندما يحدث تغيير ملموس في العالم (مثل الانتقال من غرفة المعيشة إلى المطبخ). وهذا ما يسمى بالتغذية الراجعة على مستوى المرتكز (Anchor-Level).
تشبيه لعبة الفيديو
تخيل أنك تلعب لعبة فيديو حيث تحصل فقط على شاشة "Game Over" أو "Level Complete" في النهاية.
- التعلم المعزز القياسي (Standard RL): تحاول تخمين أي ضغطة زر هي التي أنقذت الموقف.
- التقطير القديم (Old Distillation): يقف صديق خلفك، يرى المستوى بأكمله، ويهمس لك: "اضغط X الآن!" لكنك لا تستطيع رؤية ما يراه هو، لذا تشعر بالارتباك.
- SERL: لا تزال تحصل فقط على شاشة "Level Complete" في النهاية لتخبرك ما إذا كنت قد فزت أم لا. ولكن، هناك مدرب يراقب شاشتك. عندما تضغط على زر ويفتح باب فورًا، يصرخ المدرب: "عمل رائع!" (رفع مستوى الصوت). عندما تضغط على زر وتسقط في حفرة، يقول المدرب: "حركة سيئة" (خفض مستوى الصوت). المدرب لا يخبرك أي زر تضغط تاليًا؛ هو فقط يخبرك بمدى أهمية الزر الذي ضغطته للتو.
النتائج
اختبر الباحثون SERL في مهمتين معقدتين:
- ALFWorld: منزل افتراضي حيث يتعين على الروبوت العثور على الأشياء ونقلها.
- WebShop: متجر إلكتروني افتراضي حيث يتعين على الروبوت البحث عن وشراء عناصر محددة.
تفوق SERL على جميع الطرق الأخرى. لقد تعلم بشكل أسرع وكان أكثر نجاحًا لأنه لم يعتمد على "المعرفة السحرية" من المعلم. لقد استخدم ردود فعل المعلم الفورية لتسليط الضوء على التحركات الأكثر أهمية، بينما ترك نتيجة النجاح/الفشل النهائية توجه الاستراتيجية العامة.
الخلاصة الكبرى
لتعليم وكيل ذكاء اصطناي القيام بمهام طويلة ومعقدة، لست بحاجة لمنح معلمه الذي يرى المستقبل. أنت تحتاج فقط لمعلم يمكنه إخبار الوكيل فورًا: "ذلك الإجراء المحدد الذي قمت به للتو كان هو الشيء الصحيح (أو الخاطئ) الذي يجب فعله"، وترك النتيجة النهائية تقرر الهدف العام. المعلومات الأقل "امتيازًا" والتغذية الراجعة الأكثر "واقعية" تعمل بشكل أفضل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.