← أحدث الأبحاث
🤖 machine learning

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

تقترح هذه الورقة استراتيجية تعزيز بيانات قائمة على السياسة (on-policy) وفعالة من حيث التكلفة لمرحلة ما بعد التدريب لوكلاء النماذج اللغوية الكبيرة، والتي تخصص ميزانيات الإشراف لتكملات المعلم القصيرة وغير المفلترة عند السياقات المستحثة من قبل المتعلم، مما يثبت أن هذا النهج يتفوق على النسخ السلوكي الصرف ويطابق أو يتجاوز طرق التصفية الأكثر تعقيداً عبر معايير متعددة.

المؤلفون الأصليون: Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

نُشر 2026-09-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل طالباً يتعلم مهارة معقدة، مثل حل لغز أو إصلاح آلة معطلة، من خلال مشاهدة خبير متمكن وهو يؤدي المهمة من البداية إلى النهاية. يقلد الطالب كل حركة يقوم بها الخبير، آملًا أنه من خلال محاكاة المسار المثالي، سيتعلم في النهاية كيفية حل المشكلة بمفرده. ينجح هذا النهج بشكل جيد في البداية، لكنه ينطوي على عيب خفي. ففي العالم الحقيقي، يرتكب الطلاب أخطاءً. وعندما يتعثر الطالب، يتغير الموقف؛ إذ يصبح المسار الذي يسلكه الآن مختلفاً عن المسار المثالي الذي اتخذه الخبير. وإذا اكتفى الطالب بممارسة التدريب على مسار الخبير المثالي فقط، فسيظل غير مستعد للمواقف الفوضوية وغير المثالية التي سيواجهها بالفعل. إنه يعرف كيفية اتباع المعلم، لكنه لا يعرف كيفية التعافي عندما يخرج عن المسار.

هذا هو التحدي المركزي الذي سعى الباحثون في جامعة ستانفورد وجامعة نيويورك إلى حله لوكلاء الذكاء الاصطناعي. هؤلاء الوكلاء هم نماذج لغوية كبيرة مصممة للعمل في العالم، سواء من خلال البحث في الإنترنت عن إجابات، أو التخطيط للمهام المنزلية في بيئة محاكاة نصية، أو كتابة كود برمجي لإصلاح أخطاء البرمجيات. لتعليم هؤلاء الوكلاء، غالباً ما يستخدم المطورون طريقة تسمى "الضبط الدقيق الخاضع للإشراف"، حيث يقوم نموذج "معلم" قوي بإنشاء أمثلة مثالية، ويتعلم نموذج "طالب" أصغر حجمًا بكيفية تقليدها. النهج القياسي هو تغذية الطالب بآلاف من هذه العروض التوضيحية المثالية والمتكاملة. ومع ذلك، أدرك الباحثون أن هذه الطريقة تترك الطالب غير مؤهل للتعامل مع أخطائه الخاصة. فعندما يرتكب الطالب خطأً في النهاية أثناء مهمة حقيقية، يجد نفسه في سياق لم يره من قبل، لأن المعلم لم يوضح أبداً ما يجب فعله بعد وقوع نوع معين من الفشل.

ولإصلاح ذلك، اقترح الفريق طريقة جديدة لتوليد بيانات التدريب. فبدلاً من مجرد مشاهدة المعلم يبدأ من البفر وينتهي بإنجاز المهمة، دعوا الطالب يحاول حل المشكلة أولاً. وعندما يعلق الطالب أو يتخذ مساراً خاطئاً، يقوم الباحثون بإيقاف الطالب ويطلبون من المعلم التدخل لإظهار كيفية الاستمرار من نقطة الفشل تلك تحديداً. يُعرف هذا باسم البيانات "على السياسة" (on-policy)، لأنها تُولد بناءً على سلوك الطالب الفعلي بدلاً من مسار مثالي افتراضي. لكن هذا أثار سؤالاً عملياً جديداً: كيف ينبغي للباحثين إنفاق مواردهم المحدودة؟ هل ينبغي عليهم إنفاق ميزانيتهم على عروض توضيحية كاملة الطول من البداية؟ هل ينبغي عليهم أن يطلبوا من المعلم كتابة حلول طويلة ومفصلة لكل خطأ يرتكبه الطالب؟ أم يجب أن يطلبوا فقط بضع خطوات سريعة لإعادة الطالب إلى المسار الصحيح؟

تعامل الباحثون مع هذا الأمر كمسألة تخصيص ميزانية. لقد اختبروا استراتيجيات مختلفة عبر ثلاثة أنواع متميزة من المهام: الإجابة على أسئلة معقدة باستخدام محرك بحث، والتخطيط لأفعال في بيئة منزلية محاكية، وتصحيح الأخطاء البرمجية في واجهة سطر أوامر. وقارنوا بين الطريقة القياسية المتمثلة في نسخ عروض الخبراء الكاملة وبين نهجهم الجديد المتمثل في جعل المعلم يقدم تصحيحات قصيرة ومستهدفة في لحظات فشل الطالب. وتتبعوا بعناية نوعين من التكاليف: إجمالي قدرة الحاسوب المستخدمة لتوليد استجابات المعلم، وكمية البيانات المستخدمة فعلياً لتدريب الطالب.

كانت النتائج واضحة ومثيرة للدهشة. ففي كل بيئة اختبروها، أثبتت استراتيجية طلب بضع خطوات فقط من توجيه المعلم عند نقاط الفشل المحددة للطالب أنها الأكثر كفاءة. فعندما حدد الباحثون المعلم بتقديم عدد قليل من الدورات فقط — أحياناً خطوة واحدة أو ثلاث خطوات فقط — لتصحيح مسار الطالب، تعلم الطالب بشكل أفضل بكما لو تم تدريبه على تصحيحات أطول وأكثر تفصيلاً. في الواقع، كان طلب كتابة حل كامل ومثالي من نقطة الفشل غالباً ما يهدر الموارد؛ إذ لم تساهم الطول الإضافي في تحسين تعلم الطالب، بل استهلكت ببساطة المزيد من الميزانية دون تحسين الأداء.

وجدت الدراسة أن بضع خطوات من المعلم، موضوعة بدقة حيث يحتاجها الطالب، كانت أكثر قيمة بكافية من إكمال أطول أو أكثر تنقيحاً. فعلى سبيل المثال، في مهام البرمجة، سمحت طريقة استخدمت جزءاً صغيراً من بيانات التدريب المعتادة، جنباً إلى جنب مع هذه التصحيحات القصيرة والآنية، للطالب بمضاهاة أداء نظام تم تدريبه على مجموعة بيانات ضخمة ثم خضع لعملية تعلم تعزيزي متعددة المراحل ومعقدة. كما اكتشف الباحثون أن تصفية استجابات المعلم بناءً على ما إذا كانت "ناجحة" أو "مثالية" لم يكن دائماً أفضل استخدام للموارد. فأحياناً، كان رؤية كيفية تعامل المعلم مع موقف صعب، حتى لو لم تكن النتيجة النهائية مثالية، أكثر إرشاداً من رؤية المسارات المثالية فقط.

الخلاصة الرئيسية هي أن الطريقة الأكثر فعالية لتعليم وكيل الذكال الاصطناعي ليست في عرض فيلم مثالي لكيفية تنفيذ المهمة، بل في التدخل لفترة وجيزة في اللحظات التي يفقد فيها طريقه. ومن خلال إنفاق الميزانية على تصحيحات قصيرة ومستهدفة بدلاً من العروض التوضيحية الطويلة، يمكن للمطورين إنشاء وكلاء أذكى وأكثر قدرة على التعافي من أخطائهم. تشير الأبحاث إلى أنه بالنسبة للعديد من المهام المعقدة، فإن القليل من توجيه الخبراء، الذي يتم تقديمه في اللحظة المناسبة، يقطع شوطاً طويلاً جداً. يسمح هذا النهج بتعلم أكثر كفاءة، مما يعني أنه باستخدام نفس القدر من قدرة الحوسبة، يمكننا بناء وكلاء أكثر قوة وقدرة على التعامل مع الطبيعة غير المتوقعة لمشاكل العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →