← أحدث الأبحاث
🤖 AI

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

إن LEGO-RL هو إطار عمل يُمكّن التعلم المعزز القابل للتوسع لوكلاء البرمجة من خلال الربط بين أطر التنفيذ الأصلية وتحسين تدرج السياسة عبر استضافة نماذج لغوية كبيرة وسيطة داخل العمليات، وتنسيق بيئات معزولة قوية، والمراقبة المتكاملة، مما يؤدي إلى تحسين أداء النماذج بشكل كبير على SWE-bench Verified عبر بيئات متنوعة مع الحفاظ على توافق عالٍ بين التدريب والاستدلال.

المؤلفون الأصليون: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

نُشر 2026-08-19
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، يقوم الباحثون بتعليم الحواسيب كيف تعمل كمهندسي برمجيات مستقلين. هذه الوكلاء الرقميون لا يكتفون بمجرد الإجابة على الأسئلة؛ بل يتنقلون عبر قواعد بيانات برمجية معقدة، ويستخدمون الأدوات لإصلاح الأخطاء، ويجرون الاختبارات ليروا ما إذا كانت تغييراتهم قد نجحت. ولتعلم هذه المهارات، يستخدم الوكلاء طريقة تسمى "التعلم التعزيزي". تخيل طالباً يتعلم حل لغز ما: يحاول القيام بحركة، وإذا أدت به تلك الحركة إلى الاقتراب من الحل، فإنه يحصل على مكافأة صغيرة. ومع مرور الوقت، يتعلم أي الحركات تؤدي إلى النجاح. بالنسبة لوكلاء البرمجة، تتضمن هذه العملية توليد تسلسلات طويلة من الإجراءات، ومراقبة برنامج حاسوبي أثناء تشغيله، وتلقي إشارة بسيطة بـ "نعم" أو "لا" تشير إلى ما إذا كان الكود الذي كتبوه قد أصلح المشكلة بالفعل. يكمن التحدي في حقيقة أن هؤلاء الوكلاء يعملون في بيئات حوسبة حقيقية وفوضوية حيث يمكن أن تسوء الأمور بطرق غير متوقعة. فإذا تعطلت البيئة، أو إذا تم خداع نظام المكافآت، أو إذا فقد الحاسوب الذي يسجل أفكار الوكيل تتبع ما قيل بالفعل، فإن عملية التعلم تنهار. قد يتعلم الوكيل استغلال النظام أو ببساطة يتوقف عن التعلم لأن التغذية الراجعة التي يتلقاها غير موثوقة.

لقلبت فريق من الباحثين نظاماً جديداً يسمى LEGO-RL لحل هذه المشكلات المحددة. كان هدفهم هو ربط وكلاء البرمجة المعقدين الموجودين بخوارزميات تعلم قوية دون إجبار الوكلاء على تغيير طريقة عملهم. فكر في الوكيل كعامل ماهر يعرف تماماً كيفية استخدام مجموعة محددة من الأدوات واتباع سير عمل معين. كانت المحاولات السابقة لتدريب هؤلاء العمال تتطلب غالباً إعادة بناء مساحة عملهم بالكامل لتناسب برنامج التدريب، مما كان يتسبب في حد التغييرات أو تغيير سلوك العامل الطبيعي. بدلاً من ذلك، بنى فريق LEGO-RL جسراً يسمح لبرنامج التدريب بمراقبة العامل تماماً كما هو، مع التقاط كل حركة وفكرة في الوقت الفعلي مع حماية عملية التعلم من فوضى العالم الحقيقي.

يكمن جوهر حلهم في إطار عمل يضمن أن يرى كمبيوتر التدريب بالضبط ما يراه ويفعله الوكيل. عندما يولد الوكيل استجابة، يقوم مكون خاص بالتقاط التدفق الخام للكلمات والاحتمالية الدقيقة التي خصصها الوكيل لكل كلمة قبل أن يتمكن أي برنامج آخر من تعديلها أو تلخيصها. وهذا أمر بالغ الأهمية لأن البرنامج الذي يدير بيئة الوكيل غالباً ما يعيد كتابة التاريخ أو يضغط المعلومات لتوفق المساحة. إذا اعتمد نظام التدريب على هذه النسخ المعاد كتابتها، فسيقوم بحساب تقدم تعلم الوكيل بناءً على ذاكرة مشوهة للأحداث. ومن خلال التقاط البيانات في لحظة التوليد، ضمن الباحثون بقاء إشارة التعلم وفية لقرارات الوكيل الفعلية. علاوة على ذلك، قاموا ببناء نظام لإعادة تشغيل الخيارات الداخلية المحددة التي اتخذها الوكيل، مما يضمن أن النماذج المعقدة ذات الأجزاء المتخصصة المتعددة تتعلم من المسار الصحيح.

للحفاظ على موثوقية عملية التعلم، أنشأ الفريق بيئة منظمة للغاية حيث يتم تشغيل كل اختبار في حاوية خاصة ومعزولة وآمنة. وهذا يمنع اختباراً واحداً معطلاً من التسبب في انهيار النظام بأكمله، ويمنع الوكلاء من إيجاد طرق مختصرة لتجاوز نظام التسجيل. على سبيل المثال، أخفوا الإجابات عن الوكلاء أثناء الاختبار وضمنوا أن البرنامج المستخدم لتقييم العمل لا يمكن التلاعب به. كما صمموا النظام للتعامل مع الإخفاقات بسلاسة؛ فإذا علق الوكيل أو تعطلت البيئة، يحدد النظام المشكلة، ويستبعد تلك المحاولة المحددة، ويمضي قدماً دون السماسة بترك الخطأ يفسد بيانات التعلم. وهذا يسمح للتدريب بالاستمرار بسلاسة حتى لو فشلت الاختبارات الفردية، وهو أمر يحدث بشكل متكرر في مهام البرمجة المعقدة.

اختبر الباحثون هذا النظام عن طريق تدريب نموذج لغوي كبير باستخدام ثلاثة أطر عمل مختلفة لوكلاء البرمجة الموجودين. ووجدوا أن النظام عمل بشكل رائع عبر الأطر الثلاثة جميعها. لقد تحسنت قدرة النموذج على حل مشكلات البرمجيات في العالم الحقيقي بشكل ملحوظ. فعند استخدام أحد أطر العمل الشهيرة، قفز معدل النجاح من 64 بالمائة إلى أكثر من 70 بالمائة. ومع إطار آخر، ارتفع من 62 بالمائة إلى ما يقرب من 68 بالمائة، ومع الثالث، ارتفع من 57 بالمائة إلى ما يقرب من 67 بالمائة. والأهم من ذلك، تحقق الباحثون من أن عملية التعلم كانت صادقة؛ إذ ظلت العلاقة الرياضية بين ما فعله الوكيل وما حسبه نظام التدريب مثالية تقريباً، مع ارتباط يتجاوز 99 بالمائة. وقد أثبت هذا أن النظام لم يكن مجرد ضربة حظ، بل كان يتعلم حقاً من البيانات الصحيحة.

بعيداً عن مجرد تحسين الدرجات، وفر النظام نافذة واضحة لكيفية تعلم الوكلاء. استطاع الباحثون مراقبة التدريب في الوقت الفعلي، ورؤية سبب فشل اختبار ما أو كيف تغير سلوك الوكيل على مدار أسابيع من التدريب. لاحظ أنهم مع تحسن الوكلاء، بدأوا في فحص عملهم الخاص بشكل متكرر، وقراءة الملفات التي عدلوها للتو للتأكد من صحة تغييراتهم. كما لاحظوا أن الوكلاء بدأوا في اتخاذ خطوات أكثر لحل المشكلات، منخرطين في محادثات أطول وأكثر تعقيداً مع الكمبيوتر للوصول إلى حل. سمحت هذه التفاصيل بمستوى عالٍ من التفاصيل للباحثين لتشخيص المشكلات بسرعة، مثل عندما يتوقف الوكيل عن استخدام الأدوات ويبدأ في كتابة النصوص بدلاً من ذلك، وتعديل التدريب وفقاً لذلك.

إن نجاح LEGO-RL يثبت أن توسيع نطاق تدريب وكلاء البرمجة يتطلب أكثر من مجرد أجهزة كمبيوتر أسرع أو نماذج أكبر. إنه يتطلب نظاماً يحترم سلامة سير عمل الوكيل مع توفير بيئة مستقرة وقابلة للملاحظة للتعلم. ومن خلال بناء إطار عمل يلتقط البيانات بأمانة، ويحمي من الأخطاء، ويوفر رؤية عميقة لعملية التدريب، أظهر الباحثون أنه من الممكن تعليم وكلاء البرمجيات المعقدة التحسن بشكل موثوق. ويشير عملهم إلى أن مستقبل البرمجة المستقلة لا يكمن في إجبار الوكلاء على قوالب جامدة، بل في بناء أنظمة مرنة وقوية يمكنها التعلم من الواقع الفوضوي لتطوير البرمجيات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →