← أحدث الأبحاث
🤖 AI

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

تقدم هذه الورقة SWE-RPG، وهو معيار موحد لوكلاء البرمجة يقيم ليس فقط نجاح الرقعة النهائية بل أيضًا خطوات الاستدلال الوسيطة مثل توضيح المتطلبات وتخطيط التنفيذ، مما يكشف أن الاسترداد الضمني للمتطلبات هو العائق الأساسي الذي يحد من أداء الوكلاء الحاليين في المهام على مستوى المستودع.

المؤلفون الأصليون: Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

نُشر 2026-08-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً تمتلك فيه مساعداً آلياً فائق الذكاء يمكنه كتابة أكواد برمجية. تعطيه تعليمات بسيطة مثل: "أصلح الخطأ في هذه اللعبة"، أو "أضف مستوى جديداً"، ويبدأ بالعمل. هذا هو حلم وكلاء البرمجة بالذكاء الاصطناعي (AI coding agents). لفترة طويلة، كان العلماء يختبرون هذه الروبوتات عبر إعطائها مهمة ورؤية ما إذا كانت النتيجة النهائية تعمل أم لا. إذا عملت اللعبة دون أن تنهار، يحصل الروبوت على نجمة ذهبية. وإذا انهارت، يحصل على علامة (X) حمراء.

لكن تكمن المشكلة هنا: علامة (X) الحمراء لا تخبرك لماذا فشل الروبوت. هل أساء فهم تعليماتك؟ هل وضع خطة سيئة؟ أم أنه كتب الكود بشكل خاطئ فحسب؟ الأمر يشبه طالباً رسب في اختبار رياضيات ولم يحصل إلا على درجة "0/10" دون رؤية ملاحظات المعلم حول مواضع خطئه. لكي نجعل هذه الروبوتات أفضل حقاً، نحتاج إلى رؤية عملية تفكيرها، وليس فقط النتيجة النهائية. هذا هو السؤال الكبير الذي تعالجه الورقة البحثية: كيف نتوقف عن مجرد تقييم التعديل النهائي ونبدأ في تشخيص عقل الروبوت؟

هنا يأيد SWE-RPG، وهو اختبار جديد فائق التفصيل مصمم لاستراق النظر داخل عقل الروبوت. لقد بنى الباحثون معياراً (اختباراً معيارياً) باستخدام 163 مهمة برمجة من العالم الحقيقي من 31 مشروعاً برمجياً مختلفاً. وبدلاً من مجرد التحقق مما إذا كان الكود يعمل في النهاية، قاموا بإنشاء مراجع "الحقيقة الذهبية" (Gold Truth) لكل خطوة من رحلة الروبوت. فكر في الأمر كامتلاك كتاب وصفات لشيف ماهر لا يوضح الطبق النهائي فحسب، بل يسرد أيضاً كل مكون خفي كان على الشيف تخيله، وكل خطوة في خطة الطهي، واللحظة الدقيقة التي قد ينحرف فيها الروبوت عن المسار.

وضع الباحثون ثلاثة وكلاء برمجة مشهورين (سُموا Claude Code وCodex وOpenCode) تحت الاختبار، وربطوهم بستة نماذج "عقل" مختلفة (نماذج لغوية كبيرة - LLMs). كانت النتائج بمثابة صدمة للواقع؛ إذ لم يحل حتى أفضل الروبوتات سوى حوالي 31.5% من المهام. وهذا يعني أنهم فشلوا في نحو ثلثي المرات! لكن السحر الحقيقي لـ SWE-RPG كان في اكتشاف أين فشلوا. وجدت الدراسة أن العائق الأكبر لم يكن في الواقع كتابة الكود، بل كان في فهم القواعد الخفية. حيث حدثت حوالي 24.5% إلى 46.0% من حالات الفشل لأن الروبوتات لم تستطع استيعاب "المتطلبات الضمنية" — وهي الأشياء التي لم تقلها أنت ولكن كان على الروبوت معرفتها ليؤدي المهمة بشكل صحيح.

على سبيل المثال، إذا طلبت من روبوت "إصلاح استيراد ملفات TSV"، فقد يصلح الكود ولكنه قد يعطل استيراد ملفات CSV عن غير قصد لأنه لم يدرك أن الاثنين مرتبطان ببعضهما. تشير الدراسة إلى أنه لجعل هؤلاء الوكلاء مفيدين حقاً، لا يجب أن نركز فقط على جعلهم يكتبون كوداً أسرع، بل يجب أن نبدأ في تعليمهم كيف يكونون محققين أفضل، قادرين على القراءة ما بين السطور في طلب المستخدم. وتخلص الورقة إلى أنه بينما يبدو هؤلاء الوكلاء مثيرين للإعجاب، إلا أنهم لا يزالون يعانون مع الجانب البشري المعقد لتطوير البرمجيات، وأن SWE-RPG هو الخريطة الجديدة التي نحتاجها لمساعدتهم على التنقل عبر تلك المتطلبات الخفية الصعبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →