← أحدث الأبحاث
💻 computer science

An Empirical Investigation of Multi-Trial Consistency, Trajectory Pathologies, and Reliability Rankings in Software Engineering Agents

تقترح هذه الورقة إطار تقييم شامل متعدد التجارب لتقييم الاتساق والموثوقية واعتلالات المسار لوكلاء هندسة البرمجيات ذاتية التشغيل، مما يثبت جدواها التشغيلية من خلال دراسة استطلاعية تكشف عن معدلات كبيرة في حجب البنية التحتية وتضع أساساً للانتقال لما هو أبعد من مقاييس النجاح أحادية التجربة.

المؤلفون الأصليون: Muhammad Tayyab

نُشر 2026-09-22
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Muhammad Tayyab

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم تطوير البرمجيات الحديث، تُدار مكتبات ضخمة من الأكواد البرمجية بواسطة فرق من المهندسين الذين يعتمدون على أدوات مؤتمتة للعثور على الأخطاء وإصلاحها. ومؤخرًا، ظهر جيل جديد من الذكاء الاصطناعي، قادر على العمل كمساعدين مستقلين يمكنهم قراءة هذه القواعد البرمجية، وفهم المشكلات، ومحاولة كتابة الإصلاحات اللازمة بأنفسهم. وقد أظهرت هذه الأنظمة، التي تعمل غالبًا بنماذج لغوية كبيرة، قدرتها على حل مهام برمجية معقدة في اختبارات محكومة. ومع ذلك، يظل هناك سؤال جوهري دون إجابة: هل يمكن الوثوق بهذه العمال الرقميين للقيام بنفس المهمة بموثوقية في كل مرة؟ ففي العالم الحقيقي، حيث يتم نشر تحديثات البرمجيات تلقائيًا، فإن المساعد الذي ينجح مرة ويفشل في المرة التالية عندما يُطلب منه القيام بالشيء نفسه تمامًا يخلق حالة من الفوضى؛ إذ يؤدي ذلك إلى عدم القدرة على التنبؤ، مما يجبر المطورين البشر على التحقق باستمرار من العمل، وهو ما يبطل الغرض من الأتمتة. إن التحدي الجوهري لا يكمن فقط في قدرة الذكاء الاصطناعي على حل مشكلة ما، بل في قدرته على حلها باستمرار دون ارتباك، أو ارتكاب أخطاء عشوائية، أو تغيير نهجه بطرق تؤدي إلى تعطل النظام.

وقد اقترح باحث في جامعة الهندسة والتكنولوجيا في لاهور، باكستان، طريقة جديدة لقياس هذه الموثوقية، متجاوزًا المعيار الحالي الذي يكتفي ببساطة بحساب عدد المرات التي ينجح فيها الذكاء الاصطناعي في محاولة واحدة. فالطريقة الحالية، المعروفة باسم "معدل النجاح في المحاولة الواحدة"، تعامل الذكاء الاصطناعي كطالب يخضع لامتحان لمرة واحدة: إذا كانت الإجابة صحيحة، فإنه ينجح، بغض النظر عما إذا كان بإمكانه حلها مرة أخرى. وتجادل هذه الدراسة الجديدة بأن هذا النهج غير كافٍ للهندسة البرمجية. وبدلاً من ذلك، صمم الباحث بروتوكولًا صارمًا لاختبار هؤلاء الوكلاء عدة مرات على نفس المشكلة، بحثًا عن الاتساق. وكان الهدف هو معرفة ما إذا كان بإمكان الذكاء الاصطناعي التنقل داخل مستودع برمجيات، والعثور على خطأ، وإصلاحه بنفس الطريقة تمامًا في كل مرة يُطلب منه ذلك، أم أن أداءه سينهار تحت وطأة التدقيق المتكرر.

ولاختبار ذلك، أقام الباحث تجربة واسعة النطاق تتضمن مجموعة محددة من المهام البرمجية الواقعية المستمدة من مشاريع مفتوحة المصدر شهيرة. وخططت الدراسة لتشغيل هذه المهام عبر شبكة من نماذج الذكاء الاصطناعي المختلفة وأطر عمل برمجية مختلفة، مع تكرار كل مهمة خمس مرات لتكوين صورة كاملة عن الأداء. وقبل إجراء التجربة الكاملة، أجرى الباحث "تجربة استطلاعية للجدوى" للتأكد من أن آليات الاختبار تعمل بشكل صحيح. تضمنت هذه التجربة التخطيط لـ 360 محاولة عبر 30 مشكلة برمجية مختلفة باستخدام نموذجين محددين من الذكاء الاصطناعي ونظامين مختلفين من هياكل البرمجة (scaffolding). ومع ذلك، تم استكمال وتحليل 312 محاولة فقط بنجاح، بينما توقفت 48 محاولة بسبب عوامل خارجية. وقد تتبع الباحثون كل خطوة اتخذها الذكاء الاصطعي بدقة، ولم يكتفوا بتسجيل ما إذا كان قد نجح أم فشل، بل سجلوا أيضًا عدد المرات التي اضطر فيها لتغيير رأيه، وعدد المرات التي ارتكب فيها أخطاءً أثناء محاولة استخدام الأدوات الحاسوبية، وعدد المرات التي تعطل فيها البنية التحتية للاختبار نفسه.

كشفت الدراسة الاستطلاعية أن بيئة الاختبار نفسها هشة. فمن بين 360 محاولة مخططة، توقفت 48 محاولة بسبب عوامل خارجية، مثل انتهاء مهلة خدمة السحابة (timeout) أو إعادة ضبط الحاوية الحاسوبية بشكل غير متوقع. أدى هذا إلى معدل إلغاء بلغ 13.3 بالمائة، وهي نتيجة تسلط الضوء على صعوبة تشغيل هذه الاختبارات المعقدة بموثوقية. والأهم من ذلك، أظهرت الدراسة الاستطلاعية أن ميزانية الاختبار الحالية كانت قصيرة جدًا لإنتاج إصلاحات ناجحة. نظرًا لأن الذكاء الاصطناعي كان محدودًا بخمس جولات فقط من المحادثة أو الإجراءات لكل محاولة، لم تؤدِ أي من الحلقات الـ 312 المكتملة إلى إصلاح ناجح. فقد قضى الوكلاء وقتهم المحدود بالكامل في مجرد محاولة التنقل في الكود وفهم المشكلة، ولم يصلوا أبدًا إلى مرحلة تطبيق الحل.

وعلى الرغم من غياب الإصلاحات الناجحة في هذه التجربة الاستطلاعية القصيرة، فقد أثبتت الدراسة بنجاح إمكانية جمع بيانات مفصلة حول كيفية سلوك هؤلاء الوكلاء. فقد حدد الباحثون أنواعًا محددة من الأخطاء التي تحدث عندما يحاول الذكاء الاصطناعي التفاعل مع النظام الحاسوبي، مثل إنشاء أوامر لا يستطيع الحاسوب فهمها أو محاولة الوصول إلى ملفات غير موجودة. كما طوروا طرقًا جديدة لقياس "تغير الكود" (code churn)، والذي يتتبع مقدار التغيير الذي يجريه الذكاء الاصطناعي على عمله قبل الاستقرار على إجابة نهائية. ويشير القدر العالي من التغير إلى أن الوكيل متردد أو غير مستقر، حيث يعيد كتابة الكود الخاص به باستمرار دون خطة واضحة. كما قدمت الدراسة مقياسًا لـ "فشل الأداة"، يميز بين الأخطاء الناتجة عن ضعف منطق الذكاء الاصطناعي والأخطاء الناتجة عن تعطل النظام الحاسوبي.

وتخلص الورقة البحثية إلى أنه بينما يظهر وكلاء الذكاء الاصطناعي هذه القدرة، فإن الطريقة الحالية لتقييمهم غير مكتملة. فمن خلال التركيز فقط على المحاولات الفردية، تفوت الصناعة ظاهرة "التذبذب" (flakiness) التي تجعل هذه الأدوات غير موثوقة للاستخدام في العالم الحقيقي. ويجادل الباحث بأن الوكيل الموثوق حقًا يجب أن يكون قادرًا على حل المشكلة باتساق عبر محاولات متعددة، وليس مجرد ضربة حظ في مرة واحدة. وقد أثبتت الدراسة الاستطلاعية أن الأدوات اللازمة لقياس هذا الاتساق موجودة، وأن البنية التحتية يمكنها التعامل مع جمع البيانات، حتى لو لم تكن نماذج الذكاء الاصطناعي الحالية جاهزة بعد لاجتياز الاختبار الكامل. وتشير النتائج إلى أن التقييمات المستقبلية يجب أن تتجاوز درجات النجاح والفشل البسيطة لتشمل سجلات مفصلة لرحلة الذكاء الاصطناعي، وقياس عدد المرات التي يتعثر فيها، وكم يتردد، وكم مرة يفشل في إكمال المهمة بسبب الانقطاعات الخارجية.

إن الهدف النهائي من هذا العمل هو وضع معيار جديد للثقة في هندسة البرمجيات المؤتمتة. فتمامًا كما قد يُطرد موظف بشري لكونه غير متسق وغير موثوق، يجب على مساعد الذكاء الاصطناعي أن يثبت قدرته على أداء واجباته بنفس الاستقرار. ولا تدعي هذه الدراسة أن نماذج الذكاء الاصطناعي الحالية قد حلت مشكلة الإصلاح الآلي؛ بل في الواقع، أظهرت بيانات الدراسة الاستطلاعية صفر إصلاحات ناجحة تحت الظروف الصارمة. بدلاً من ذلك، هي توفر المخطط لكيفية اختبار هذه الأنظمة بشكل صحيح في المستقبل. ومن خلال تحديد مقاييس جديدة للاتساق وتتبع الأمراض النوعية التي تؤدي إلى الفشل، وضع الباحث حجر الأساس لإجراء تقييم أكثر صدقًا وصرامة للذكاء الاصطناعي في تطوير البرمجيات. ويتضمن المسار المستقبلي إجراء التجربة كاملة النطاق مع حدود زمنية أطول ونماذج أكثر قوة لمعرفة ما إذا كان الاتساق سيتحسن، أم أن الوكلاء سيصبحون ببساطة أكثر تطورًا في أخطائهم. وحتى ذلك الحين، يجب على الصناعة أن تدرك أن إصلاحًا واحدًا ناجحًا ليس كافيًا لضمان السلامة أو الموثوقية في العالم المعقد لصيانة البرمجيات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →