Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation
تقدم الورقة البحثية "Autonomous QA Agent"، وهو إطار عمل للتوليد المعزز بالاسترجاع (RAG) يعمل على تحسين دقة سكربتات "Selenium" بشكل كبير من خلال ربط توليد الكود بالوثائق الخاصة بالمشروع وهياكل HTML الفعلية، محققاً معدل نجاح في التنفيذ بنسبة 90% مقارنة بـ 30% مع النماذج اللغوية الكبيرة القياسية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت ذكي جداً، ولكنه أخرق بعض الشيء، كيف يتنقل في منزل معين لإنجاز مهمة ما، مثل "إعداد كوب من القهوة".
المشكلة: الروبوت الأخرق
في عالم اختبار البرمجيات، هذا الروبوت هو ذكاء اصطناعي (AI)، وتحديداً ما يسمى بـ "النموذج اللغوي الكبير" (LLM). إذا طلبت من ذكاء اصطناعي قياسي أن يكتب نصاً برمجياً لـ "النقر على زر الشراء في موقع إلكتروني"، فسيبذل قصارى جهده. ومع ذلك، بما أنه لم يرَ الموقع الإلكتروني المحدد الذي تتحدث عنه، فعليه أن يخمن.
قد يخمن أن الزر يحمل الاسم #submit-button. ومع ذلك، في موقعك الفعلي، يحمل الزر الاسم #btn-pay-now. هنا يقوم الذكاء الاصطناعي بـ "الهلوسة" – أي يبتكر تفاصيل تبدو صحيحة ولكنها خاطئة تماماً. في الورقة البحثية، يشبه هذا الأمر روبوتاً يحاول فتح باب باستخدام مفتاح من ابتكاره بدلاً من المفتاح الذي يناسب القفل بالفعل. وعندما يحاول الروبوت استخدام مفتاحه الخاطئ، يتعطل النص البرمجي ويفشل الاختبار.
الحل: "وكيل ضمان الجودة المستقل" (Autonomous QA Agent)
لقد طور مؤلفو هذه الورقة نظاماً أكثر ذكاءً يسمى وكيل ضمان الجودة المستقل. تخيل هذا الوكيل كأنه روبوت لا يكتفي بالتخمين فحسب؛ بل يذهب أولاً إلى المكتبة ليقرأ المخططات ويعاين المنزل الفعلي قبل بدء العمل.
إليك كيف يعمل، باستخدام تشبيه بسيط:
المكتبة (قاعدة المعرفة): قبل أن يفعل الروبوت أي شيء، يأخذ النظام شيئين ويضعهما في مكتبة رقمية:
- التعليمات: المتطلبات المكتوبة (مثل وصفة طعام أو دليل مستخدم).
- المخططات: هيكل الكود الفعلي للموقع الإلكتروني (HTML)، والذي يوضح بالضبط مكان كل زر وحقل.
البحث (الاسترجاع): عندما تطلب من الروبوت "اختبار عملية الدفع"، فإنه لا يخمن ببساطة. بل يبحث فوراً في مكتبته. يجد الصفحة المحددة المتعلقة بـ "الدفع" ويسترجع المخططات الدقيقة لتلك الصفحة. يرى: "آه، زر 'الدفع' يحمل المعرف
btn_payوليسsubmit".الكتابة (التوليد): الآن يكتب الروبوت النص البرمجي باستخدام المعلومات الحقيقية التي وجدها للتو. لم يعد يخمن؛ بل يتبع الخريطة.
النتائج: سباق بين روبوتين
اختبر الباحثون هذا النظام الجديد ضد روبوت ذكاء اصطناعي قياسي في 20 سيناريو تسوق مختلفاً (مثل إضافة عناصر إلى السلة أو الدفع).
- الروبوت القياسي (بدون مكتبة): نجح في كتابة قواعد اللغة البرمجية (كانت القواعد جيدة)، لكنه فشل في 70% من الحالات في العثور على الأزرار لأنه كان يخمن. لقد اجتاز 30% فقط من الاختبارات.
- الوكيل المستقل (مع المكتبة): بما أنه بحث عن أسماء الأزرار الحقيقية، فقد اجتاز 90% من الاختبارات. كما نجح في كتابة القواعد بنسبة 100%.
لماذا هذا مهم؟
تجادل الورقة بأن المشكلة الأكبر في الاختبار الآلي ليست في أن الذكاء الاصطناعي لا يستطيع كتابة الكود؛ بل هي أن الذكاء الاصطناعي لا يعرف "العنوان" المحدد للأشياء التي يحتاج للنقر عليها. ومن خلال منح الذكاء الاصطناعي نظاماً "مدعوماً بالاسترجاع" (طريقة للبحث عن الحقائق قبل التحدث)، منعوا الروبوت من ابتكار عناوين خاطئة.
ما لا تدعيه الورقة
من المهم ملاحظة ما لا تدعيه هذه الورقة:
- هي لا تدعي أن هذا يعمل مع كل أنواع البرمجيات (مثل تطبيقات البنوك أو الصحة)؛ فقد اختبروه فقط على متجر إلكتروني وهمي.
- هي لا تقول إن الروبوت يمكنه إصلاح نفسه إذا تغير الموقع الإلكتروني غداً (رغم أنهم ذكروا هذا كفكرة مستقبلية).
- هي لا تدعي أنها أفضل من الأدوات التجارية باهظة الثمن التي يجب إعدادها يدوياً من قبل البشر؛ فقد قارنوها فقط بـ "ذكاء اصطناعي خام" بدون مكتبة.
الملخص
تقدم الورقة أداة تمنع الذكاء الاصطناعي من التخمين عند اختبار المواقع الإلكترونية. ومن خلال إجبار الذكاء الاصطناعي على قراءة "المخططات" الفعلية (HTML) و"التعليمات" (المستندات) الخاصة بالموقع الإلكتروني قبل كتابة الكود، ينشئ النظام اختبارات موثوقة تعمل بالفعل، محولاً إياه من مخمن أخرق إلى عامل دقيق.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.