FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation
تقدم الورقة البحثية FullStack-Agent، وهو نظام موحد يتكون من إطار عمل للتطوير متعدد الوكلاء، وطريقة ذاتية التحسين لتوسيع نطاق البيانات، ومعيار قياس شامل، والتي تمكن نماذج اللغات الكبيرة مجتمعة من إنشاء تطبيقات ويب متكاملة (full-stack) بمستوى إنتاجي مع تحسن ملحوظ في الأداء عبر وظائف الواجهة الأمامية، والخلفية، وقواعد البيانات مقارنة بالأساليب الحالية المتطورة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد بناء متجر إلكتروني كامل الوظائف. تطلب من مساعد ذكاء اصطناعي ذكي القيام بذلك. معظم مساعدي الذكاء الاصطناعي الحاليين يشبهون الرسامين الموهوبين الذين يعرفون فقط كيفية رسم واجهة المتجر. يمكنهم جعل اللوحة تبدو جميلة، والنوافذ لامعة، والأبواب تفتح بسلاسة، ولكن إذا حاولت شراء شيء ما، فلن يحدث شيء. لا توجد آلة تسجيل نقود، ولا غرفة للمخزون، ولا شاحنة توصيل. إنه متجر "مزيف" يبدو حقيقياً ولكنه يفتقر إلى الأنظمة الخلفية.
تقدم الورقة البحثية FullStack-Agent، وهو نظام جديد مصمم لمنع الذكاء الاصطناعي من مجرد رسم الواجهة وبناء المتجر بأكل، بما في ذلك السباكة غير المرئية، والمستودع، وشاحنات التوصيل.
إليك كيف فعلوا ذلك، مقسماً إلى ثلاثة أجزاء بسيطة:
1. طاقم البناء (FullStack-Dev)
بدلاً من إسناد المهمة إلى عامل ذكاء اصطناعي واحد يحاول القيام بكل شيء في وقت واحد، أنشأ المؤلفون طاقم بناء بأدوار محددة:
- المهندس المعماري (وكيل التخطيط): يقوم هذا الذكاء الاصطناعي بالنظر إلى طلبك ورسم المخططات. يقرر أين توضع الجدران، وأين تمر الأنابيب، وكيف تتدفق البيانات من الباب الأمامي إلى المكتب الخلفي.
- مهندس الواجهة الأمامية (Front-End Engineer): يقوم هذا العامل ببناء الجزء الذي تراه (تصميم الموقع الإلكتروني).
- مهندس الواجهة الخلفية (Back-End Engineer): يقوم هذا العامل ببناء الجزء الذي لا تراه (قاعدة البيانات ومنطق الخادم).
السلاح السري: يمتلك الطاقم أدوات تصحيح أخطاء خاصة (مثل جهاز تشخيص الأعطال الخاص بالميكانيكي).
- إذا لم يفتح الباب الأمامي، فإن مهندس الواجهة الأمامية لا يخمن فحسب؛ بل يقوم بإجراء اختبار يخبره بالضبط أي مسمار هو المرتخي.
- إذا كانت آلة تسجيل النقود لا تحصي الأموال، يستخدم مهندس الواجهة الخلفية أداة تشبه Postman (أداة يستخدمها المطورون الحقيقيون) لاختبار الاتصال مباشرة، بدلاً من محاولة إصلاحه بشكل عشوائي.
هذا العمل الجماعي يضمن أن "المتجر" يعمل بالفعل، وليس مجرد مظهر جيد.
2. المتدرب ذاتي التطوير (FullStack-Learn)
حتى مع وجود طاقم رائع، يجب أن يكون الذكاء الاصطناعي ذكياً بما يكفي لمعرفة كيفية بناء أشياء معقدة. أدرك المؤلفون أن مجرد قول "ابنِ متجراً" للذكاء الاصطناعي ليس كافياً؛ بل يحتاج إلى التعلم من أمثلة حقيقية.
لقد ابتكروا طريقة تسمى الترجمة العكسية (Back-Translation). تخيل أنك وجدت منزلاً مكتملاً وعالي الجودة (كود موقع إلكتروني حقيقي من GitHub). بد instead من مجرد نسخه، يتصرف الذكاء الاصطناعي كمحقق:
- يدرس المنزل المكتمل.
- يستنتج ما الذي طلبه مالك المنزل الأصلي (على سبيل المثال، "أريد منزلاً بباب أحمر ومرآب").
- ثم يتظاهر ببناء ذلك المنزل من الصفر، خطوة بخطوة، كما لو كانت المرة الأولى.
من خلال القيام بذلك مع آلاف المواقع الإلكترونية الحقيقية، يقوم الذكاء الاصطناعي بإنشاء "دليل التدريب" الخاص به. إنه يتعلم منطق البناء من الصفر بدلاً من مجرد النسخ. كما يستخدمون التعزيز (Augmentation)، حيث يأخذون تصميم منزل موجود ويسألون الذكاء الاصطناعي "أضف طابقاً ثانياً" أو "حول هذا المنزل إلى مخبز"، مما يخلق المزيد من سيناريوهات التدريب. هذا يسم يتيح للذكاء الاصطناي أن يصبح أكثر ذكاءً من تلقاء نفسه دون الحاجة إلى معلم بشري لكل خطوة.
3. المفتش الصارم (FullStack-Bench)
كيف تعرف أن الذكاء الاصطناعي بنى متجراً يعمل بالفعل وليس مجرد متجر مزيف؟ الاختبارات السابقة كانت مثل الفحص البصري: "هل يبدو الباب جميلاً؟ نعم. ناجح".
بنى المؤلفون نظام اختبار جديداً يسمى FullStack-Bench يعمل مثل مفتش الصحة:
- اختبار الواجهة الأمامية: هل يفتح الباب؟
- اختبار الواجهة الخلفية: هل سجلت آلة تسجيل النقود عملية البيع بالفعل؟
- اختبار قاعدة البيانات: هل المال موجود بالفعل في الحساب البنكي، أم أن الآلة تظاهرت فقط باستلامه؟
المفتش لا ينظر فقط إلى الموقع الإلكتروني؛ بل يقوم بإجراء اختبارات فعلية ليرى ما إذا كان يتم حفظ واسترجاع البيانات بشكل صحيح. إذا قام الذكاء الاصطناعي بتزييف الواجهة الخلفية، سيكتشفه المفتش على الفور.
النتائج
عندما وضعوا هذا النظام قيد الاختبار:
- بنى طاقم البناء الجديد (FullStack-Dev) مواقع إلكترونية تعمل بشكل أفضل بكثير من الطرق السابقة. لقد حسن معدل نجاح "واجهة المتجر" بنحو 9%، و"آلة تسجيل النقود" بنسبة هائلة بلغت 38%، و"الحساب البنكي" (قاعدة البيانات) بنسبة 16%.
- أخذ المتدرب ذاتي التطوير (FullStack-Learn) نموذج ذكاء اصطناعي قياسي، ومن خلال ممارسته الخاصة، جعله أكثر ذكاءً بشكل ملحوظ في بناء هذه الأنظمة الكاملة، محققاً تحسناً في درجاته بنسبة تقارب 10% في بعض المجالات.
باخت-القول: تقدم الورقة نظاماً يمنع الذكاء الاصطناعي من مجرد "تزييف" المواقع الإلكترونية. فهو يستخدم فريقاً من عمال الذكاء الاصطبي المتخصصين، ويعلمهم من خلال الهندسة العكسية لمشاريع حقيقية، ويوظف مفتشاً صارماً للتأكد من أن الأجزاء غير المرئية من الموقع الإلكتروني تعمل بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.