Safe and Scalable Web Agent Learning via Recreated Websites
تقدم هذه الورقة VeriEnv، وهو إطار عمل يستفيد من النماذج اللغوية لاستنساخ المواقع الإلكترونية الواقعية تلقائياً إلى بيئات اصطناعية آمنة وقابلة للتحقق، مما يمكّن الوكلاء الويب المستقلين من إجراء تطور ذاتي قابل للتوسع وتحقيق تعميم قوي دون الاعتماد على التفاعلات غير الآمنة في العالم الحقيقي أو إشارات المكافأة الاستدلالية.
المؤلفون الأصليون:Hyungjoo Chae, Jungsoo Park, Alan Ritter
تخيل أنك تريد تعليم روبوت كيفية التنقل عبر الإنترنت للقيام بأمور مثل حجز رحلة طيران، أو شراء البقالة، أو التحقق من حالة الطقس. تكمن المشكلة في أن الإنترنت الحقيقي مكان خطير وفوضوي لروبوت يتعلم. إذا ارتكب الروبوت خطأً، فقد يحذف بياناتك بالخطأ، أو يرسل رسائل مزعجة لموقع إلكتروني، أو يتم حظره من قبل أنظمة الأمان. بالإضافة إلى ذلك، كيف ستعرف ما إذا كان الروبوت قد نجح حقاً؟ هل وجد الرحلة الصحيحة بالفعل، أم أنه كان يخمن فقط؟
تقدم هذه الورقة البحثية VERIENV، وهو إطار عمل ذكي يحل هذه المشكلات عبر بناء نسخة "فيديو جيم" مثالية وآمنة من الإنترنت الحقيقي ليتدرب فيها الروبوت.
إليك التفاصيل باستخدام تشبيهات بسيطة:
١. المشكلة: التعلم على الإنترنت "المباشر" أمر خطير
تخيل الإنترنت الحقيقي كأنه مدينة حقيقية مزدحمة.
المخاطرة: إذا أرسلت سائقاً مبتدئاً (الوكيل الذكي - AI Agent) ليتعلم في هذه المدينة، فقد يصطدم بسيارة، أو يتجاوز إشارة حمراء، أو يضل الطريق. ولا يمكنك ببساطة "إعادة ضبط" المدينة إذا أخطأ.
مشكلة الحكم: في الماضي، حاول الباحثون الاستعانة بذكاء اصطناعي متطور (مثل المعلم) لينظر إلى عمل الطالب ويقول له: "عمل جيد!" أو "حاول مرة أخرى". لكن هذا المعلم غالباً ما يكون مخطئاً، أو منحازاً، أو يسهل خداعه. الأمر يشبه طلب تصحيح اختبار رياضيات من إنسان دون وجود نموذج إجابة؛ فقد يكتفي بمجرد التخمين.
٢. الحل: مدينة "التوأم الرقمي"
ابتكر المؤلفون VERIENV، الذي يعمل مثل محاكي طيران عالي التقنية للإنترنت.
النسخة المستنسخة: بدلاً من ترك الروبوت يقود على طريق سريع حقيقي، يقوم "وكيل برمجي" خاص (ذكاء اصطناعي فائق البرمجة) بالنظر إلى موقع إلكتروني حقيقي (مثل أمازون أو موقع إخباري) ويبني فوراً نسخة رقمية مثالية منه.
الوصول السري: هذه ليست مجرد صورة للموقع؛ بل هي نسخة حية وعاملة بالكامل لها قاعدة بياناتها وبرمجتها الخاصة. والأهم من ذلك، منح الباحثون الروبوت "مفتاحاً خلفياً" (Python SDK). هذا المفتاح يسمح للروبوت بالنظر داخل غرفة المحركات ليرى بالضبط ما يحدث، وهو أمر مستحيل في العالم الحقيقي.
٣. الواجب المنزلي "ذاتي التصحيح"
هذا هو الجزء الأكثر سحراً. في العالم الحقيقي، عليك الانتظار حتى يصحح إنسان واجبك المنزلي. أما في VERIENV، فإن النظام يكتب نموذج إجابته الخاص.
المهمة: يقوم النظام بإنشاء مهمة، مثل "ابحث عن أرخص قميص أحمر".
المُحقِّق (Validator): بما أن الباحثين يمتلكون "المفتاح الخلفي"، يمكنهم كتابة برنامج صغير يتحقق فوراً من قاعدة البيانات: "هل وجد الروبوت القميص الأحمر فعلاً؟ نعم/لا".
المكافأة: إذا نجح الروبوت، يحصل على درجة كاملة. وإذا فشل، يحصل على صفر. لا يوجد تخمين، ولا انحياز بشري، ولا كلمة "ربما". إنه موضوعي بنسبة ١٠٠٪.
٤. لماذا هذا مهم: "الدوجو اللانهائي"
بما أن هذا النظام آمن وتلقائي، يمكن للروبوت أن يتدرب للأبد.
التطور الذاتي: يمكن للروبوت محاولة حل مهمة، ثم الفشل، ثم التعلم، ثم المحاولة مجدداً ليصبح أفضل. يمكنه إنشاء آلاف التحديات الجديدة لنفسه دون الحاجة إلى بشر لكتابتها.
التوسع: تماماً كما تتحسن لعبة الفيديو كلما أضفت مستويات جديدة، وجد الباحثون أنه كلما استنسخوا المزيد من "المدن الرقمية" (المواقع الإلكترونية)، أصبح الروبوت أكثر ذكاءً.
النتيجة
عندما اختبروا هذه الروبوتات على مواقع حقيقية (مثل WebArena و Mind2Web)، كانت الروبوتات التي تدربت في هذا "المحاكي الآمن" أفضل بكثير في التنقل عبر الإنترنت الحقيقي مقارنة بالروبوتات التي تدربت بالطرق القديمة.
باختصار: VERIENV يشبه بناء لعبة فيديو آمنة، لانهائية، وذاتية التصحيح تشبه الإنترنت الحقيقي تماماً. إنها تسمح لوكلاء الذكاء الاصطناعي بممارسة مهاراتهم دون كسر أي شيء، ولأن اللعبة تعرف نموذج الإجابة الدقيق، فإن الوكلاء يتعلمون بشكل أسرع وأكثر موثوقية من أي وقت مضى.
إليك ملخص تقني مفصل لورقة البحث "Safe and Scalable Web Agent Learning via Recreated Websites" (تعلم وكلاء الويب بشكل آمن وقابل للتوسع عبر المواقع المعاد إنشاؤها) للباحثين هيونغجو تشاي، جونغسو بارك، وآلان ريتر.
1. بيان المشكلة
يواجه تدريب وكلاء الويب المستقلين ثلاثة قيود جوهرية عند التفاعل مع مواقع الويب في العالم الحقيقي:
السلامة والمخاطر: الاستكشاف المباشر غير آمن؛ فقد يتداخل الوكلاء مع مستخدمين آخرين، أو ينتهكون سياسات المنصات، أو يطلقون آليات أمنية (مثل اختبارات CAPTCHA أو حظر Cloudflare).
عدم القدرة على إعادة الضبط (Resetability): بيئات العالم الحقيقي يصعب إعادة ضبطها إلى حالة معروفة، مما يعيق التدريب والتجريب المتكرر.
التغذية الراجعة غير الموثوقة: نادراً ما توفر المواقع الحقيقية حقيقة أرضية (ground truth) يمكن التحقق منها. تعتمد النماذج الحالية "ذاتية التطور" غالباً على نموذج "النموذج اللغوي الكبير كحكم" (LLM-as-a-Judge) لتقييم مسارات الوكيل. وهذا يؤدي إلى إدخال الذاتية، ومخاطر الهلوسة، وإشارات مكافأة عرضة للخطأ، مما يؤدي إلى عدم استقرار التعلم.
التحدي الأساسي هو إنشاء إطار عمل يسمح للوكلاء بالتطور ذاتياً (توليد المهام، التفاعل، والتحسن) دون مخاطر التفاعل مع العالم الحقيقي ودون عدم موثوقية التقييم الاستدلالي.
2. المنهجية: إطار عمل VERIENV
يقترح المؤلفون VERIENV، وهو إطار عمل يعامل النماذج اللغوية الكبيرة (LLMs) كـ "منشئي بيئات". بدلاً من التدريب على مواقع الويب الحية، يقوم VERIENV تلقائياً باستنساخ مواقع الويب الواقعية إلى بيئات اصطناعية قابلة للتنفيذ والتحقق بالكامل.
يعمل إطار العمل عبر ثلاث مراحل رئيسية (كما هو موضح في الشكل 2 من الورقة):
أ. بناء البيئة (الاستنساخ)
المدخلات: لقطات شاشة وأوصاف لموقع ويب مستهدف من العالم الحقيقي.
العملية: يقوم وكيل برمجي (Coding Agent) (مدعوم بـ GPT-5.2) بإعادة بناء موقع الويب من البداية إلى النهاية.
يقوم بتوليد الواجهة الأمامية (HTML/CSS/JS)، ومنطق الواجهة الخلفية (Backend)، وحالة قاعدة البيانات.
ينشئ مجموعة أدوات تطوير (Python SDK) توفر وصولاً داخلياً متحكماً فيه إلى البيئة (على سبيل المثال، الاستعلام عن قاعدة البيانات مباشرة، وتجاوز واجهة المستخدم).
التحسين: يقوم الوكيل بتصحيح أخطاء الموقع المستنسخ بشكل تكراري باستخدام Playwright MCP (بروتوكول سياق النموذج) لمقارنة المخرجات المصورة مقابل لقطات الشاشة المرجعية، ومعالجة الأخطاء حتى تستقر البيئة وتصبح وظيفية.
ب. توليد المهام والتحكيم القابل للتحقق
توليد المهام: تولد النماذج اللغوية الكبيرة مهاماً باللغة الطبيعية بناءً على البيئة المستنسخة.
برنامج التحقق: من الضروري أن يتم اقتران كل مهمة بـ برنامج تحقق يعتمد على Python SDK.
بدلاً من سؤال نموذج لغوي كبير عما إذا كانت الإجابة "صحيحة"، يقوم برنامج التحقق بتنفيذ كود للتحقق من حالة البيئة (على سبيل المثال، الاستعلام عن قاعدة البيانات بحثاً عن سجل معين).
ينتج هذا حكماً قابلاً للتحقق (Verifiable Judge) يقيم الحالة النهائية للوكيل بشكل حتمي.
المخرجات: مجموعة بيانات من المهام مع مُحققات قابلة للتنفيذ، مما يضمن أن المكافآت ثنائية، حتمية، وخالية من هلوسة النماذج اللغوية الكبيرة.
ج. تعلم الوكيل ذاتي التطور
حلقة التدريب: يتفاعل الوكلاء مع البيئة الاصطناعية لحل المهام.
إشارة المكافأة: عند الانتهاء، يتم تقييم مسار الوكيل عن طريق تشغيل برنامج التحقق عبر Python SDK. وهذا ينتج إشارة مكافأة حتمية (نجاح/فشل).
الضبط الدقيق (Fine-Tuning): يستخدم إطار العمل الضبط الدقيق بالرفض القائم على المكافأة (Reward-based Rejection Fine-Tuning). يتم الاحتفاظ فقط بالمسارات التي تستوفي معايير التحقق القابلة للتنفيذ، مما يسمح للوكلاء بالتطور ذاتياً من خلال التعلم من النجاحات المتحقق منها دون إشراف بشري.
3. المساهمات الرئيسية
إطار عمل VERIENV: خط إنتاج مبتكر يعيد بناء مواقع الويب الواقعية تلقائياً إلى بيئات اصطناعية آمنة، قابلة لإعادة الضبط، ومجهزة بالكامل مع وصول داخلي كامل.
التحقق الحتمي: تقديم برامج تحقق قابلة للتنفيذ (عبر Python SDK) تحل محل تقييمات "النموذج اللغوي الكبير كحكم" غير الموثوقة، مما يوفر مكافآت ذات حقيقة أرضية لتدريب الوكيل.
التطور الذاتي القابل للتوسع: إثبات أن الوكلاء يمكنهم تحقيق إتقان خاص بالموقع (site-specific mastery) وتعميم عبر المجالات من خلال التدريب على هذه البيئات الاصطناعية، مما يلغي الحاجة إلى البيانات البشرية المكلفة أو التفاعل الخطير مع العالم الحقيقي.
إنشاء مجموعة بيانات: بناء مجموعة بيانات واسعة النطاق تضم 149 موقع ويب اصطناعياً و 7,400 مهمة قابلة للتحقق بمستويات صعوبة متفاوتة.
4. النتائج التجريبية
قيم المؤلفون VERIENV على معيارين رئيسيين: WebArena و Mind2Web-Online.
التعميم عبر المجالات:
أظهر الوكلاء المدربون على VERIENV تحسناً ملحوظاً مقارنة بالنماذج الأساسية عند اختبارهم على مواقع غير مرئية.
Qwen3-4B: حسن معدل النجاح بنسبة +6.06% في WebArena.
LLaMA-3.2-3B-Instruct: حسن معدل النجاح بنسبة +9.09% في WebArena.
في Mind2Web-Online، تفوقت الوكلاء المدربة بـ VERIENV على النماذج المرجعية (Synatra, ADP) بنسبة +7.27% (Qwen) و +13.19% (LLaMA).
الإتقان الخاص بالموقع:
في التجارب حيث تم تدريب الوكلاء بشكل متكرر على موقع مستنسخ واحد، أظهرت وكلاء VERIENV مكاسب أداء ثابتة بمرور الوقت.
مقارنة بـ PAE (منهج سابق يستخدم مواقع حقيقية وأحكام نماذج لغوية كبيرة)، حقق VERIENV تحسينات أكثر استقراراً وأكبر، مما يثبت أن المكافآت القابلة للتحقق تتفوق على الأحكام الاستدلالية للتحسين الذاتي المتكرر.
تأثيرات التوسع (Scaling Effects):
تظهر الورقة وجود علاقة طردية بين عدد بيئات التدريب وأداء الوكيل. مع زيادة عدد المواقع المستنسخة، تحسنت قدرات الوكيل، مما يشير إلى أن توسيع البيئة (environment scaling) هو مسار قابل للتطبيق لتطوير وكلاء الويب.
التقييم البشري:
حققت البيئات الاصطناعية معدل صحة وظيفية بنسبة 90.3% وتقييماً بصرياً قدره 4.7/5، مما يؤكد الدقة العالية.
بلغت قابلية تنفيذ المهام 90%، وصحة الحكم 76% (كانت الأخطاء ناتجة أساساً عن عدم اتساق إعادة ضبط قاعدة البيانات، وهي أمور يمكن إصلاحها).
5. الأهمية والأثر
السلامة: من خلال فصل التدريب عن التفاعل مع العالم الحقيقي، يلغي VERIENV مخاطر مثل السبام (Spamming)، أو فساد البيانات، أو انتهاك السياسات أثناء مرحلة التعلم.
قابلية التكرار: استخدام المحكمات البرمجية الحتمية يزيل طبيعة "الصندوق الأسود" لتقييمات النماذج اللغوية الكبيرة، مما يجعل تدريب الوكيل أكثر صرامة وقابلية للتدقيق.
القابلية للتوسع: يتيح إطار العمل التوليد التلقائي لسيناريوهات تدريب متنوعة ولا نهائية، مما يعالج مشكلة نقص البيانات في أبحاث وكلاء الويب.
الاتجاه المستقبلي: يمهد VERIENV الطريق لتعلم تعزيزي (Reinforcement Learning) مبدئي لوكلاء الويب، حيث يمكن للوكلاء تحدي أنفسهم ذاتياً وتحسين أدائهم باستمرار في بيئة محاكاة آمنة ومعزولة قبل النشر الفعلي.
في الختام، يمثل VERIENV تحولاً جذرياً من "التعلم عبر التفاعل مع الويب الحقيقي الفوضوي" إلى "التعلم عبر إتقان توأم رقمي مستنسخ وقابل للتحقق"، مما يوفر أساساً قوياً للجيل القادم من وكلاء الويب المستقلين.