← أحدث الأبحاث
💬 NLP

VeRO: An Evaluation Harness for Agents to Optimize Agents

تقدم الورقة البحثية VeRO، وهي حزمة تقييم ومجموعة اختبار شاملة مصممة لتقييم وتحسين وكلاء البرمجة بشكل منهجي من خلال دورات تحسين الوكيل التكرارية، مما يعالج التحديات الفريدة المتمثلة في تقييم الأنظمة التي تجمع بين الكود الحتمي وإكمالات النماذج اللغوية الكبيرة العشوائية.

المؤلفون الأصليون: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

نُشر 2026-02-27
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً (روبوت) ذكياً جداً، ولكنه أخرق قليلاً. يمكن لهذا الروبوت قراءة رسائل البريد الإلكتروني، وكتابة الأكواد البرمجية، والبحث في الويب، ولكنه يرتكب الأخطاء أحياناً، أو يقع في فخ الأخطاء المطبعية، أو ينسى مراجعة عمله.

في الماضي، إذا أردت جعل هذا الروبوت أفضل، كان عليك (أنت كبشر) أن تجلس، وتراقبه وهو يفشل، وتخمن ما الذي سار بشكل خاطئ، ثم تعيد كتابة تعليماته، وتحاول مجدداً. كانت العملية بطيئة، ومكلفة، وتتطلب جهداً بشرياً كبيراً.

المشكلة:
تساءل مؤلفو هذه الورقة البحثية: "ماذا لو استطعنا بناء روبوت ثانٍ وظيفته الوحيدة هي إصلاح الروبوت الأول؟"

هذا الروبوت الثاني (المُحسِّن - Optimizer) سيراقب فشل الروبوت الأول (الهدف - Target Agent)، ويكتب كوداً جديداً لإصلاح الأخطاء، ويختبر الإصلاح، ويكرر العملية تلقائياً. وهذا ما يسمى بـ تحسين الوكيل (Agent Optimization).

التحدي:
بناء روبوت لإصلاح روبوت آخر هو أمر صعب بشكل مفاجئ. الأمر يشبه محاولة ضبط تردد راديو بينما يقوم شخص آخر باستمرار بتغيير المحطة، ومستوى الصوت، وحالة الطقس.

  1. الأمر فوضوي: عقل الروبوت (الذكاء الاصطناعي) غير متوقع. أحياناً ينجح العمل، وأحياناً لا ينجح، حتى مع نفس التعليمات.
  2. الأمر مكلف: في كل مرة تختبر فيها إصلاحاً، فإن ذلك يكلف مالاً ووقتاً.
  3. من الصعب التتبع: إذا قام الروبوت المصلح بتغيير الكود 50 مرة، فكيف ستعرف أي تغيير هو الذي ساعد فعلياً؟ هل ساعد بسبب الكود الجديد، أم لمجرد أن الشمس كانت مشرقة؟

الحل: VERO (صالة الألعاب الرياضية للروبوتات)
بنت شركة Scale AI نظاماً جديداً يسمى VERO (الإصدارات، والمكافآت، والملاحظات). فكر في VERO كأنه صالة ألعاب رياضية عالية التقنية للروبوتات.

إليك كيف يعمل VERO، باستخدام تشبيهات بسيطة:

1. "كاميرا السفر عبر الزمن" (الإصدارات - Versioning)

في صالة الألعاب الرياضية العادية، إذا جربت تمريناً جديداً وفشلت، فقد تنسى بالضبط ما الذي فعلته بشكل خاطئ.
في صالة ألعاب VERO، يتم حفظ كل تغيير يقوم به الروبوت المصلح مثل Git commit (لقطة زمنية ثابتة).

  • التشبيه: تخيل لعبة فيديو بها زر "تراجع" (Undo). إذا جرب الروبوت المصلح استراتيجية جديدة وتعطل الروبوت المستهدف، فإن VERO يعود فوراً بالزمن إلى آخر نسخة ناجحة. هذا يضمن أننا لن نفقد التقدم أبداً ويمكننا دائماً رؤية ما الذي تغير بالضبط.

2. "الحكم الصارم" (الميزانية والقواعد)

في سيناريو من الواقع، قد يغش الروبوت المصلح باستخدام عقل قوي جداً (ومكلف) فقط لاجتياز الاختبار، وهو ما لا يعد إصلاحاً حقيقياً عادلاً.

  • التشبيه: يعمل VERO كحكم صارم في مباراة ملاكمة. فهو يضع ميزانية (مثل مؤقت زمني أو حد لعدد اللكمات التي يمكنك توجيهها). كما أنه يغلق الأبواب حتى لا يستطيع الروبوت المصلح التلصص على "نموذج الإجابة" (بيانات الاختبار) أو تغيير قواعد اللعبة. هذا يضمن أن التحسينات حقيقية، وليست مجرد تخمينات محظوظة.

3. "لوحة النتائج" (التغذية الراجعة المنظمة)

عادةً، عندما يفشل الروبوت، فإنه يقول فقط "خطأ" (Error). وهذا ليس مفيداً للمصلح.

  • التشبيه: يقدم VERO للروبوت المصلح بطاقة نتائج مفصلة. بدلاً من قول "فشل" فقط، يقول: "لقد فشلت لأنك نسيت التحقق من حالة الطقس قبل إرسال البريد الإلكتروني. إليك سجل دقيق لما حدث". هذا يساعد الروبوت المصلح على تعلم لماذا فشل، وليس فقط أنه فشل.

ماذا اكتشفوا؟ (النتائج)

استخدم الفريق VERO لإجراء تجارب مع أنواع مختلفة من الروبوتات المصلحة. إليك أهم النتائج، مترجمة إلى لغة بسيطة:

  • الروبوتات البسيطة تحصل على دفعة أكبر: إذا بدأت بروبوت أساسي وبسيط جداً، يمكن للروبوت المصلح إجراء تحسينات هائلة (مثل إضافة أدوات أو مهارات جديدة). ولكن إذا بدأت بروبوت متطور للغاية، فستكون هناك مساحة أقل للتحسين. الأمر يشبه ضبط سيارة رخيصة مقابل ضبط سيارة فيراري؛ السيارة الرخيصة لديها الكثير من "الثمار الدانية" التي يمكن إصلاحها.
  • التعليمات مهمة: طريقة إخبارك للروبوت المصلح بمهمته تغير كل شيء.
    • إذا أعطيته كتاب طبخ (قائمة من القواعد والأنماط الصارمة)، فسيعمل بشكل رائع مع الروبوتات البسيطة.
    • ولكن إذا كان الروبوت ذكياً بالفعل، فإن كثرة القواعد ستؤدي في الواقع إلى تقييده. الروبوت الذكي يحتاج إلى "حرية إبداعية" لابتكار حلوله الخاصة.
  • فخ "الأوامر النصية" (The Prompt Trap): معظم الروبوتات المصلحة كسولة. فهي تفضل مجرد تعديل التعليمات النصية (البرومبت/Prompts) بدلاً من إعادة كتابة هيكل الكود الفعلي. الأمر يشبه محاولة إصلاح محرك مكسور عن طريق طلاء غطاء المحرك باللون الأحمر؛ يبدو جميلاً، لكن المحرك لا يزال معطلاً. تظهر الورقة البحثية أننا بحاجة لتعليم هذه الروبوتات أن تكون أكثر استعداداً للقيام بالعمل الشاق المتمثل في إعادة كتابة الكود.
  • التخصص: الإصلاح الذي يجعل الروبوت بارعاً في الرياضيات قد يجعله سيئاً في التسوق. لا يوجد حل واحد يناسب الجميع.

لماذا يهم هذا؟

في الوقت الحالي، بناء وكلاء الذكاء الاصطناعي يشبه بناء منزل يدوياً، طوبة بطوبة، مع وجود مهندس معماري بشري. إنه أمر بطيء.

VERO هو الخطوة الأولى نحو البناء الآلي. إنه يثبت أننا نستطيع بناء أنظمة ذكاء اصطناعي لا تستطيع فقط أداء المهام، بل يمكنها أيضاً كتابة الكود الخاص بها لتصبح أفضل في تلك المهام.

الصورة الكبيرة:
هذه الورقة البحثية لا تتعلق فقط بجعل الروبوتات أكثر ذكاءً اليوم؛ بل تتعلق ببناء الآلة التي تبني آلات المستقبل. من خلال إنشاء طريقة عادلة وآمنة وقابلة للتكرار لاختبار هذه "الروبوتات المصلحة"، فإن المؤلفين يمنحون مجتمع الذكاء الاصطناعي بأكمله ساحة تجارب لمعرفة كيفية جعل مساعدينا الرقميين قادرين حقاً على تطوير أنفسهم ذاتياً.

باختصار: لقد بنوا صندوق رمال آمناً حيث يمكن للروبوتات التدرب على إصلاح روبوتات أخرى، ووجدوا أنه بينما يكون الأمر ممكناً، إلا أننا بحاجة إلى الحذر بشأن كيفية توجيههم حتى لا يكتفوا بتعديل السطح بل يقوموا فعلياً بإصلاح المحرك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →