← أحدث الأبحاث
🤖 AI

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

تقدم هذه الورقة SkillTV-Bench، وهو معيار شامل لتقييم التحقق من المسار المدرك للمهارة في وكلاء النماذج اللغوية الكبيرة (LLM agents)، إلى جانب SkillTV-Evolve، وهي طريقة تعمل على صقل مهارات التقييم القابلة لإعادة الاستخدام لتحسين دقة التحقق ومعدلات نجاح اختيار المسار بشكل كبير.

المؤلفون الأصليون: Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

نُشر 2026-08-07
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا تكتفي فيه الحواسيب بمجرد الدردشة معك، بل تقوم بالفعل بـ "أفعال". يمكنها فتح الملفات، وكتابة الأكواد، وتصفح الويب، وحتى التحكم في الروبوتات لحل مشكلات معقدة ومتعددة الخطوات. تُسمى هذه الأنظمة "وكلاء الذكاء الاصطناي" (AI Agents). ولكن هنا يكمن الجزء الصعب: عندما يحاول وكيل الذكاء الاصطناعي إصلاح موقع إلكتروني معطل أو التخطيط لرحلة، فإنه لا يعطيك مجرد إجابة نهائية واحدة، بل يخوض رحلة طويلة، يقوم خلالها بمئات التحركات الصغيرة، واستدعاء الأدوات، والتحقق من عمله على طول الطريق.

السؤال الكبير للعلماء هو: كيف نعرف ما إذا كان الذكاء الاصطناعي قد أدى عملاً جيداً حقاً؟ في الماضي، كنا ننظر فقط إلى النتيجة النهائية؛ فإذا بدا الموقع الإلكتروني مصلحاً، نقول "عمل رائع!". ولكن ماذا لو وصل الذكاء الاصطناعي إلى تلك النتيجة عبر اتخاذ طرق مختصرة، أو إذا قام بإصلاح الشيء الخطأ وتسبب في كسر شيء آخر في العملية؟ نحن بحاجة إلى طريقة لمراقبة الرحلة بأكملها، وليس فقط خط النهاية. وهنا يأتي دور "القضاة" — وهي أنظمة ذكاء اصطناعي خاصة تم تدريبها لمراجعة عمل الوكيل. لكن هؤلاء القضاة يعانون حالياً؛ فهم غالباً ما يُخدعون بالإجابات النهائية البراقة ويغفلون عن الأخطاء الخفية التي حدثت في الطريق، خاصة عندما يستخدم الوكيل "مهارات" معينة (مثل صندوق أدوات يحتوي على حيل مبرمجة مسبقاً) لإنجاز المهمة.

تقدم هذه الورقة البحثية طريقة جديدة لاختبار وتدريب هؤلاء القضاة. فقد أنشأ الباحثون ملعباً ضخماً يسمى SkillTV-Bench، وهو يشبه ماراثون عروض تلفزيونية يتكون من 681 حلقة مختلفة يحاول فيها وكلاء الذكاء الاصطناعي حل مهام من العالم الحقيقي عبر 11 مجالاً مختلفاً، من الأمن السيبراني إلى الطبخ. والمفاجأة هي أن القضاة لا يشاهدون فيديو فحسب؛ بل يتم تزويدهم بـ "دليل مهارات" الوكيل والوصول إلى الملفات والسجلات الفعلية التي أنشأها الوكيل. وهذا يسمح لهم برؤية ما كان من المفترض أن يفعله الوكيل بالضبط والتحقق مما إذا كان قد اتبع القواعد.

وجد الفريق أن حتى أذكى القضاة الحاليين يقعون في الفخ؛ فهم غالباً ما يقولون "اجتياز" لوكلاء يبدون جيدين في الظاهر ولكنهم فشلوا في المهمة فعلياً. ولإصلاح ذلك، بنى المؤلفون نظاماً يسمى SkillTV-Evolve. فكر في هذا النظام كـ "مدرب" للقاضي؛ فبدلاً من مجرد التخمين، يتم تزويد القاضي بقائمة مراجعة ديناميكية (تسمى "JudgeSkill") تخبره بالضبط بما يجب أن يبحث عنه، وأين يبحث، وما هي الأدلة التي تثبت نجاح الوكيل أو فشله. وإذا ارتكب القاضي خطأً، يقوم النظام تلقائياً بإعادة كتابة قائمة المراجعة لمنع حدوث هذا الخطأ في المرة القادمة.

كانت النتائج مثيرة للإعجاب. فمن خلال استخدام هذه القائمة المتطورة، قفزت دقة القاضي بنسبة تقارب 15 نقطة مئوية. ولكن السحر الحقيقي حدث عندما استخدموا هذا القاضي الأفضل لاختيار أفضل المحاولات من بين مجموعة من وكلاء الذكاء الاصطناعي. تخيل أن ذكاءً اصطناعياً يحاول حل لغز 10 مرات وينتج 10 محاولات مختلفة؛ قد يختار القاضي السيئ نجاحاً "مزيفاً"، ولكن هذا القاضي الجديد الواعي بالمهارات يمكنه رصد النجاح "الحقيقي" الوحيد. وباستخدام هذا القاضي الأفضل، تمكن الفريق من اختيار حل ناجح بنسبة 45.5% عند النظر في 10 محاولات، مقارنة بـ 22.9% فقط عند استخدام محاولة واحدة أو قاضٍ أضعف.

باخت-صار، تشير الورقة البحثية إلى أنه لكي نثق في وكلاء الذكاء الاصطناعي، نحتاج إلى قضاة لا ينظرون فقط إلى الصورة النهائية، بل يفحصون ألبوم الصور بأكمله، مستخدمين دليل التعليمات الخاص بالوكيل لكشف التزييف. ومن خلال تزويد هؤلاء القضاة بـ "كتاب قواعد" أفضل يتعلم من أخطائه، يمكننا جعل الذكاء الاصطناعي أكثر موثوقية في أداء المهام المعقدة في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →