One-Eval: An Agentic System for Automated and Traceable LLM Evaluation
يُعد One-Eval نظاماً وكيلياً يعمل على أتمتة التقييم الشامل للنماذج اللغوية الكبيرة عبر تحويل الطلبات المكتوبة باللغة الطبيعية إلى سير عمل قابل للتتبع والتخصيص من خلال مكونات متكاملة لتخطيط المعايير المرجعية، وحل مشكلات مجموعات البيانات، وإعداد التقارير الموجهة نحو اتخاذ القرار، مما يقلل الجهد اليدوي ويعزز قابلية التكرار.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك طاهٍ (شيف) ابتكرت للتو وصفة ثورية جديدة. وقبل أن تتمكن من تقديمها للعالم، تحتاج إلى معرفة: هل هي جيدة حقاً؟ هل طعمها مثل البيتزا أم مثل الفطيرة (البان كيك)؟ هل تسببت في حرق المطبخ؟
في عالم الذكاء الاصطناعي (AI)، يسمى "اختبار التذوق" هذا التقييم (Evaluation). ولكن في الوقت الحالي، فإن اختبار نموذج ذكاء اصطناعي جديد يشبه محاولة تشغيل مطبخ مطعم حيث تأتي كل مكوناته من دول مختلفة، وكل وصفة مكتوبة بلغة مختلفة، وعليك بناء موقدك وفرنك ولوح التقطيع الخاص بك يدوياً قبل أن تبدأ حتى في الطهي. إنه أمر بطيء، ومربك، وعرضة للأخطاء.
إليك One-Eval. فكر في One-Eval كأنه مساعد طاهٍ (Sous-Chef) (مساعد ماهر للغاية) يمكنك التحدث إليه باللغة الإنجليزية البسيطة. بدلاً من إعطائه أكواداً برمجية معقدة أو جداول بيانات، ما عليك سوى قول: "مهلاً، أريد التحقق مما إذا كان ذكائي الاصطناعي الجديد جيداً في الرياضيات وهل يمكنه قول الحقيقة."
إليك كيف يعمل One-Eval، مقسماً إلى ثلاث خطوات بسيطة:
1. المترجم (NL2Bench)
المشكلة: أنت تقول "تحقق من مهاراتي في الرياضيات". لكن الذكاء الاصطناعي لا يعرف أي اختبار رياضيات يستخدم. هل هو رياضيات المرحلة الابتدائية؟ أم حساب التفاضل والتكامل الجامعي؟ أم ألغاز مخادعة؟
حل One-Eval: هذا هو المترجم. إنه يستمع لطلبك العفوي ويحوله إلى قائمة تسوق احترافية.
- التشبيه: تخيل أنك تخبر وكيل سفر: "أريد عطلة شاطئية مريحة". الوكيل لا يحجز رحلة عشوائية فحسب؛ بل يستنتج أنك على الأرجم تريد هاواي، وليس صحراء، ويحجز منتجعات محددة تناسب ميزانيتك.
- ماذا يفعل: يأخذ جملتك، ويفهم بالضبط ما تعنيه، ويختار "الاختبارات" المثالية (المعايير/Benchmarks) من مكتبة ضخمة تضم الآلاف من الخيارات. بل إنه يسألك: "هل كنت تقصد هذا الاختبار المحدد؟" حتى تتمكن من تعديله قبل أن يبدأ.
2. مدير اللوجستيات (BenchResolve)
المشكلة: حتى لو عرفت الاختبار الذي تريد استخدامه، فإن الحصول على مواد الاختبار يعد كابوساً. أحد الاختبارات موجود على موقع إلكتروني، والآخر في ملف مضغوط (zip)، والثالث يستخدم تنسيقاً غريباً لا يفهمه حاسوبك. سيتعين عليك تحميلها، وإعادة تسمية الملفات، وإصلاح الروابط المعطلة يدوياً.
حل One-Eval: هذا هو مدير اللوجستيات. إنه يقوم بكل العمل الشاق خلف الكواليس.
- التشبيه: تخيل أنك طلبت بناء منزل مخصص. بدلاً من ذهابك بنفسك إلى مستودع الأخش、 ومتجر الأدوات، ومتجر لوازم السباكة لشراء الطوب والأنابيب، يقوم البناء بالذهاب وشراء كل شيء، وتسليمه لك عند مدخل منزلك، مرتباً في أكوام أنيقة.
- ماذا يفعل: يقوم تلقائياً بالعثور على ملفات البيانات الصحيحة، وتحميلها، و"ترجمتها" إلى تنسيق قياسي حتى يتمكن الذكاء الاصطناعي من إجراء الاختبار فعلياً. إنه يتأكد من بناء "الموقد" وتجهيز "المكونات".
3. الناقد والمُقرر (المقاييس والتقارير)
المشكلة: عادةً، عندما تختبر ذكاءً اصطناعياً، تحصل على رقم واحد فقط، مثل "85%". هذا يشبه معلماً يعطيك درجة "ب" دون أن يخبرك لماذا حصلت عليها، أو أي الأسئلة أخطأت فيها. هذا لا يساعدك على التحسن.
حل One-Eval: هذا هو الناقد. هو لا يعطيك مجرد درجة فحسب؛ بل يعطيك تقريراً كاملاً مع نصائح.
- التشبية: بدلاً من مجرد قول "لقد حصلت على ب"، يقول المدرب الرائع: "لقد كنت سريعاً، لكنك تعثرت في الحاجز الأخير. كما أن وضعية جسمك كانت رائعة في الجانب الأيسى ولكنها ضعيفة في الجانب الأيمن. إليك ثلاثة تدريبات محددة لإصلاح ذلك".
- ماذا يفعل: ينظر في كيفية فشل الذكاء الاصطناعي. هل كذب؟ هل ارتبك بسبب جملة طويلة؟ هل "هلوس" (ألف أشياء من خياله)؟ إنه ينشئ تقريراً ملوناً وسهل القراءة يخبرك بالضبط أين تكمن نقاط القوة لدى الذكاء الاصطناعي وأين يحتاج للعودة إلى المدرسة.
شبكة الأمان "الإنسان في الحلقة" (Human-in-the-Loop)
One-Eval ذكي، لكنه يعلم أنه ليس مثالياً. لذا لديه نقطة تفتيش للسلامة.
- التشبيه: فكر في الأمر كطيار يقود طائرة. يمكن لنظام الطيار الآلي (One-Eval) التعامل مع 99% من الرحلة، ولكن قبل الهبوط، يسأل الطيار (أنت): "مهلاً، أنا على وشك الهبوط على المدرج رقم 4. هل هذا مناسب؟" إذا قلت: "لا، استخدم المدرج رقم 2"، فسيغير النظام مساره فوراً.
- ماذا يفعل: في لحظات رئيسية، يتوقف ويعرض عليك خطته. يمكنك الموافقة عليها، أو تعديلها، أو أمره بالبدء من جديد. هذا يضمن أنك دائماً في موقع السيطرة، رغم أن النظام هو من يقوم بالعمل الممل.
لماذا يهم هذا؟
قبل One-Eval، كان اختبار الذكاء الاصطناعي يشبه محاولة تجميع أثاث من "إيكيا" بدون تعليمات، وباستخدام أدوات عليك بناؤها بنفسك. كان الأمر يستغرق أياماً ويتطلب دكتوراه في النجارة.
مع One-Eval، ما عليك سوى قول: "اصنع لي طاولة"، وسيقوم النظام بإحضار الخشب، والبراغي، والتعليمات، والمنتج النهائي، مع الإشارة إلى أي أرجل مهتزة. إنه يحول كابوساً يدوياً فوضوياً إلى محادثة سلسة ومؤتمتة، مما يجعل من السهل جداً على الشركات بناء ذكاء اصطناعي أكثر أماناً وذكاءً وموثوقية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.