Conv-to-Bench: Evaluating Language Models Via User-Assistant Dialogues In Code Tasks
يُعد Conv-to-Bench إطار عمل متعدد المراحل وقابل للتوسع، يقوم تلقائياً بتحويل حوارات المستخدم والمساعد متعددة الأدوار والحقيقية إلى معايير تقييم مهيكلة وقابلة للتحقق لمهام البرمجة، محققاً توافقاً شبه تام مع المعايير التي يضعها البشر مع تقليل الاعتماد بشكل كبير على التنسيق الخبير كثيف العمالة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية كتابة كود برمجي. للقيام بذلك بشكل جيد، تحتاج إلى اختبار لترى ما إذا كان الروبوت يتحسن. تقليديًا، إنشاء هذه الاختبارات يشبه استئجار فريق من الطهاة المهرة لكتابة 1,000 وصفة فريدة ومثالية يدويًا. إنه أمر مكلف، بطيء، ويصعب توسيع نطاقه. إذا أردت اختبارًا جديدًا، عليك الانتظار حتى يكتب الطهاة الاختبار مرة أخرى.
تقدم هذه الورقة طريقة جديدة لصنع هذه الاختبارات تسمى Conv-to-Bench. بدلًا من استئجار طهاة لكتابة وصفات جديدة من الصفر، قرر الباحثون النظر في "سجلات المطبخ" لأشخاص حقيقيين يتحدثون مع المساعدين الذكيين. لقد تساءلوا: هل يمكننا تحويل هذه المحادثات الواقعية الفوضوية إلى اختبار مثالي؟
إليك كيف فعلوا ذلك، مقسمًا إلى خطوات بسيطة:
1. المشكلة: عنق الزجاجة المتمثل في "الطاهي"
في الوقت الحالي، أفضل الاختبارات للذكاء الاصطائي (مثل BigCodeBench) يكتبها خبراء بشريون. يستغرق الأمر منهم عامًا كاملًا لصنع اختبار جيد. الأمر يشبه محاولة بناء مدينة جديدة عن طريق نحت كل طوبة فيها يدويًا. الجودة عالية، لكنها بطيئة جدًا لمواكبة سرعة تعلم الذكاء الاصطناعي.
2. الحل: التنقيب في "سجلات المطبخ"
أدرك الباحثون أن الملايين من الناس يتحدثون بالفعل مع الذكاء الاصطناعي يوميًا، ويطلبون المساعدة في البرمجة. هذه المحادثات هي مناجم ذهب.
- السيناريو: يطلب مستخدم: "اكتب سكربت بايثون". يكتب الذكاء الاصطناي شيئًا خاطئًا. يقول المستخدم: "لا، إنه يتعطل عند تشغيله. أصلح الحلقة (loop)". يحاول الذكاء الاصطناعي مرة أخرى. يقول المستخدم: "رائع، الآن أضف تعليقًا".
- الرؤية المستخلصة: هذا الأخذ والرد ليس مجرد دردشة؛ بل هو مخطط توجيهي. طلب المستخدم النهائي، مدمجًا مع كل تصحيحاته، هو في الواقع مجموعة تعليمات مفصلة ومثالية لما يجب أن يكون عليه حل الكود الجيد.
3. العملية: تحويل الدردشة إلى قائمة تحقق
بنى الفريق نظامًا (Conv-to-Bench) يعمل كمحرر فائق الذكاء. يأخذ هذه المحادثات الطويلة والفوضوية ويقوم بثلاثة أشياء:
- التصفية (Filters): يستبعد الدردشات المتعلقة بالطبخ أو الطقس، ويحتفظ فقط بتلك المتعلقة بالبرمجة.
- التركيب (Synthesizes): يقرأ المحادثة بأكملها ويكتب "تعليمات رئيسية" واحدة مثالية تجمع بين الطلب الأصلي وكل الإصلاحات التي طلبها المستخدم.
- إنشاء قائمة تحقق (Creates a Checklist): يحول تلك التعليمات إلى قائمة "نعم/لا" بسيطة. على سبيل المثال: "هل يعمل الكود دون أخطاء؟" "هل يتعامل مع الحلقة بشكل صحيح؟" "هل توجد تعليقات؟"
4. التجربة: هل نجح الأمر؟
اختبروا هذا النظام الجديد لمعرفة ما إذا كان بإمكانه ترتيب نماذج الذكاء الاصطناي بنفس الطريقة التي تفعلها الاختبارات المكتوبة بشريًا (عالية الجودة).
- النتيجة: لقد نجح الأمر بشكل مذهل. عندما قارنوا اختباراتهم المولدة بواسطة الذكاء الاصطناي بالاختبار "المعياري الذهبي" المكتوب بشريًا (BigCodeBench)، تطابقت التصنيفات بشكل شبه مثالي. في بعض الحالات، كان الارتباط 1.0 من أصل 1.0 — مما يعني أن النظام الجديد اتفق مع الخبراء البشر بنسبة 100%.
- تحول "التغذية الراجعة": جربوا نسختين. استخدمت الأولى التعليمات النهائية فقط، بينما استخدمت الأخرى التعليمات بالإضافة إلى شكاوى وتصحيحات المستخدم (التغذية الراجعة). ومن المثير للدهشة، أن النسخة التي تحتوي على التعليمات فقط كانت في الواقع أكثر استقرارًا وموثوقية. فالتغذية الراجعة للمستخدم أدت أحيانًا إلى إضافة "ضجيج" (ارتباك) بدلاً من الوضوح، مثل زبون يغير رأيه عدة مرات كثيرة.
5. الحكم النهائي
تخلص الورقة إلى أننا لسنا بحاجة لانتظار الخبراء البشريين لكتابة كل اختبار جديد. يمكننا استخدام المحادثات الطبيعية والفوضوية التي يجريها الناس بالفعل مع الذكاء الاصطناعي لبناء اختبارات عالية الجودة وموثوقة تلقائيًا.
باخت-الاختصار:
فكر في الاختبار التقليدي على أنه رسم لوحة فنية يدوية (بطيء، مكلف، مثالي).
أما Conv-to-Bench فهو يشبه استخدام ماسح ضوئي عالي التقنية لتحويل ملايين الرسومات الأولية الخشنة التي صنعها الجمهور إلى لوحة فنية معيارية مثالية. إنه أسرع، وأرخص، ودقيق بشكل مدهش، بشرًا إذا التزمت بالتعليمات الأساسية وتجاهلت الخربشات الفوضوية في الهوامش.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.