DIALEVAL: Automated Type-Theoretic Evaluation of LLM Instruction Following
تقدم الورقة البحثية DIALEVAL، وهو إطار عمل قائم على نظرية الأنواع يستخدم وكلاء نماذج لغوية كبيرة (LLM) مزدوجين لتفكيك التعليمات تلقائياً إلى محمولات نمطية ذات دلالات استيفاء متمايزة، مما يحقق دقة أعلى بكثير ومواءمة أقوى مع التقدير البشري مقارنة بالنماذج المرجعية الحالية، لا سيما في سياقات المحادثات المعقدة ومتعددة الأدوار.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك معلم صارم يصحح واجبات طالب. يجب على الطالب اتباع مجموعة محددة للغاية من القواعد: "اكتب قصة عن قطة، ولكن يجب أن تكون مكونة من 50 كلمة بالضبط، وتستخدم نبرة حزينة، وتتضمن الرقم 42".
في الماضي، كان التحقق مما إذا كان الطالب قد اتبع هذه القواعد كابوساً. كان عليك قراءة كل قصة، وعد الكلمات، والتحقق من النبرة، والمجادلة مع معلمين آخرين حول ما إذا كانت عبارة "50 كلمة" تعني "50 كلمة بالضبط" أو "حوالي 50 كلمة". أحياناً، كنت تخطئ لأنك كنت متعباً أو لأن القواعد كانت غامضة للغاية.
DIALEVAL يشبه توظيف اثنين من مساعديك الآليين الأذكياء والمتخصصين للقيام بهذا التصحيح، ولكن مع لمسة خاصة؛ فهما لا يقرآن القصة فحسب، بل يفهمان نوع القاعدة التي تم خرقها أو اتباعها.
إليك كيف يعمل الأمر، مقسماً إلى مفاهيم بسيطة:
1. فريق الروبوت المكون من اثنين
بدلاً من روبوت واحد يحاول القيام بكل شيء، يستخدم DIALEVAL فريقاً من عميلين:
روبوت التفكيك (المحلل): يقرأ هذا الروبوت تعليمات المعلم ويقسمها إلى قطع صغيرة سهلة الهضم. إنه يشبه أخذ وصفة معقدة وإدراج كل مكون وخطوة فيها بشكل منفصل.
- مثال: إذا كانت التعليمات هي "اكتب قصة حزينة عن قطة في 50 كلمة بالضبط"، فسيقوم هذا الروبوت بتجزئتها إلى:
- المحتوى: يجب أن تكون عن قطة.
- الأسلوب: يجب أن يكون حزيناً.
- التنسيق: يجب أن تكون 50 كلمة بالضبط.
- والأهم من ذلك، أنه يتأكد من عدم تداخل هذه الخطوات؛ فهو يعاملها كمهام مستقلة.
- مثال: إذا كانت التعليمات هي "اكتب قصة حزينة عن قطة في 50 كلمة بالضبط"، فسيقوم هذا الروبوت بتجزئتها إلى:
روبوت التصحيح (المقيم): يأخذ هذا الروبوت قصة الطالب ويتحقق منها مقابل القائمة. ولكن السحر يكمن في أن: هذا الروبوت يصحح بشكل مختلف اعتماداً على نوع القاعدة.
- بالنسبة لـ "المحتوى" (القطة): هو مرن. إذا كانت القصة عن "حيوان فصيلة السنوريات" بدلاً من "قطة"، أو إذا كانت القطة "تخرخر" بدلاً من "تموء"، فسيقول الروبوت: "قريب بما يكفي! هذه هي نفس الفكرة". إنه يفهم الفروق الدقيقة في اللغة البشرية.
- بالنسبة لـ "الأرقام" (الـ 50 كلمة): هو مثل الصقر. إذا كانت القصة 49 كلمة أو 51 كلمة، فسيرسب الطالب فوراً. لا مجال لـ "قريب بما يكفي" هنا.
- بالنسبة لـ "الأسلوب" (الحزن): ينظر إلى الحالة المزاجية العامة، مثل ناقد موسيقي يقيم "جو" أغنية ما.
2. لماذا يعد هذا أمراً هاماً؟
قبل DIALEVAL، كانت أنظمة التصحيح الآلي تشبه المطرقة الثلمة. كانت تستخدم نفس القواعد الصارمة لكل شيء.
- كانت ستفشل قصة عن قطة لمجرد أنها استخدمت كلمة "سنوريات" (صارمة جداً فيما يخص المحتوى).
- وقد تقبل قصة طولها 100 كلمة لأنها لم تتحقق من الحساب (متساهلة جداً فيما يخص الأرقام).
DIALVEAL يشبه نموذج تصحيح مخصص. فهو يعرف أن البشر مرنون مع الكلمات ولكنهم صارمون مع الرياضيات. ومن خلال محاكاة كيفية تفكير البشر الحقيقيين، فإنه يرتكب أخطاء أقل بكثير. في الاختبارات، حقق الدرجة الصحيحة بنسبة 90%، بينما حققت الطرق القديمة الدرجة الصحيحة بنسبة 87% فقط. قد لا يبدو هذا فرقاً كبيراً، ولكن في عالم الذكاء الاصطناي، تعد هذه قفزة هائلة.
3. تحدي "المحادثة"
معظم اختبارات الذكاء الاصطناعي تنظر فقط إلى سؤال واحد وإجابة واحدة (مثل مسألة رياضية واحدة). لكن الحياة الواقعية هي محادثة. قد تقول: "أخبرني نكتة"، فيخبرك الذكاء الاصطناعي بنكتة. ثم تقول: "اجعلها أقصر"، فيقوم الذكاء الاصطناعي بتقصيرها.
DIALEVAL مميز لأنه يمكنه تذكر المحادثة بأكملها. فهو لا ينظر فقط إلى الجملة الأخيرة؛ بل ينظر إلى تاريخ المحادثة.
- تشبيه: تخيل لعب لعبة "الهاتف المكسور" حيث تتغير القواعد في كل دور. DIALEVAL هو الحكم الذي يتذكر القواعد الأصلية والقواعد الجديدة أيضاً، مما يضمن أن اللاعب لا يزال يتبع قواعد اللعبة، حتى بعد 20 دوراً من الدردشة.
4. ماذا اكتشفوا؟
عندما استخدموا DIALEVAL لاختبار نماذج ذكاء اصطناعي مختلفة (مثل GPT-4، Mixtral، إلخ) في هذه المحادثات الطويلة، وجدوا بعض نقاط الضعف المضحكة:
- صراع "عدد الكلمات": حتى أذكى أنظمة الذكاء الاصطناعي تواجه أحياناً صعوبة في إصابة عدد كلمات محدد بالضبط. الأمر يشبه محاولة إصابة هدف في منتصف اللوحة وأنت معصوب العينين.
- فجوة "المحتوى": الذكاء الاصطناعي بارع في أن يبدو مهذباً (الأسلوب) ومنطقياً (المنطق)، ولكنه غالباً ما يخطئ في الحقائق أو التفاصيل الفعلية (المحتوى) عندما تصبح المحادثة طويلة. إنه يشبه قصاصاً رائعاً يستمر في نسيان اسم الشخصية الرئيسية.
الخلاصة
DIALEVAL هو طريقة جديدة لاختبار الذكاء الاصطناعي تعامل التعليمات كقائمة مراجعة لأنواع مختلفة من القواعد. فهو يعرف متى يكون متساهلاً (مع الكلمات) ومتى يكون صارماً (مع الأرقام). إنه يعمل كمعلم خارق لا يتعب أبداً، ولا ينسى القواعد أبداً، ويفهم الفرق بين "السنوريات" و"القطة"، ولكنه يعرف أن "50 كلمة" يجب أن تعني 50 كلمة بالضبط.
يساعد هذا المطورين على بناء برامج دردشة آلية أفضل تستمع إلينا حقاً، وتتبع أوامرنا المعقدة، وتتذكر ما تحدثنا عنه قبل خمس دقائق.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.