From Raw Corpora to Domain Benchmarks: Automated Evaluation of LLM Domain Expertise
تقدم هذه الورقة مساراً آلياً حتمياً يحول مجموعات البيانات الخام الخاصة بمجالات معينة إلى اختبارات مرجعية قائمة على أسلوب الإكمال، وذلك لتوفير تقييمات قابلة للتوسع وغير منحازة ومستقلة عن النماذج اللغوية الكبيرة لقياس الخبرة في مجالات محددة في كل من النماذج الأساسية والمصقولة بالتعليمات، مما يعالج بفعالية مشكلات تلوث الاختبارات المرجعية وانحياز الاختيار من متعدد.
المؤلفون الأصليون:Nitin Sharma, Thomas Wolfers, Çağatay Yıldız
المشكلة الكبرى: كيف نعرف حقاً ما الذي "يعرفه" الذكاء الاصطناعي؟
تخيل أن لديك مكتبة من الكتب حول فيزياء الكم. تريد أن تعرف أي من طلابك (أو نماذج الذكاء الاصطناعي) يستوعب المادة فعلياً، ومن منهم قام فقط بحفظ الإجابات لاختبار محدد.
حالياً، طريقة اختبار الذكاء الاصطناعي تشبه إعطاءهم اختبار خيارات متعددة (مثل معيار MMLU). تجادل الورقة البحثية بأن هذه طريقة سيئة جداً لاختبار الخبرة الحقيقية لثلاثة أسباب:
ثغرة "الترتيب يهم": إذا قمت بتغيير ترتيب الإجابات (أ، ب، ج، د)، تتغير درجة الذكاء الاصطناعي بشكل هائل. الأمر يشبه طالباً يعرف فقط كيف يختار الإجابة "ج" لأنها دائماً في المنتصف، وليس لأنه يعرف الإجابة الصحيحة.
مشكلة "الغش": العديد من هذه الاختبارات موجودة بالفعل في بيانات تدريب الذكاء الاصطناعي. الأمر يشبه إعطاء طالب امتحاناً نهائياً قد رأى إجاباته مسبقاً على الإنترنت؛ هو هنا لا يظهر معرفة، بل يظهر ذاكرة.
فخ "العامّي": الاختبارات القياسية تطرح أسئلة عامة. هي لا تخبرك ما إذا كان الذكاء الاصطناعي عبقرياً في علم الأعصاب ولكنه سيء جداً في طب القلب.
الحل: مصنع "إكمال الفراغات" المخصص
قام المؤلفون ببناء مسار حتمي (آلة تعمل بخطوات محددة) يحول النصوص الخام والمبعثرة من مجال معين (مثل المجلات الطبية أو أوراق الفيزياء) إلى اختبار مخصص.
فكر في الأمر كالتالي:
الطريقة القديمة: تشتري لعبة أسئلة عامة جاهزة وتأمل أن تغطي الموضوع المحدد الذي يهمك.
الطريقة الجديدة: تأخذ كومة من الكتب المدرسية الخام، وتغذي بها آلة، وهي تقوم تلقائياً بإنشاء اختبار "إكمال فراغات" فريد يعتمد فقط على الكلمات والمفاهيم الموجودة في تلك الكتب.
كيف تعمل الآلة (وصفة من 4 خطوات)
التنقيب عن الذهب (استخراج الكلمات المفتاحية): يقرأ النظام آلاف الأوراق ويستخرج أهم "الكلمات الرنانة" (مثل "التعلم التعزيزي"، "الشجرة التطورية"). ويقوم بتصفية الكلمات المملة مثل "الـ" أو "دراسة".
إيجاد السياق (مطابقة الجمل): لكل كلمة رنانة، يجد النظام الجمل الموجودة في النص والتي تتحدث عن تلك الكلمة.
بناء اللغز (أزواج المحفز والهدف): يأخذ جملة ويقطعها قبل المصطلح الرئيسي مباشرة.
المحفز (Prompt): "تضمنت المحاولات السابقة لتحسين كفاءة البيانات في التعلم التعزيزي استخدام الـ..."
الهدف (Target): "...إعادة التشغيل (Replay)."
على الذكاء الاصطناعي تخمين الكلمة المفقودة.
بطاقة الدرجات (الترتيب): بدلاً من السؤال "هل أصاب أم أخطأ؟"، يسأل النظام: "ما هو ترتيب الكلمة الصحيحة في قائمة تخمينات الذكاء الاصطناعي؟"
إذا وضع الذكاء الاصطناعي الكلمة الصحيحة كخيار رقم 1، فهذه درجة مثالية.
إذا وضعها في المركز 500، فهو يعاني.
لماذا هذا مهم: هذا يقيس الثقة والمعرفة دون الحاجة لأن يكون الذكاء الاصطناعي بارعاً في المحادثة المثالية.
لماذا يعد هذا تغييراً جذرياً
تثبت الورقة البحثية صحة هذه الطريقة من خلال تجارب رائعة:
"فحص الخبير": قارنوا اختبارهم المُنشأ آلياً باختبار كتبه خبراء بشريون من كتاب مدرسي مشهور. تطابقت النتائج بشكل شبه مثالي (ارتباط بنسبة 99%). وهذا يثبت أن آلتهم بارعة بقدر الخبير البشري في بناء الاختبار.
"تتبع التعلم": راقبوا ذكاءً اصطناعياً وهو يتعلم أثناء تدريبه.
المقياس القديم (الارتباك/Perplexity): يشبه فحص خط يد الطالب؛ يصبح الخط أكثر ترتيباً بمرور الوقت، لكنه لا يخبرك ما إذا كان قد تعلم الرياضيات فعلياً.
المقياس الجديد (ترتيبهم الخاص): يشبه مراقبة الطالب وهو يحل المسائل؛ يمكنك أن ترى بالضبط متى بدأ يفهم موضوعاً معيناً.
"مفاجأة الشات بوت": اختبروا النماذج "الأساسية" (Base Models - خام، ذكي لكنه فظ) مقابل نماذج "الدردشة" (Chat Models - مهذب، متعاون، ومتوافق مع القواعد البشرية).
الصدمة: غالباً ما كانت نماذج "الدردشة" تؤدي بشكل أسوأ في المعرفة المتخصصة مقارنة بالنماذج "الأساسية".
التشبيه: الأمر يشبه توظيف بروفيسور عبقري وعابس (النموذج الأساسي) ثم تعيين فريق علاقات عامة لجعله مهذباً وودوداً (نموذج الدردشة). في هذه العملية، جعل فريق العلاقات العامة البروفيسور ينسى بعض تفاصيله التقنية العميقة دون قصد ليبدو أكثر "أماناً" و"عمومية". يطلق المؤلفون على هذا اسم "ضريبة التوافق" (Alignment Tax).
الخلاصة
تقدم هذه الورقة البحثية طريقة قابلة للتوسع، ومحصنة ضد الغش، وغير منحازة لاختبار ما إذا كان الذكاء الاصطناعي خبيراً حقاً في مجال معين (مثل القانون، الطب، أو الفيزياء).
بدلاً من الاعتماد على أسئلة الخيارات المتعددة التي يمكن التلاعب بها أو تلويثها، قاموا ببناء آلة تحول بيانات المجال الخام إلى امتحان "إكمال الفراغات". وهذا يسمح للباحثين برؤية مقدار ما يعرفه الذكاء الاصطنا actually، وكيف يتعلم، وما إذا كان جعل النموذج "أكثر أماناً" (عبر ضبط التعليمات) يجعله "أقل ذكاءً" في وظيفته الفعلية عن غير قصد.
إليك ملخص تقني مفصل للورقة البحثية بعنوان "من المجموعات النصية الخام إلى معايير التقييم المتخصصة: التقييم الآلي لخبرة النماذج اللغوية الكبيرة في المجالات المتخصصة."
1. بيان المشكلة
أدى الانتشار السريع للنماذج اللغوية الكبيرة (LLMs) إلى ظهور حاجة ماسة لتقييم الخبرة في مجالات محددة بدقة (مثل الرعاية الصحية، أو القانون، أو مجالات علمية معينة). ومع ذلك، تعاني طرق التقييم الحالية من قيود حرجة:
الارتباك (Perplexity): يجمع جودة التنبؤ عبر جميع الرموز (tokens)، مما يجعله عاجزاً عن التمييز بين الطلاقة اللغوية العامة والمعرفة الحقيقية بالمجال.
الأسئلة متعددة الخيارات (MCQs): تعاني معايير التقييم مثل MMLU من الانحيازات (مثل ترتيب الإجابات، وتنسيق المطالبات/Prompts)، وغالباً ما تعتمد على بيانات قد تكون ملوثة في مجموعات التدريب، كما أنها تضع النماذج الأساسية (base models) التي تفتقر إلى قدرات اتباع التعليمات في موقف غير عادل.
معايير التقييم الثابتة: غالباً ما يتم تنسيق معايير التقييم الخاصة بالمجالات المتخصصة يدوياً، وهي مكلفة في التحديث، وعرضة للتلوث مع تدريب النماذج على مجموعات بيانات عامة تحتوي على أسئلة المعايير.
نقص التفصيل (Granularity): تغطي معايير التقييم الحالية غالباً فئات واسعة بدلاً من المجالات الفرعية الدقيقة.
يقترح المؤلفون الحاجة إلى إطار عمل قابل للتوسع، ومقاوم للتلوث، وآلي لتوليد معايير تقييم خاصة بالمجالات من مجموعات النصوص الخام دون الاعتماد على التوسيم البشري أو نماذج لغوية كبيرة أخرى.
2. المنهجية
يقدم المؤلفون مسار عمل حتمي (deterministic pipeline) يحول مجموعات النصوص الخام للمجالات (مثل الأوراق الأكاديمية) إلى معايير تقييم بنمط الإكمال (completion-style). تتكون العملية من ست مراحل:
تنسيق البيانات (Data Curation):
المدخلات: نص المجال الخام (مثل أوراق arXiv الكاملة) والبيانات الوصفية (Abstracts).
المصدر: تم تطبيق مسار العمل باستخدام مجموعة بيانات RedPajama-Data-1T (1.56 مليون ورقة من arXiv) وربطها ببيانات Kaggle الوصفية.
المجالات المستهدفة: CS.AI، الفيزياء (Soc-Ph)، البيولوجيا الكمية (Q-Bio.PE)، والاقتصاد العام (Econ-GN).
توليد الكلمات المفتاحية:
المعالجة المسبقة: يتم توحيد الملخصات (تحويل الأحرف لصغيرة، إزالة الأقواس، معالجة الاختصارات).
استخراج الـ N-gram: يقوم نموذج Phrases من مكتبة Gensim بتوليد n-grams مكونة من 2 إلى 7 رموز.
التصفية: تُزال الكلمات الشائعة (stopwords)، والمصطلحات الأكاديمية العامة، والتعبيرات الكمية.
الاختيار: تستهدف التصفية القائمة على الطول التكيفي حوالي 300 كلمة مفتاحية عالية الجودة لكل مجال.
إزالة التكرار: تُستخدم التشابه الدلالي (cosine similarity > 0.85 باستخدام all-MiniLM-L6-v2) لدمج الكلمات المفتاحية المكررة.
المطابقة بين الكلمات المفتاحية والجمل:
يتم تضمين (embedding) الجمل من الأوراق الكاملة ومطابقتها مع الكلمات المفتاحية باستخدام تشابه جيب التمام (عتبة 0.5).
يتم تنظيف الجمل (إزالة LaTeX، وإزالة الاستشهادات) لضمان سياق عالي الجودة.
بناء المفردات المستهدفة:
يتم إنشاء نسختين لالتقاط مستويات مختلفة من التحديد:
تردد المصطلح (TF): يلتقط المصطلحات ذات الصلة على نطاق واسع.
تردد المصطلح - لوغاريتم عكسي (TF-IDF): يبرز المصطلحات الأكثر ندرة وتخصصاً من خلال خفض وزن المصطلحات الشائعة عبر جميع مجموعات الكلمات المفتاحية.
بناء أزواج (المطالبة-الهدف):
لكل كلمة مفتاحية، يتم اختيار الجمل التي تحتوي على المفردات المستهدفة.
المطالبة (Prompt): الجملة حتى (ولكن ليس بما في ذلك) المصطلح المستهدف.
الهدف (Target): المصطلح الخاص بالمجال الذي يلي المطالبة.
القيود: يجب أن تكون المطالبات > 10 رموز؛ ويجب أن تظهر الأهداف بعد الرمز العاشر.
المخرج: مئات من أزواج (المطالبة-الهدف) لكل كلمة مفتاحية.
تقييم النموذج:
المقياس:رتبة التنبؤ (Prediction Rank) (رتبة رمز الهدف الصحيح في توزيع مخرجات النموذج).
السبب المنطقي: تُفضل الرتبة على الاحتمالية لأن احتمالات النماذج اللغوية الكبيرة غالباً ما تكون غير معايرة بشكل جيد، خاصة بعد الضبط الدقيق للتعليمات (RLHF). الرتبة تعزل ما يعرفه النموذج عن مدى ثقته في التعبير عنه.
التجميع: يُستخدم المتوسط المقطوع بنسبة 20% (20% trimmed mean) للرتب لتقليل تأثير القيم المتطرفة.
3. المساهمات الرئيسية
توليد معايير التقييم آلياً: مسار عمل حتمي بالكامل يولد معايير التقييم من أي مجموعة نصوص خام دون تدخل بشري أو الاعتماد على نماذج لغوية أخرى.
مقاومة التلوث: يمكن إعادة توليد معايير التقييم عند الطلب من مجموعات نصية جديدة أو محجوزة، مما يلغي خطر تلوث بيانات التدريب بالتصميم.
إطار تقييم موحد: يسمح تنسيق نمط الإكمال بمقارنة عادلة بين النماذج الأساسية (base models) والنماذج المضبوطة للتعليمات (chat models)، مما يتجنب انحيازات التنسيق المتأصلة في الأسئلة متعددة الخيارات.
التفصيل (Granularity): يتيح التقييم عند مستويات مختلفة من التفصيل، بدءاً من التخصصات الواسعة وصولاً إلى مجالات بحثية فرعية محددة.
4. النتائج والتحقق
قام المؤلفون بالتحقق من صحة مسار العمل من خلال تجارب مكثفة:
التحقق مقابل معايير الخبراء:
تمت مقارنة مسار العمل بمعيار خبير تم تنسيقه يدوياً من كتاب Understanding Deep Learning.
الارتباط: أظهر مسار العمل الآلي ارتباطاً شبه مثالي مع معيار الخبير (r=0.99, p<0.001).
وكيل Claude: أظهر معيار التقييم الذي تم توليده بواسطة Claude Sonnet 4 أيضاً ارتباطاً قوياً مع معيار الخبير (r=0.91)، مما يؤكد صلاحية استخدام النماذج اللغوية الكبيرة عالية الجودة كوكيل قابل للتوسع للتنسيق البشري.
تجارب التكيف مع المجال:
حققت النماذج التي تكيفت مع مجالات قريبة دلالياً من الهدف (مثل CS.CL لـ CS.AI) رتب تنبؤ أفضل بكثير من تلك التي تكيفت مع مجالات غير مرتبطة.
المقارنة مع الخط المرجعي: أظهر مقياس الرتب المقترح ارتباطاً قوياً مع معيار الخبير، بينما أظهر الارتباك (Perplexity) ومعدل نسبة الطبقة الأخيرة (Last-Layer Attribution Rate) ارتباطاً ضعيفاً أو معدوماً، وفشلا في التقاط اكتساب المعرفة الحقيقية بالمجال.
ديناميكيات ما قبل التدريب:
نجح معيار التقييم في تتبع اكتساب المعرفة أثناء التدريب المسبق العام (OLMo-2) والتدريب المسبق المستمر (Llama2-7B).
على عكس الأسئلة متعددة الخيارات، التي غالباً ما تصل إلى مرحلة التشبع مبكراً في التدريب، كشف مقياس الرتب عن تحسينات دقيقة ومستمرة في معرفة المجال طوال عملية التدريب.
النماذج الأساسية مقابل نماذج الدردشة (ضريبة المحاذاة - Alignment Tax):
كشف تقييم ست عائلات من النماذج عبر أربعة مجالات أن ضبط التعليمات يقلل عموماً من المعرفة الخاصة بالمجال مقارنة بالنماذج الأساسية.
كانت هذه "الضريبة" متباينة للغاية؛ فعلى سبيل المثال، أظهرت نماذج Llama2-7B وMistral-7B انخفاضاً كبيراً في الأداء، بينما أظهرت نماذج أخرى (مثل Qwen2-1.5B) تدهوراً طفيفاً أو حتى تحسناً.
5. الأهمية
يوفر هذا العمل بديلاً منهجياً لتقييم النماذج اللغية الكبيرة في المجالات المتخصصة. ومن خلال الانتقال من الأسئلة متعددة الخيارات الثابتة والمنحازة إلى معايير تقييم ديناميكية قائمة على الإكمال ومستمدة مباشرة من مجموعات نصوص المجال، يقدم المؤلفون أداة:
تقضي على التلوث: تضمن أن التقييمات تعتمد على بيانات لم يسبق للنموذج رؤيتها.
تقلل الانحياز: تزيل انحيازات التنسيق والترتيب المرتبطة بالأسئلة متعددة الخيارات.
تسمح بالتوسع: تتيح للباحثين توليد معايير تقييم فورية للمجالات الناشئة أو المجالات الفرعية المحددة.
توفر رؤى أعمق: تكشف أن ضبط التعليمات قد يأتي على حساب الخبرة الخام بالمجال، وهي رؤية بالغة الأهمية للممارسين الذين يختارون النماذج للمهام المتخصصة.
يعد هذا الإطار ذا قيمة خاصة للمجالات عالية المخاطر (الطب، القانون، التمويل) حيث يكون التقييم الدقيق والمحدث والخالي من التلوث لقدرات النماذج أمراً ضرورياً.