Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study
تُقارن هذه الدراسة بين سبعة من النماذج التأسيسية في النصوص القانونية الأوكرانية، كاشفةً أن كفاءة أداة التجزئة (tokenizer) تؤثر بشكل كبير على تكاليف واجهة برمجة التطبيقات (API)، وأن نموذج NVIDIA Nemotron Super 3 بـ 120 مليار معلمة يتفوق على نموذج Mistral Large 3 الأكبر حجماً بجزء بسيط من التكلفة، وأن التلقين بصفر محاولة (zero-shot prompting) يتفوق على التلقين ببضع محاولات (few-shot prompting) لهذه اللغة الغنية صرفياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدير مكتبة ضخمة من القرارات القضائية الأوكرانية. تريد توظيف فريق من أمناء المكتبة الأذكياء للغاية (النماذج التأسيسية - Foundation Models) لقراءة هذه الوثائق، وتصنيفها إلى فئات، وتحديد من ربح القضية، واستخراج القوانين المحددة المذكورة.
هذه الورقة البحثية تشبه "تقرير درجات" يقارن بين سبعة من أمناء المكتبة من الذكاء الاصطناعي لمعرفة أيهم يعمل بشكل أفضل، وأيهم يكلف أقل، وأيهم يرتكب أقل عدد من الأخطاء عند التعامل مع اللغة الأوكرانية.
إليك تفاصيل نتائجهم، باستخدام تشبيهات بسيطة:
1. ضريبة "الكلمة إلى الرمز" (خصوبة الـ Tokenizer)
فكر في نموذج الذكاء الاصطناعي كأنه مترجم لا يقرأ كلمات كاملة، بل يفكك كل كلمة إلى قطع أحجية صغيرة تسمى "رموز" (Tokens).
- المشكلة: بعض نماذج الذكاء الاصطناعي سيئة جداً في هذا الأمر؛ فهي تقطع الكلمات الأوكرانية إلى قطع صغيرة كثيرة جداً. تطلق الورقة على هذا "الخصوبة" (عدد القطع التي تنتجها الكلمة الواحدة).
- النتيجة: إحدى عائلات الذكاء الاصطناعي (Llama) فعالة جداً، حيث تفكك الكلمة إلى حوالي 2.4 قطعة. بينما عائلة أخرى (Qwen) مسرفة، حيث تفكك نفس الكلمة إلى 3.9 قطعة.
- التشبيه: تخيل أنك تدفع أجرة سيارة أجرة بناءً على عدد الخطوات التي تخطوها. الذكاء الاصطناعي "المسرف" يتخذ خطوات أكثر بنسبة 60% للوصافة إلى نفس الوجهة. هذا يعني أنك ستدفع مالاً أكثر بنسبة 60% لمجرد قراءة نفس الوثيقة.
- الخلاصة: قبل اختيار نموذج ذكاء اصطناعي، تحقق من عدد "الخطوات" (الرموز) التي يستغرقها لقراءة اللغة الأوكرانية. هذا يؤثر مباشرة على محفظتك.
2. الحجم الأكبر ليس دائماً الأفضل
في عالم الذكاء الاصطناعي، يفترض الناس غالباً أن النموذج الذي يمتلك أكبر قدر من "القوة الذهنية" (المعلمات - Parameters) هو الأذكى.
- النتيجة: اختبرت الورقة نموذجاً ضخماً (Mistral Large 3) بـ 675 مليار معلمة مقابل نموذج أصغر (NVIDIA Nemotron Super 3) بـ 120 مليار معلمة فقط.
- النتيجة: النموذج الأصغر (Nemotron) فاز بالفعل. لقد حصل على درجات أعلى في المهام الثلاث، وكان تكلفته أقل بمقدار الثلث لتشغيله.
- التشبيه: الأمر يشبه استئجار طاقم بناء مكون من 675 شخصاً لبناء كوخ صغير، بينما يمكن لفريق متميز مكون من 12 شخصاً فقط، يمتلك أدوات أفضل، أن ينجز المهمة بشكل أسرع، وأرخص، وبجودة أعلى. حجم الفريق لم يكن هو المهم؛ بل التدريب والأدوات هما الأهم.
3. فخ "الأمثلة" (التعلم بالقليل من الأمثلة مقابل التعلم بدون أمثلة)
عادةً، عندما تعلم بشراً مهمة جديدة، تعطيه بضعة أمثلة أولاً. في الذكاء الاصطناعي، يسمى هذا "التحفيز بالقليل من الأمثلة" (Few-shot prompting).
- النتي النتيجة: بالنسبة للنصوص القانونية الأوكرانية، غالباً ما جعل إعطاء الأمثلة للذكاء الاصطناعي يجعله أغبى. في بعض الحالات، انخفض الأداء بنسبة 26 نقطة مئوية!
- التشبيه: تخيل أنك تعلم طباخاً كيفية طهي طبق أوكراني معين. إذا عرضت عليه صورة لنسخة مختلفة قليلاً من الطبق، فقد يرتبك وينسى الوصفة الأصلية. لقد "تثبت" الذكاء الاصطناعي بالنماذج المقدمة (Anchored) وتوقف عن استخدام معرفته الخاصة باللغة.
- التحول: اختبرت الورقة ما إذا كان هذا بسبب عدم توازن الأمثلة (وجود الكثير من نوع واحد) أو سوء كتابة "المطالبة" (Prompt). لم يكن الأمر كذلك. حتى عندما قاموا بإصلاح الأمثلة والمطالبات، ظل الذكاء الاصطناعي يسوء في الأداء.
- الاستنتاج: بالنسبة للغة الأوكرانية، من الأفضل غالباً أن تقول ببساطة: "إليك الوثيقة، أخبرني بالنتيجة"، دون تقديم أمثلة أولاً.
4. الاستراتيجية المثلى: "الفريق المتخصص"
بما أنه لا يوجد نموذج ذكاء اصطناعي واحد مثالي لكل شيء، اقترح المؤلفون نظام "توجيه" (Routing)، مثل ممرض الفرز في المستشفى.
- المهمة 1 (تصنيف القضايا): استخدم أرخص وأسرع ذكاء اصطناعي (Llama 4 Maverick). إنه رائع في التصنيف البسيط ويكلف شيئاً لا يذكر.
- المهمة 2 (تحديد الفائزين): استخدم أذكى ذكاء اصطناعي (NVIDIA Nemotron). هذا هو الجزء الصعب، لذا ستدفع أكثر قليلاً مقابل أفضل عقل.
- المهمة 3 (إيجاد القوانين): استخدم ذكاءً اصطناعياً آخر (Llama 3.3) بارع حقاً في رصد أنماط محددة في النصوص.
- النتيجة: من خلال المزج والتبديل بين النماذج، حصلوا على أعلى جودة للنتائج بتكلفة أقل بنسبة 37% من استخدام "أفضل" نموذج واحد لكل المهام.
5. الخلاصة للممارسين
إذا كنت تبني أداة تقنية قانونية لأوكرانيا:
- تحقق من "عدد الخطوات" أولاً: لا تنظر فقط إلى حجم النموذج؛ تحقق من مدى كفاءته في قراءة الكلمات الأوكرانية.
- لا تثق في أسطورة "الأكبر هو الأفضل": يمكن لنموذج أصغر ومدرب جيداً أن يهزم نموذجاً عملاقاً.
- تخطَّ مرحلة الأمثلة: بالنسبة للنصوص القانونية الأوكرانية، فإن طلب العمل بدون أمثلة (Zero-Shot) هو الأكثر موثوقية من إعطاء أمثلة.
- امزج فريقك: استخدم نماذج ذكاء اصطناعي مختلفة لمهام مختلفة لتوفير المال والحصول على نتائج أفضل.
التكلفة: الدراسة بأكملها، التي اختبرت سبعة نماذج على مئات الوثائق، كلفت الباحثين حوالي 60 دولاراً فقط في رسوم واجهة برمجة التطبيقات (API). وهذا يثبت أنك لا تحتاج إلى ميزانية ضخمة لإجراء اختبارات جادة وعالية الجودة على نماذج اللغة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.