Building Large-Scale English-Romanian Literary Translation Resources with Open Models
تقدم هذه الورقة إطار عمل "TinyFabulist Translation Framework (TF2)"، وهو مسار موحد يستفيد من البيانات الاصطناعية وعملية ضبط دقيق مكونة من مرحلتين لإنتاج نموذج مفتوح بـ 12 مليار معلمة ومنخفض التكلفة للترجمة الأدبية عالية الجودة من الإنجليزية إلى الرومانية، إلى جانب إصدار مجموعات بيانات وأدوات تقييم واسعة النطاق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً تكون فيه القصص هي عملة الثقافة، لكن بعض اللغات تشبه الجزر التي تربطها روابط قليلة جداً ببقية العالم. هذا هو تحدي الترجمة الآلية، وهو فرع من فروع الذكاء الاصطناعي يحاول تعليم الحواسيب التحدث بلغات مختلفة. عادةً، تتعلم هذه الحواسيب من خلال قراءة ملايين الكتب والمقالات الإخبارية التي كتبها البشر. ولكن بالنسبة للعديد من اللغات، وخاصة تلك التي يتحدث بها عدد أقل من الناس، لا توجد ببساطة كتب كافية لتعليم الكمبيوتر. الأمر يشبه محاولة تعلم طهي الطعام الإيطالي بينما لم ترَ وصفة أو تتذوق حبة طماطم من قبل.
لحل هذه المشكلة، بدأ العلماء في استخدام نماذج اللغات الكبيرة (LLMs). فكر في هذه النماذج كطهاة رقميين فائق الذكاء، تذوقوا تقريباً كل الأطباء في العالم ويمكنهم تخمين كيف يجب أن يكون طعم الوصفة الجديدة. ومع ذلك، فإن تعليم هؤلاء الطهاة كيفية طهي "الأدب" — القصص التي تحمل مشاعر، ونكات، وأسراراً ثقافية — أصعب بكثير من ترجمة تقرير إخباري. والقيام بذلك للغة مثل الرومانية، التي تمتلك موارد رقمية أقل من الإنجليزية، يشبه محاولة خبز كعكة مثالية في مطبخ بمكونات محدودة جداً وميزانية ضيقة. السؤال الكبير الذي يطرحه الباحثون هو: هل يمكننا بناء مكتبة عالية الجودة من القصص المترجمة دون إنفاق ثروة أو الحاجة إلى حاسوب خارق؟
قصة الحكواتي الصغير
في هذه الورقة البحثية، قدم فريق من الباحثين من رومانيا مشروعاً جديداً يسمى إطار عمل ترجمة الحكواتي الصغير (TF2 - TinyFabulist Translation Framework). كان هدفهم هو إنشاء مكتبة ضخمة من الخرافات المترجمة — وهي قصص قصيرة ذات مغزى أخلاقي مثل خرافات إيسوب — من الإنجليزية إلى الرومانية. أرادوا معرفة ما إذا كان بإمكانهم القيام بذلك باستخدام نماذج "مفتوحة" (أدوات ذكاء اصطناعي مجانية وعامة) بدلاً من الأدوات الخاصة والمكلفة، وما إذا كان بإمكانهم فعل ذلك بميزانية محدودة للغاية.
الوصفة: بناء مكتبة من الصفر
أدرك الباحثون أنه لا يمكنهم ببساء طلب ترجمة ملايين القصص من البشر؛ لأن ذلك سيستغرق وقتاً طويلاً وسيكلف الكثير. بدلاً من ذلك، بنوا خط تجميع مكون من أربع خطوات لإنشاء البيانات بأنفسهم:
- اختبار المذاق (المرحلة 1): أولاً، اختبروا 13 نموذجاً مختلفاً للذكاء الاصطناعي (بعضها مجاني وبعضها مدفوع) لمعرفة أي منها كان الأفضل في ترجمة عينات من الخرافات. لم يكتفوا بالنظر في مدى تطابق الكلمات فحسب؛ بل طلبوا من الذكاء الاصطناعي تقييم الترجمات بناءً على خمسة أشياء: الدقة، الانسيابية، منطق القصة، الأسلوب، والملاءمة الثقافية. وكان الفائز نموذجاً قوياً يسمى GPT-o3، والذي أصبح "المعيار الذهبي" لهم لإنشاء بقية المكتبة.
- المعيار الفضي (المرحلة 2): باستخدام هذا النموذج الفائز، قاموا بترجمة 15,000 خرافة إنجليزية إلى الرومانية. وعلى الرغم من أن هذه الخرافات صُنعت بواسطة روبوت، إلا أنها كانت جيدة جداً لدرجة أن الباحثين تعاملوا معها كـ "معيار فضي" (شبه ذهبي) لتدريب نماذجهم الخاصة.
- التدريب المتخصص (المرحلة 3): هذا هو الجزء السحري. لقد أخذوا نماذج ذكاء اصطناعي مفتوحة المصدر (تحديداً نسخ من نموذج Gemma، تتراوح من نماذج صغيرة بسعة 1 مليار معلمة وصولاً إلى نموذج بسعة 12 مليار معلمة) ومنحوها "مدرسة نهائية" متخصصة. استخدموا تقنية تسمى LoRA (التكيف منخفض الرتبة)، وهي تشبه إعطاء طاهٍ عام متخصص كتاب طبخ خاص بالخرافات دون الحاجة إلى إعادة بناء المطبخ بالكامل. قاموا بتدريب هذه النماذج على الـ 15,000 قصة مترجمة.
- الإنتاج الضخم (المرحلة 4): أخيراً، استخدموا نماذجهم المتخصصة والمدربة حديثاً لترجمة الـ 3 ملايين خرافة المتبقية من المجموعة الأصلية الإنجليزية. والنتيجة هي مجموعة بيانات جديدة ضخمة تسمى DS-TF2-EN-RO-3M، تحتوي على ثلاثة ملايين زوج من الإنجليزية والرومانية للخرافات.
النتائج: نماذج صغيرة، مفاجآت كبيرة
قام الباحثون بعد ذلك باختبار نماذجهم الجديدة المدربة مقابل النماذج الخاصة الكبيرة والمكلفة (مثل GPT-4 وDeepL) والنماذج المفتوحة الأصلية غير المدربة.
- تقلصت الفجوة: أدى أفضل نموذج مفتوح لديهم، TF2-12B (نسخة الـ 12 مليار معلمة)، أداءً مذهلاً. فقد سجل متوسط 4.83 من 5 في معيار الجودة الخاص بهم، بينما سجل النموذج الخاص الأعلى (GPT-o3) 4.92. كانت الفجوة بين النموذج المجاني المخصص والعملاق الخاص باهظ الثمن ضئيلة جداً — أقل من 0.1 نقطة.
- فرق التكلفة: هنا تصبح القصة مثيرة حقاً. ترجمة جميع الخرافات الثلاثة ملايين باستخدام واجهات برمجة التطبيقات (APIs) الخاصة والمكلفة كان سيكلف ما بين 1,800 و32,400 دولار أمريكي (اعتماداً على النموذج الذي ستختاره). في المقابل، قام نموذجهم المفتوح المصدر TF2 بنفس المهمة بتكلفة تقارب 350 دولاراً. هذا يعني توفيراً بنسبة 97% إلى 99%.
- النماذج الصغيرة: حتى أصغر نموذج لديهم (1 مليار معلمة)، وبعد التدريب، قفز من 2.02 إلى 3.75. لم يكن مثالياً، لكنه انتقل من مرحلة "بالكاد يمكن فهمه" إلى "جيد جداً"، مما يثبت أن حتى الحواسيب الصغيرة والرخيصة يمكنها تعلم سرد القصص إذا تم تعليمها بالطريقة الصحيحة.
ما وجدوه (وما لم يجدوه)
تشير الورقة البحثية إلى أنك لست بحاجة لتكون مليارديراً لبناء أدوات ترجمة أدبية عالية الجودة. فمن خلال استخدام عملية ذكية وخطوة بخطوة والتركيز على نوع معين من القصص (الخرافات)، أظهروا أن النماذج المفتوحة يمكنها منافسة العمالقة.
ومع ذلك، يلاحظ المؤلفون بوضوح بعض النقاط:
- ليست مثالية بعد: بينما تقترب النماذج المفتوحة من المستوى المطلوب، فإن النماذج الخاصة (مثل GPT-o3) لا تزال تسجل درجات أعلى قليلاً، خاصة في الأسلوب واللمسات الثقافية. النماذج المفتوحة هي بديل رائع، لكنها لم "تحل" المشكلة تماماً فيما يتعلق بمطابقة جودة الترجمة البشرية في كل حالة.
- "المعيار الذهبي" هو في الواقع فضي: الترجمات المرجعية التي استخدموها لتدريب النماذج صُنعت بواسطة ذكاء اصطناعي آخر، وليس بواسطة بشر. وهذا يعني أن النماذج تتعلم كيف تبدو مثل الذكاء الاصطناعي الآخر، وليس بالضرورة مثل المترجمين البشر. وقد تحقق الباحثون من ذلك من خلال جعل خبير بشري يراجع عينة صغيرة من القصص، واتفق الإنسان مع تصنيفات الذكاء الاصطناعي بشكل عام، لكنهم أقروا بأن هناك حاجة لدراسة بشرية أكبر للتأكد بنسبة 100%.
- الخرافات حالة خاصة: الخرافات قصيرة ولها هيكل واضح. ويقترح الباحثون أنه بينما تنجح هذه الطريقة بشكل رائع مع الخرافات، فقد يكون من الصعب تطبيقها على الروايات المعقدة التي تحتوي على استعارات عميقة أو حوارات تاريخية.
الخلاصة
مشروع TF2 يشبه إظهار أنه يمكنك بناء مكتبة رائعة باستخدام مواد معاد تدويرها وقليل من البراعة، بدلاً من الحاجة إلى خزنة من الذهب. لقد أثبتوا أنه مع بيانات التدريب الصحيحة والنهج الذكي وفعال التكلفة، يمكن للذكاء الاصطناعي مفتوح المصدر ترجمة المحتوى الأدبي للغات مثل الرومانية بجزء ضئيل من التكلفة المعتادة. لقد أطلقوا جميع أكوادهم، ومجموعة بياناتهم المكونة من 3 ملايين قصة، ونماذجهم المدربة للجمهور، داعين الجميع للبناء على عملهم. إنها خطوة نحو مستقبل يمكن فيه للذكاء الاصطناعي المساعدة في حفظ ومشاركة القصص من كل ثقافة، بغض النظر عن مقدار المال الذي تملكه تلك الثقافة للإنفاق على التكنولوجيا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.