← أحدث الأبحاث
💬 NLP

PETra: A Multilingual Corpus of Pragmatic Explicitation in Translation

تقدم هذه الورقة PragExTra، وهي أول متن لغوي وإطار كشف متعدد اللغات للتصريح التداولي في الترجمة، والذي يستفيد من التعلم النشط لتحديد وقياس كيفية إثراء المترجمين للنصوص بتفاصيل الخلفية الثقافية، مما يعزز تطوير الترجمة الآلية الواعية ثقافياً.

المؤلفون الأصليون: Doreen Osmelak, Koel Dutta Chowdhury, Uliana Sentsova, Cristina España-Bonet, Josef van Genabith

نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Doreen Osmelak, Koel Dutta Chowdhury, Uliana Sentsova, Cristina España-Bonet, Josef van Genabith

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تروي قصة لصديق نشأ في بلد مختلف تماماً. تذكر "البيت الأبيض". بالنسبة لك، من الواضح أنك تقصد منزل الرئيس الأمريكي. لكن بالنسبة لصديقك، الذي لم يرَ السياسة الأمريكية قط، قد يبدو الأمر مجرد منزل فاخر. لذا، تقوم تلقائياً بإضافة تفصيل إضافي بسيط: "البيت الأبيض، حيث يعيش الرئيس الأمريكي."

أنت لم تغير القصة؛ بل ملأت الفراغات فقط لكي لا يفقد صديقك تسلسل الأحداث. في عالم الترجمة، يسمى هذا "التوضيح البراغماتي" (Pragmatic Explicitation). وهو عندما يضيف المترجم تفاصيل خلفية، أو شروحات، أو تحويلات للتأكد من أن الجمهور الجديد "فهم الأمر".

لفترة طويلة، كان اللغويون يعرفون أن هذا يحدث، لكن الحواسيب لم تكن تعرف حقاً كيف ترصده أو تقيسه. وهنا يأتي دور هذا البحث.

إليك تفصيل مشروع PETra، مشروحاً ببساًطة:

1. المشكلة: المترجم "الصامت"

الحواسيب بارعة في ترجمة الكلمات، لكنها غالباً ما تغفل عن الثقافة.

  • السيناريو: نص يقول "1 ميل". قد يقوم الحاسوب فقط بترجمة كلمة "ميل" إلى لغة أخرى. لكن إذا كان الجمهور المستهدف يستخدم الكيلومترات، فقد يشعرون بالارتباء. المترجم البشري سيكتب "1 ميل (1.6 كم)".
  • الفجوة: هذه المعلومة الإضافية ضئيلة، لكنها حاسمة. وحتى الآن، لم يكن هناك قاعدة بيانات كبيرة لتعليم الحواسيب كيفية القيام بهذا النوع من "الجسور الثقافية".

2. الحل: بناء "صالة تدريب رياضية" (متن PETra)

قام الباحثون ببناء PETra، وهي بمثابة صالة ألعاب رياضية ضخمة للذكاء الاصطناعي الخاص بالترجمة.

  • التمرين: أخذوا 3000 زوج من الجمل من مصادر واقعية (مثل محاضرات TED وخطابات البرلمان الأوروبي) بـ 12 لغة مختلفة.
  • المراقب: لم يتركوا الحاسوب يخمن فحسب. بل استخدموا نهج "الإنسان في الحلقة" (Human-in-the-Loop). فكر في الأمر كمدرب شخصي؛ يجد الحاسوب "تفصيلاً إضافياً" محتملاً، ثم يتحقق خبير بشري منه: "نعم، هذه إضافة ثقافية مفيدة"، أو "لا، هذا مجرد خطأ مطبعي".
  • النتيجة: مكتبة من الأمثلة توضح بالضبط كيف يضيف البشر السياق الثقافي.

3. كيف وجدوا "الجواهر الخفية"

العثور على هذه التفاصيل الإضافية يشبه العثور على إبرة في كومة قش لأنها نادرة.

  • مطاردة "الأشباح": بحث الحاسوب عن كلمات ظهرت في اللغة الهدف ولكن ليس لها كلمة مطابقة في اللغة المصدر (ما يسمى "المحاذاة الصفرية" أو null alignments).
  • الفلتر (المصفاة): قام بتصفية الضجيج العشوائي والتركيز على أشياء مثل:
    • الأسماء: تحويل "الجدار" إلى "جدار برلين".
    • القياسات: تغيير "100 درجة فهرنهايت" إلى "38 درجة مئوية".
    • الوظائف: تغيير "College" إلى "University" (لأن الأنظمة التعليمية مختلفة).
    • الملاحظات: إضافة ملاحظة مترجم مثل: "هذا تلاعب بالألفاظ".

4. "المعلم الذكي" (التعلم النشط)

هذا هو الجزء الأروع في الورقة البحثية. بدلاً من تسمية 3000 جملة يدوياً (وهو أمر يستغرق وقتاً طويلاً)، استخدموا التعلم النشط (Active Learning).

  • التشبيه: تخيل طالباً يؤدي اختباراً.
    1. الطالب (الذكاء الاصطناعي) يجري اختباراً قصيراً.
    2. المعلم (البشر) يصحح الاختبار.
    3. المعلم لا يكتفي بإعطاء درجة فقط؛ بل يقول: "أنت جيد جداً في الرياضيات، لكنك تخطئ باستمرار في الكسور. دعنا نتدرب على 10 مسائل كسور أخرى".
    4. يدرس الطالب تلك المسائل الصعبة تحديداً ويصبح أفضل.
  • النتيجة: من خلال التركيز فقط على الجمل التي كان الذكاء الاصطناعي غير متأكد منها، حسنوا دقة الذكاء الاصطناعي بنسبة 7-8% بسرعة كبيرة. لقد انتقل من مبتدئ مرتبك إلى مترجم محترف.

5. ماذا اكتشفوا؟

بمجرد تدريب الذكاء الاصطناعي، اختبروه عبر لغات مختلفة ووجدوا بعض الأنماط المثيرة للاهتمام:

  • تبديل "النظام": يميل المترجمون إلى تحويل القياسات والمسميات الحكومية (على سبيل المثال، تغيير "High School" إلى "Gymnasium" في الألمانية).
  • لعبة "الأسماء": غالباً ما يضيفون أوصافاً للأشخاص المشهورين أو الأماكن إذا كان الجمهور المستهدف لن يعرفهم.
  • العائلات اللغوية تفرق:
    • اللغات الجرمانية (مثل الألمانية) تميل إلى أن تكون دقيقة جداً في القياسات والأبعاد.
    • اللغات السامية (مثل العربية) غالباً ما تضيف شروحات وصفية أكثر حول من يكون الشخص أو ماذا يعني المفهوم.

لماذا يهم هذا؟

فكر في الترجمة الآلية كجسر بين جزيرتين. في الوقت الحالي، الجسر متين، لكن أحياناً يتعثر الناس أثناء عبوره لأنهم لا يعرفون العادات المحلية.

PETra هو المخطط لبناء جسر مزود بدرابزين ولوحات إرشادية. إنه يعلم الحواسيب ليس فقط ترجمة الكلمات، بل ترجمة الثقافة. هذه خطوة ضخمة نحو ذكاء اصطناعي لا يتحدث لغتك فحسب، بل يفهم عالمك حقاً.

باختصار: قامت الورقة البحثية ببناء مجموعة بيانات وطريقة تدريب ذكية لتعليم الحواسيب كيف يكونون مترجمين متعاونين يضيفون "الأشياء الصغيرة" التي تجعل القصة مفهومة للجمهور الجديد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →