Instruction-Guided Poetry Generation in Arabic and Its Dialects
تقدم هذه الورقة مجموعة بيانات ضخمة قائمة على التعليمات باللغة العربية الفصحى ولهجاتها، تُمكّن النماذج اللغوية الكبيرة من توليد الشعر ومراجعته وتحليله بشكل قابل للتحكم وفقاً لمتطلبات مستخدم محددة مثل الأسلوب والقافية.
تخيل الشعر العربي كمكتبة عظيمة وقديمة مليئة بالملايين من الكتب الجميلة. لقرون مضت، كتب الناس قصائد في هذه المكتبة باستخدام قواعد صارمة حول الإيقاع والقافية والأسلوب، تماماً مثل بناء منزل باستخدام مخططات هندسية محددة. ومع ذلك، وحتى الآن، كانت الحواسيب (وتحديداً النماذج اللغوية الكبيرة أو LLMs) تشبه أمناء المكتبة الذين يمكنهم فقط قراءة الكتب، أو عد الصفحات، أو تخمين من كتبها. لم تكن جيدة جداً في كتابة قصائد جديدة بنفسها، خاصة عندما يُطلب منها اتباع قواعد معينة أو الكتابة بلهجات إقليمية مختلفة.
تقدم هذه الورقة مشروعاً جديداً يسمى InstructPoet، والذي يعلم الحواسيب كيف تصبح هي نفسها شعراء. إليكم كيف فعلوا ذلك، مشروحاً ببساًطة:
١. كتاب الوصفات (مجموعة البيانات)
لتعليم الكمبيوتر كيف يطبخ، تحتاج إلى كتاب وصفات جيد. جمع الباحثون مجموعة ضخمة من القصائد العربية من الإنترنت، تغطي كل شيء من العصور القديمة حتى العصر الحديث.
التنظيف: قاموا بتنظيم هذه المجموعة الفوضوية من القصائد في تنسيق موحد ومرتب، مثل فرز صندوق مبعثر من قطع "الليغو" في حاويات مصنفة.
التصنيف: أضافوا "البيانات الوصفية" (العلامات) لكل قصيدة، حيث تم وسمها بتفاصيل مثل "رومانسي"، "حرب"، "العصر العباسي"، أو "لهجة خليجية".
الترجمة: لم يكتفوا باللغة العربية الفصحى فقط؛ بل أنشأوا تعليمات بخمس "نكهات" مختلفة: العربية الفصحى بالإضافة إلى أربع لهجات رئيسية (الخليجية، الشامية، المصرية، والمغاربية). هذا يشبه تعليم الكمبيوتر التحدث ليس فقط بالإنجليزية الرسمية، بل أيضاً بلكنات تكساس، واسكتلندا، وأستراليا، لكي يتمكن من التحدث مع الجميع بشكل طبيعي.
٢. ألعاب التدريب الأربع (المهام)
بدلاً من مجرد طلب "اكتب قصيدة" من الكمبيوتر، وضعوا أربع ألعاب تدريبية محددة لجعل الكمبيوتر أكثر ذكاءً:
التوليد (الصفحة البيضاء): "اكتب قصيدة رومانسية عن البحر باستخدام إيقاع محدد". يجب على الكمبيوتر ابتكار شيء من الصفر.
الإكمال (التعليق المشوق): "إليك الأسطر الثلاثة الأولى من قصيدة؛ يرجى إكمال البقية". يجب على الكمبيوتر الحفاظ على القصة والإيقاع دون كسر التدفق.
المراجعة (المحرر): "إليك قصيدة بها بعض الأخطاء المطبعية والإيقاع المكسور؛ قم بإصلاحها". يعمل الكمبيوتر هنا كمصحح لغوي، ليعيد القصيدة إلى حالتها المثالية.
التحليل (الاختبار): "اقرأ هذه القصيدة وأخبرني: من أي عصر هي؟ وما هو نظام القافية فيها؟". يعمل الكمبيوتر هنا كناقد يجري اختباراً.
٣. الفصل الدراسي (تدريب النماذج)
أخذ الباحثون أربعة "طلاب" من الحواسيب (نماذج ذكاء اصطناعي موجودة بالفعل) وعلموهم باستخدام مجموعة البيانات الجديدة هذه.
الطلاب: استخدموا نموذجين جيدين في لغات متعددة (LLaMA و Qwen) ونموذجين متخصصين في اللغة العربية (ALLaM و Fanar).
أسلوب التدريب: جربوا طريقتين. الأولى كانت التدريب المشترك (إلقاء جميع الألعاب على الطالب دفعة واحدة)، والثانية هي التعلم المنهجي (تعليم الأشياء السهلة أولاً، مثل التحليل، وتوفير الأشياء الصعبة، مثل الكتابة من الصفر، لوقت لاحق).
٤. تقرير الدرجات (النتائج)
بعد التدريب، اختبروا الطلاب بطريقتين:
المصحح الآلي: استخدموا ذكاءً اصطناعياً آخر لتقييم القصائد بناءً على أشياء مثل القواعد، والتدفق، وما إذا كان الكمبيوتر قد اتبع القواعد فعلياً (مثل استخدام القافية الصحيحة).
الحكام البشر: استعانوا بمتحدثين أصليين للغة العربية من محبي الشعر لقراءة القصائد وتقييمها على مقياس من ١ إلى ٥.
النتائج:
تحسن هائل: قبل التدريب، كانت الحواسيب سيئة جداً في كتابة الشعر الذي يتبع القواعد. بعد التدريب، أصبحوا أفضل بكثير.
الطالب المتفوق: نموذج ALLaM، الذي صُمم خصيصاً للغة العربية، أصبح الشاعر الأفضل بعد التدريب، حيث سجل أعلى الدرجات في الفصاحة والتماسك.
المهمة الأصعب: كانت كتابة قصيدة من الصفر (التوليد) هي الأسهل للحواسيب. أما إصلاح قصيدة مكسورة (المراجعة) فكانت الأصعب، لأنها تتطلب من الكمبيوتر فهم "روح" القصيدة أثناء إصلاح الأخطاء التقنية.
اللهجات نجحت: أصبحت الحواسيب أفضل بكثير في فهم وكتابة اللهجات العربية المختلفة، وليس فقط النسخة الفصحى.
الخلاصة
لا تدعي هذه الورقة أن الحواسيب ستستبدل الشعراء البشر أو أنها تستطيع كتابة روائع مثيرة للمشاعر ومثالية بعد؛ بل توضح أننا نستطيع الآن بناء مساعد رقمي يساعد الناس على كتابة الشعر. إذا كنت تريد قصيدة بأسلوب معين، وبإيقاع محدد، وبلهجتك المحلية، فإن هذا النظام الجديد يمكنه مساعدتك في صياغة مسودتها، أو إصلاح أخطائك، أو حتى تحليل ما كتبت. إنه يحول الكمبيوتر من قارئ سلبي إلى شريك إبداعي نشط يلتزم بالقواعد.
إليك ملخص تقني مفصل لورقة البحث بعنوان "توليد الشعر الموجه بالتعليمات باللغة العربية ولهجاتها".
1. بيان المشكلة
على الرغم من الدور المركزي للشعر في الثقافة واللغة العربية، إلا أن النماذج اللغوية الكبيرة (LLMs) الحالية تواجه صعوبة في التوليد المتحكم به للشعر العربي. ركزت الأبحاث الحالية بشكل أساسو على المهام التحليلية (مثل كشف البحر الشعري، ونسبة القصائد للشاعر، وتصنيف المواضيع) باستخدام مجموعات بيانات صغيرة نسبيًا. وهناك فجوة كبيرة في:
القدرات التوليدية: قلة من النماذج يمكنها توليد شعر يلتزم بالقيود الهيكلية الصارمة (البحر والقافية) والمتطلبات الأسلوبية.
التنوع اللهجي: معظم العمل الحالي يقتصر على اللغة العربية الفصحى (MSA)، متجاهلاً التنوع الغني للهجات الإقليمية (الخليجية، الشامية، المغاربية، ولهجة وادي النيل).
اتباع التعليمات: غالبًا ما تفشل النماذج الحالية في اتباع تعليمات المستخدم المعقدة المتعلقة بالقيود (مثل: "اكتب قصيدة رومانسية على الطراز العباسي باستخدام بحر البسيط").
2. المنهجية
يقترح المؤلفون إطار عمل شاملاً يتضمن بناء مجموعة بيانات، والضبط الدقيق الموجه بالتعليمات (IFT)، والتقييم الصارم.
أ. بناء مجموعة البيانات
قام الفريق بتجميع مجموعة ضخمة من النصوص من مصادر عامة (PoetsGate، Adab، Ashaar، إل&م) ومعالجتها عبر مسار متعدد الخطوات:
التوحيد والتنظيف: توحيد بنية الأبيات (بيت واحد لكل سطر)، وإزالة القصائد ذات البيت الواحد، وتوحيد البيانات الوصفية (العصر، النوع، البحر).
إثراء البيانات الوصفية: استخدام Gemini 2.5 Pro لتوليد بيانات وصفية دلالية تلقائيًا، تشمل الكلمات المفتاحية (المواضيع) والعبارات المفتاحية (الملخصات التركيبية)، محققين جودة بلغت 96% في التقييم اليدوي.
إزالة التكرار: إزالة التكرارات داخل المصدر الواحد وضمان عدم وجود تسرب للبيانات بين مجموعات التدريب والاختبار (وتحديدًا استبعاد معيار FannOrFlop من التدريب).
إنشاء نماذج التعليمات:
المهام: تحديد أربع مهام أساسية: التوليد (تأليف قصائد جديدة)، الإكمال (إكمال قصائد جزئية)، المراجعة (إصلاح القصائد التالفة أو المتضررة)، والتحليل (أسئلة الاختيار من متعدد حول البيانات الوصفية).
المهام الفرعية: إنشاء 54 مهمة فرعية تستهدف قيودًا محددة (مثل: مشروط بالقافية، أو البحر، أو العصر، أو اللهجة).
التغطية اللغوية: تصميم نماذج التعليمات بـ اللغة العربية الفصحى وأربعة لهجات رئيسية (الخليجية، الشامية، وادي النيل، والمغاربية).
النطاق: تحتوي مجموعة البيانات النهائية على 1.35 مليون زوج تدريبي و24.8 ألف زوج اختبار، مع 3,220 نموذج تعليمات فريد.
ب. تدريب النموذج
قام المؤلفون بإجراء ضبط دقيق لأربعة نماذج لغوية متميزة باستخدام تقنية LoRA (التكيف منخفض الرتبة):
النموذج اللغوي كحكم (LLM-as-a-Judge): استخدام Gemini 2.5 Flash لتقييم الامتثال، والطلاقة، والتماسك، والجودة الشعرية على مقياس من 1 إلى 5.
المقاييس الآلية: استخدام lm-eval-harness لدقة أسئلة الاختيار من متعدد، والمقاييس القياسية (BERTScore، ROUGE-L، والالتزام بالقافية) لمهام التوليد.
التقييم البشري: قام خبيران أدبيان من الناطقين بالعربية بتقييم 400 عينة مولدة دون معرفة المصدر (blindfolded) عبر المعايير الأربعة.
3. المساهمات الرئيسية
مجموعة بيانات InstructPoet-Ar: أول مجموعة بيانات ضخمة قائمة على التعليمات للشعر العربي تغطي العربية الفصحى وأربع لهجات رئيسية، وتدعم التوليد، والإكمال، والمراجعة، والتحليل.
إطار عمل شامل للمهام: نظام موحد يتعامل مع 54 مهمة فرعية تربط بين التوليد الإبداعي والفهم التحليلي.
المتانة اللهجية: أثبتت الدراسة أن الضبط الدقيق الموجه بالتعليمات يحسن أداء النماذج عبر مختلف اللهجات العربية، وليس الفصحى فقط.
التعلم المنهجي مقابل التدريب المشترك: قدمت دراسة تجريبية حول كيفية تأثير أنظمة التدريب على تعلم البنية الشعرية، موضحة أن التعرض المنظم (المنهجي) يساعد غالبًا في مهارات محددة.
اللهجات: أدى الضبط الدقيق إلى تحسين الأداء في جميع اللهجات دون وجود لهجة واحدة كانت "الأسهل" أو "الأصعب" باستمرار.
أداء النماذج:
تفوق نموذج ALLaM-7B (المخصص للعربية) باستمرار على الآخرين، محققًا أعلى الدرجات في الطلاقة والتماسك.
أظهر Qwen3-8B أكبر تحسن نسبي (+63%) بعد الضبط الدقيق، مما يشير إلى قدرة عالية على التكيف رغم ضعف قاعدته العربية الأساسية.
التعلم المنهجي: حقق عمومًا تحسينات طفيفة مقارنة بالخلط العشوائي، لا سيما في المهام الهيكلية.
التقييم البشري
مكاسب كبيرة: تفوقت النماذج التي خضعت للضبط الدقيق بشكل كبير على نظيراتها الأساسية.
ALLaM-7B (FT): سجل 3.99/5.0 (ارتفاعًا من 3.02).
Qwen3-8B (FT): سجل 3.66/5.0 (ارتفاعًا من 2.24).
نقاط القوة: كانت الطلاقة والتماسك أقوى المجالات، حيث اقتربت غالبًا من الجودة البشرية.
نقاط الضعوة: ظلت الجودة الشعرية (العمق الفني، الاستعارة) هي البعد الأقل تسجيلًا للدرجات (بحد أقصى 3.82/5.0)، مما يشير إلى أنه بينما يمكن للنماذج محاكاة البنية، فإن التقاط العمق الفني الحقيقي لا يزال تحديًا.
الدلالة الإحصائية: كانت جميع التحسينات ذات دلالة إحصائية (p<0.0001).
5. الأهمية والعمل المستقبلي
سد الفجوة: ينقل هذا العمل التركيز من التحليل السلبي إلى الخلق النشط والمتحكم به في معالجة اللغة العربية، مما يتيح أدوات عملية للكتاب والتربويين.
الحفاظ الثقافي: من خلال دعم اللهجات والعصور التاريخية، يساعد هذا الإطار في حفظ وتوليد أشكال متنوعة من التراث الأدبي العربي.
القيود:
الاعتماد على تقنية LoRA بدلاً من الضبط الدقيق الكامل قد يحد من القدرة على التقاط الفروق الأسلوبية المعقدة.
تميل مجموعة البيانات بشدة نحو الشعر التاريخي/الكلاسيكي؛ بينما يقل تمثيل الشعر المعاصر والشعر الحر.
الاتجاهات المستقبلية: يخطط المؤلفون للتوسع في الشعر المعاصر، والشعر الحر، والضبط الدقيق الكامل للنماذج الأكبر لتعزيز العمق الفني والتغطية اللهجية.
في الختام، تضع InstructPoet-Ar معيارًا جديدًا لتوليد الشعر العربي، مثبتة أن النماذج اللغوية الضخمة المضبوطة بالتعليمات يمكنها التعامل بفعالية مع القيود الهيكلية، والإيقاعية، واللهجية المعقدة للشعر العربي، رغم بقاء مساحة كبيرة للتحسين في الإبداع الفني.