← أحدث الأبحاث
💬 NLP

GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training

تقدم الورقة البحثية مجموعة بيانات GPT-NL العامة، وهي مجموعة بيانات ذات ترخيص ميسر تضم 36 مليار رمز فريد للغة الهولندية إلى جانب بيانات منسقة باللغات الإنجليزية والبرمجية والألمانية/الدنماركية، صُممت لتسهيل تطوير نماذج لغوية تجارية قانونية ومفيدة.

المؤلفون الأصليون: Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink

نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم طفل صغير، عبقري ولكن صغير جداً في السن (وهو ذكاء اصطناعي)، كيف يتحدث ويفكر ويكتب باللغة الهولندية. للقيام بذلك، يتعين عليك إعطاؤه مكتبة ضخمة من الكتب والصحف والمحادثات ليقرأها.

ومع ذلك، هناك عقبة: لا يمكنك ببساطة التقاط أي كتاب من الرف. يجب عليك التأكد من أن لديك الحق القانوني لتصويره، ولا تريد إعطاء الطفل كتباً مليئة بخطاب الكراهية أو الأكاذيب أو الهراء المربك.

هذه الورقة هي قصة كيف قام فريق في هولندا ببناء مكتبة خاصة، قانونية للغاية، ونظيفة للغاية تسمى GPT-NL Public Corpus خصيصاً لتعليم الذكاء الاصطناعي التحدث بالهولندية.

إليك تفصيل مشروعهم باستخدام تشبيهات بسيطة:

1. المشكلة: "الرف الفارغ"

لفترة طويلة، إذا أردت تدريب ذكاء اصطناعي ليتحدث الإنجليزية، كان بإمكانك صب الإنترنت بأكمله في دماغه. ولكن بالنسبة للهولندية؟ كان "الرف" فارغاً في الغالب، أو كانت الكتب مغلقة خلف جدران دفع (اشتراكات)، أو كُتبت بطريقة تجعل استخدامها للذكاء الاصطناي التجاري غير قانوني.

بسبب هذا، اضطر المتحدثون بالهولندية إلى الاعتماد على أجهزة ذكاء اصطناعي "متعددة اللغات" تم تدريبها في الغالب على الإنجليزية. الأمر يشبه محاولة تعلم عزف البيانو من خلال الاستماع فقط إلى عازف كمان؛ ستحصل على الموسيقى، لكن التقنية ستكون خاطئة تماماً.

2. الحل: "GPT-NL Public Corpus"

بنى الفريق مكتبة جديدة. إنها ليست مجرد كومة من صفحات الويب العشوائية؛ بل هي مجموعة منسقة من 21 مجموعة محددة باللغة الهولندية.

  • الحجم: تحتوي على حوالي 36 مليار كلمة (tokens) من اللغة الهولندية الصافية التي لم يرها أي ذكاء اصطناعي آخر من قبل.
  • الميزة الإضافية: أضافوا أيضاً بعض الإنجليزية، والألمانية، والدنماركية، والبرمجة (لغة البرمجة) لمساعدة الذكاء الاصطناعي على التعلم بشكل أفضل، تماماً كما يتعلم الطفل بشكل أفضل إذا سمع بعض اللغات الأخرى بجانبه.

الـقواعد الذهبية الثلاث ( "فلاتر السلامة")

قبل أن يتمكن أي كتاب من دخول هذه المكتبة، كان عليه اجتياز ثلاثة اختبارات صارمة:

  • القاعدة رقم 1: هل هو مفيد؟
    • التشبيه: لا نريد للذكاء الاصطناعي أن يحفظ رسائل البريد الإلكتروني العشوائية (Spam) أو الهراء. نريد منه أن يتعلم الحقائق، والمنطق، والتواصل الواضح. لقد ركزوا على البيانات التي تساعد الذكاء الاصطناعي ليكون مساعداً مفيداً، وليس مجرد حالم يهذي.
  • القاعدة رقم 2: هل هو قانوني؟
    • التشبيه: تخيل وجود لافتة "ممنوع التعدي" على منزل. اختار الفريق فقط الكتب التي قال أصحابها: "نعم، يمكنك نسخ هذا!" (تراخيص المشاع الإبداعي - Creative Commons). لقد تجنبوا الكتب التي تحمل علامات "ممنوع الاستخدام التجاري" أو "ممنوع الاشتقاق". أرادوا بناء مكتبة يمكن لأي شخص، حتى الشركات، استخدامها قانونياً.
  • القاعدة رقم 3: هل هو آمن؟
    • التشبيه: إذا أعطيت طفلاً كتاباً مليئاً بالتنمر أو خطاب الكراهية، فقد يبدأ في التصرف بهذا الشكل. قام الفريق بتنقية المحتوى السام، والتحيز، واللغة المسيئة. أرادوا أن يكون الذكاء الاصطناعي مهذباً ومفيداً.

4. كيف ملأوا الرفوف (المصادر)

بما أنهم لم يستطيعوا مجرد كشط الإنترنت بأكمله، فقد توجب عليهم أن يكونوا مبدعين:

  • "المسافرون عبر الزمن" (الأرشيفات): عقدوا شراكات مع الأرشيفات الهولندية لرقمنة الكتب والصحف القديمة (التي يزيد عمرها عن 100 عام). وبما أنها قديمة جداً، فهي تقع ضمن "الملكية العامة" (متاحة للاستخدام من قبل الجميع).
  • "أصدقاء الحكومة": عملوا مع الحكومة الهولندية للحصول على الوثائق الرسمية، والأحكام القضائية، وسجلات البرلمان. هذه الوثائق عادة ما تكون عامة، ولكن من الصعب العثور عليها في تنسيق نظيف.
  • "البناة الاصطناعيون" (النوع 1 فقط): لم يطلبوا من ذكاء اصطناعي "تأليف" قصص جديدة (التي قد تكون مزيفة). بدلاً من ذلك، أخذوا قواعد بيانات حقائق (مثل Wikidata) واستخدموا نصاً برمجياً ذكياً لتحويل الحقائق الجافة إلى جمل قابلة للقراءة. فكر في الأمر كتحويل جدول بيانات يحتوي على "الاسم: ويليم ألكسندر، اللقب: ملك" إلى جملة: "ويليم ألكسندر هو الملك".
  • "المترجم" (يوتيوب): أخذوا نصوص فيديوهات يوتيوب بالإنجليزية والإسبانية، ونقّوها، واستخدموا أداة ترجمة لتحويلها إلى الهولندية. منح هذا الذكاء الاصطناعي فرصة لسماع كيف يتحدث الناس الحقيقيون.
  • "ماسح الويب" (C5): استخدموا أداة خاصة لمسح الويب، ولكن فقط للصفحات التي ذكرت صراحةً أن "هذا المحتوى متاح للاستخدام المجاني". لقد قاموا بتصفية كل شيء آخر لضمان حقوق الملكية القانونية بنسبة 100%.

5. مراقبة الجودة ( "تفتيش أمين المكتبة")

قبل وضع الكتب على الرفوف، قام فريق من أمناء المكتبة البشر (منسقو البيانات) بفحص نهائي.

  • نظروا في عينات للتأكد من أن اللغة الهولندية تبدو طبيعية.
  • تحققوا من وجود أسرار شخصية (مثل أرقام الهواتف أو العناوين) وقاموا بحذفها.
  • قاموا بتقييم "مستوى الخطورة" لكل كتاب. إذا كان الكتاب يحتوي على القليل من التحيز، فقد يستخدمونه بنسبة أقل أثناء تدريب الذكاء الاصطناعي، لمجرد ضمان السلامة.

6. لماذا هذا مهم؟

هذه الورقة ليست مجرد بحث عن مجموعة بيانات؛ إنها تتعلق بـ العدالة والسلامة.

  • للباحثين: توفر لهم نقطة انطلاق نظيفة وقانونية لبناء أنظمة ذكاء اصطناعي هولندية أفضل دون القلق من التعرض للمقاضاة.
  • للجمهور: تضمن أن أدوات الذكاء الاصطناعي التي سنستخدمها في المستقبل ستفهم الثقافة والقوان واللغة الهولندية بشكل أفضل، دون أن تتسمم ببيانات سيئة أو محتوى غير قانوني.

باختصار: لم يقم فريق GPT-NL بمجرد سكب دلو من الماء (البيانات) في مسبح. لقد بنوا مسبحاً مفلتراً، قانونياً، وعالي الجودة مخصصاً للذكاء الاصطناعي المتحدث بالهولندية، لضمان أنه آمن للجميع للغوص فيه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →