GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training
تقدم الورقة البحثية مجموعة بيانات GPT-NL العامة، وهي مجموعة بيانات ذات ترخيص ميسر تضم 36 مليار رمز فريد للغة الهولندية إلى جانب بيانات منسقة باللغات الإنجليزية والبرمجية والألمانية/الدنماركية، صُممت لتسهيل تطوير نماذج لغوية تجارية قانونية ومفيدة.