SciLaD: A Large-Scale, Transparent, Reproducible Dataset for Natural Scientific Language Processing
تُعد SciLaD مجموعة بيانات جديدة، واسعة النطاق، وشفافة تماماً، تضم أكثر من 10 ملايين منشور علمي منسق باللغة الإنجليزية و35 مليون منشور متعدد اللغات، تم بناؤها باستخدام أطر عمل مفتوحة المصدر لتمكين البحث القابل لإعادة الإنتاج، وتم التحقق من صحتها بواسطة نموذج RoBERTa مُدرب مسبقاً يحقق أداءً يضاهي النماذج اللغوية العلمية الحالية.
المؤلفون الأصليون:Luca Foppiano, Sotaro Takeshita, Pedro Ortiz Suarez, Ekaterina Borisova, Raia Abu Ahmad, Malte Ostendorff, Fabio Barth, Julian Moreno-Schneider, Georg Rehm
تخيل عالم البحث العلمي كمكتبة ضخمة وقديمة. في الداخل، توجد ملايين الكتب (الأوراق العلمية) التي كتبها خبراء. ومع ذلك، فإن معظم هذه الكتب محبوسة خلف واجهات زجاجية (جدران دفع - paywalls)، ومكتوبة بلغة تقنية معقدة للغاية، ومبعثرة عبر رفوف مختلفة وبلغات متنوعة. لكي يتمكن كمبيوتر (ذكاء اصطناعي) من التعلم منها، فإنه يحتاج إلى القدرة على قراءتها، وفهم هيكلها، وعدم الارتباك بسبب التنسيقات المزخرفة.
إليك SciLaD (مجموعة بيانات اللغة العلمية). تخيل SciLaD ليس مجرد مكتبة، بل هو طاقم بناء خارق مفتوح المصدر قام ببناء غرفة قراءة جديدة ومنظمة تماماً للذكاء الاصطناعي، باستخدام أدوات يمكن لأي شخص استخدامها مجاناً.
إليك قصة كيف فعلوا ذلك، مشروحة ببساطة:
1. عملية السطو الكبرى (جمع البيانات)
عادة ما يكون الحصول على الأوراق العلمية مثل محاولة شراء تذكرة لحفل موسيقي للنخبة؛ عليك أن تدفع، وأحياناً تكون الأبواب مغلقة.
المشكلة: يتم تدريب معظم نماذج الذكاء الاصطناعي على نصوص الإنترنت العامة (مثل الأخبار والمدونات)، وهي جيدة للدردشة ولكنها سيئة جداً في فهم العلوم المعقدة.
الحل: لم يقم فريق SciLaD باقتحام المكتبة. بدلاً من ذلك، استخدموا خريطة "وصول عام" تسمى Unpaywall. تشير هذه الخريطة إلى ملايين الأوراق العلمية التي جعلها المؤلفون متاحة مجاناً للجميع قانونياً.
النطاق: جمعوا 35 مليون ورقة (هذا يشبه ملء ملعب بالكتب). كما حصلوا على نسخ إضافية من مصادر مجانية أخرى مثل arXiv وPubMed.
2. عملية التنظيف الكبرى (المعالجة)
تخيل أن لديك كومة من 35 مليون وثيقة. بعضها ملفات PDF (صور ممسوحة ضوئياً)، وبعضها كود خام (LaTeX)، وبعضها ملفات XML مهيكلة. جميعها تبدو مختلفة. إذا وضعتها فقط في خلاط، فستحصل على فوضى.
التحدي: لا يمكنك ببساال استخدام روبوت فاخر وباهظ الثمن (ذكاء اصطناعي بصري) لقراءة كل صفحة لأن ذلك سيستغرق وقتاً طويلاً وسيكلف ثروة.
الأداة: استخدموا أداة متخصصة ومفتوحة المصدر تسمى Grobid. فكر في Grobid كأمين مكتبة سريع للغاية ولا يكل، يعرف تماماً كيف يأخذ ملف PDF فوضوي، وينزع منه الرؤوس والتذييلات، ويستخرج فقط النص الصافي والهيكل المهم (مثل "هذا جدول"، "هذا اقتباس").
النتيجة: قاموا بتحويل كل تلك التنسيقات المختلفة إلى تنسيق واحد نظيف ومعياري يسمى TEI XML. إنه يشبه ترجمة كل كتاب في المكتبة إلى نفس اللغة والخط حتى يتمكن الذكاء الاصطناعي من قراءتها جميعاً دون إصابة بصداع.
3. الفلتر (ضبط الجودة)
حتى مع وجود 35 مليون كتاب، فأنت لا تريد تدريب ذكائك الاصطناعي على القمامة.
العملية: قاموا بتصفية أي شيء ليس باللغة الإنجليزية (للنموذج الرئيسي الخاص بهم) وأزالوا المكررات (مثل العثين على نفس الكتاب مطبوعاً مرتين). كما تحققوا من أن النصوص ليست مشوهة أو مشفرة.
المنتج النهائي: انتهى بهم المطاف بـ "معيار ذهبي" يتكون من 10 ملايين ورقة علمية إنجليزية عالية الجودة.
4. تجربة القيادة (تدريب الذكاء الاصطناعي)
الآن بعد أن أصبح لديهم المكتبة النظيفة، أرادوا معرفة ما إذا كان ذلك سيساعد الذكاء الاصطناعي على التعلم فعلياً.
التجربة: بنوا عقلاً جديداً للذكاء الاصطناعي (نموذج يسمى SciLaD-M) من الصفر باستخدام مجموعة البيانات الجديدة الخاصة بهم فقط. إنه يشبه تعليم طفل القراءة باستخدام الكتب العلمية فقط، بدلاً من خلطها بالقصص المصورة وقوائم البقالة.
المقارنة: أجروا سباقاً بين ذكائهم الاصطناعي الجديد وبين نماذج ذكاء اصطناعي شهيرة أخرى "خبيرة في العلوم" (مثل SciBERT).
الفائز: قدم SciLaD-M أداءً يضاهي، وأحياناً يتفوق على، النماذج الأخرى. أثبت هذا أنك لست بحاجة إلى بيانات سرية أو باهظة الثمن أو غير قانونية لبناء ذكاء اصطناعي علمي ذكي. أنت فقط بحاجة إلى مجموعة بيانات شفافة، مفتوحة، ومنظمة جيداً.
لماذا يهم هذا؟ (الصورة الكبيرة)
الشفافية: قبل هذا، كانت العديد من نماذج الذكاء الاصطناعي مثل "الصناديق السوداء". لم نكن نعرف بالضبط ما هي البيانات التي تم تغذيتها بها. SciLaD يشبه كتاب الوصفات حيث يمكنك رؤية كل مكون فيه.
قابلية التكرار: نظرًا لاستخدامهم أدوات مفتوحة المصدر، يمكن لأي عالم آخر نسخ عملهم، والتحقق من حساباتهم، والبناء عليه.
المستقبل: هذه مجموعة البيانات هي أساس. تماماً كما تحتاج إلى أساس متين لبناء ناطحة سحاب، يمكن للباحثين الآن استخدام SciLaD لبناء أدوات أفضل من أجل:
إيجاد علاجات للأمراض بشكل أسرع.
تلخيص الأبحاث المعقدة للطلاب.
الربط بين النقاط في مجالات علمية مختلفة.
باخت-القول: SciLaD هو مشروع ضخم مفتوح المصدر قام بتنظيف 35 مليون ورقة علمية، وتنظيمها بشكل مثالي، وأثبت أنه يمكننا بناء أدوات ذكاء اصطناي ذكية وقوية للعلوم دون الحاجة إلى دفع مقابل بيانات سرية أو استخدام تقنيات مغلقة وباهظة الثمن. يتعلق الأمر بجعل مكتبة المعرفة البشرية متاحة حقاً للآلات التي تساعدنا على فهمها.
إليك ملخص تقني مفصل لورقة البحث بعنوان "SciLaD: مجموعة بيانات ضخمة، شفافة، وقابلة للتكرار لمعالجة اللغات العلمية الطبيعية."
1. بيان المشكلة
على الرغم من التقدم الكبير في معالجة اللغات الطبيعية (NLP) المدفوع بمجموعات البيانات المفتوحة واسعة النطاق، إلا أن اللغة العلمية لا تزال ممثلة تمثيلاً ناقصاً في مجموعات البيانات المفتوحة. تفتقر الموارد الحالية غالباً إلى:
الشفافية والقابلية للتكرار: تعتمد العديد من مجموعات البيانات العلمية على مسارات معالجة مملوكة لجهات خاصة أو أدوات غير مفتوحة المصدر، مما يجعل من الصعب التحقق من عملية بناء البيانات أو توسيعها.
إمكانية الوصول المهيكلة: تمتلك النصوص العلمية خصائص لغوية وهيكلية فريدة (مصطلحات دقيقة، خطاب رسمي، استدلال متمحور حول البيانات) تختلف عن النصوص العامة الموجودة على الويب. تفشل مجموعات البيانات الحالية غالباً في الحفاظ على بنية المستند (مثل الاستشهادات، والبيانات الوصفية) بتنسيق معياري مناسب للمهام المعقدة اللاحقة مثل تحليل مخطط الاستشهاد.
غموض ترخيص البيانات: غالباً ما يكون الوضع القانوني لمحتوى الوصول المفتوح (OA) غير واضح، مما يعيق إنشاء مجموعات تدريب عالية الجودة وقابلة لإعادة التوزيع بالكامل.
2. المنهجية: مسار عمل SciLaD
يقدم المؤلفون SciLaD (مجموعة بيانات اللغة العلمية)، والتي تم بناؤها بالكامل باستخدام أطر عمل مفتوحة المصدر وبيانات متاحة علناً. يتكون مسار العمل من ثلاث مراحل رئيسية:
أ. حصاد البيانات
المصادر: المصدر الأساسي هو Unpaywall (قاعدة بيانات تضم أكثر من 50 مليون مقال وصول مفتوح)، مدعوماً بـ arXiv (مصادر LaTeX)، و PubMed Central (PMC) (تنسيق JATS XML)، و PLOS (تنسيق XML).
النطاق: أسفر الحصاد الأولي عن 38.9 مليون مدخل. بعد تصفية المكونات غير المستندية (الصور/الجداول) ومعالجة حالات فشل التنزيل، تم تأمين 31.6 مليون مستند بصيغة PDF.
البنية التحتية: تمت عملية المعالجة في بيئة JetStream 2 HPC باستخدام 24 آلة افتراضية متوازية.
ب. المعالجة المسبقة والتوحيد القياسي
للتعامل مع تباين التنسيقات (PDF، JATS XML، LaTeX)، يقوم مسار العمل بتوحيد جميع البيانات في تنسيق مهيكل واحد وهو: TEI XML (مبادرة ترميز النص).
معالجة PDF: بدلاً من استخدام نماذج اللغات البصرية (VLMs) البطيئة والمكلفة مثل Nougat، استخدم المؤلفون Grobid، وهي أداة مفتوحة المصدر تعتمد على الشبكات العصبية المتكررة (RNNs) والآلات المعتمدة على الشروط (CRFs). يعالج Grobid حوالي 120 صفحة في الثانية على أجهزة عادية، ويتجنب أخطاء التعرف الضوئي على الحروف (OCR) عبر استخراج طبقة النص الأصلية من ملفات PDF الرقمية المنشأة أصلاً.
تحويل XML/LaTeX:
JATS XML: تم تحويله إلى TEI XML باستخدام أنماط تنسيق Pub2TEI (XSLT).
LaTeX: تم تحويله إلى XML مهيكل باستخدام LaTeXl، والذي يحافظ على الدلالات الرياضية.
المخرجات: أنتجت هذه المرحلة 35.3 مليون منشور بتنسيق TEI XML، مع الحفاظ على 109 مليون عقدة استشهاد و1.51 مليار حافة.
ج. المعالجة اللاحقة والتصفية
استخراج النصوص: تم تحويل TEI XML إلى نص مجرد، مع الاحتفاظ بالفقرات والتعليقات التوضيحية واستبعاد الجداول والمعادلات المعقدة لضمان جودة النص.
تصفية اللغة: تم تطبيق درجة كشف لغة موزونة (باستخدام fasttext) لتصفية اللغة الإنجليزية. تم استبعاد المستندات التي كانت درجة الثقة فيها أقل من 80%.
تصفية الجودة: تم تطبيق مرشح جودة اللغة Gopher. وعلى عكس مرشحات بيانات الويب (مثل C4)، فقد تم ضبط هذا المرشح ليتناسب مع النصوص العلمية.
إزالة التكرار: تم تطبيق تقنية MinHash لإزالة التكرار (5-grams، 112 دالة هاش) لإزالة النسخ المتطابقة تقريباً (تشابه > 75%).
المجموعة النهائية: نتج عن الجزء الخاص باللغة الإنجليزية 10.9 مليون مستند (حوالي 68.7 مليار توكن/وحدة لغوية).
3. المساهمات الرئيسية
مجموعة بيانات SciLaD:
مجموعة نصوص متعددة اللغات تضم 35.3 مليون مقال علمي بتنسيق TEI XML.
جزء إنجليزي مصفى يضم 10.9 مليون مستند (68.7 مليار توكن) للتدريب المسبق.
تتضمن بيانات وصفية غنية، ومخططات استشهاد، وكلمات مفتاحية للمؤلفين.
مسار عمل مفتوح المصدر:
مسار عمل قابل للتكرار بالكامل باستخدام Grobid، وPub2TEI، وLaTeXML، وDatatrove.
جميع الأكواد ونصوص معالجة البيانات متاحة علناً على GitHub.
نماذج SciLaD-M:
مشفرات RoBERTa-base مدربة من الصفر (110 مليون معلمة).
نسختان: SciLaD-M (custom) (مدرب مع مُجزئ كلمات مخصص) و SciLaD-M (RoBERTa) (باستخدام مُجزئ كلمات RoBERTa الأصلي).
إطار التقييم:
مسار اختبار قابل للتكرار لنماذج المشفر (Encoder) والمشفر-المفكك (Encoder-Decoder) عبر خمس مهام معالجة لغات طبيعية علمية.
4. النتائج التجريبية
قام المؤلفون بتقييم نماذج SciLaD-M مقابل النماذج المرجعية (SciBERT، BERT، RoBERTa، ModernBERT) على 11 مجموعة بيانات عبر 5 مهام.
الأداء العام: حقق نموذج SciLaD-M (custom) متوسط درجة F1 قدره 74.91، متفوقاً على SciBERT (71.19) والنماذج ذات النطاق العام.
التعرف على الكيانات المسماة (NER):
حقق 97.20 F1 في مجموعة BC5CDR (الكيميائية/الأمراض)، متجاوزاً جميع النماذج المرجعية.
أدى أداءً يضاهي SciBERT في JNLPBA وNCBI-disease.
استخراج العلاقات (REL):
تفوق على جميع النماذج المرجعية في ChemProt (83.83) و SciERC (81.23)، مما يدل على قدرة فعالة في التقاط الدلالات العلاقاتية.
تصنيف النصوص (CLS):
حقق أفضل النتائج في CitationIntent (64.46)، متفوقاً بشكل كبير على النماذج العامة.
الإعراب التبعي (DEP):
تفوقت كلتا نسختي SciLaD على النماذج المرجعية في مجموعة GENIA (من حيث UAS وLAS)، مما يشير إلى فهم نحوي محسّن للنصوص العلمية.
الخلاصة: تؤكد النتائج أن النموذج الذي تم تدريبه مسبقاً حصرياً على بيانات معالجة مفتوحة المصدر ومتاحة للوصول المفتوح يمكنه تحقيق أداء يضاهي أداء النماذج المدربة على بيانات مملوكة أو مختلطة المصادر.
5. الأهمية والأثر
القابلية للتكرار والشفافية: يضع SciLaD معياراً جديداً لمعالجة اللغات العلمية الطبيعية من خلال توفير مسار عمل شفاف ومفتوح المصدر بالكامل. يتيح ذلك للمجتمع التدقيق في عمليات تنسيق البيانات وتوسيعها والتحقق منها.
المصادر الأخلاقية للبيانات: تثبت مجموعة البيانات أنه يمكن بناء نماذج لغوية كبيرة (LLMs) علمية عالية الجودة دون الاعتماد على مصادر بيانات مملوكة أو مقيدة أو تم الحصول عليها بشكل غير قانوني.
الفائدة الهيكلية: من خلال الحفاظ على بنية TEI XML ومخططات الاستشهاد، يتيح SciLaD مهاماً لاحقة متقدمة (مثل التحليل الببليومتري، ونمذجة مخطط الاستشهاد) التي يصعب تنفيذها مع مجموعات البيانات التي تعتمد على النصوص المجردة فقط.
مورد للمجتمع: إن إصدار مجموعة البيانات، والنماذج، وإطار التقييم يخفض حواجز الدخول أمام الباحثين في المجالات العلمية المتخصصة، مما يعزز الابتكار في مجال معالجة اللغات العلمية الطبيعية (NSLP).
القيود والعمل المستقبلي:
يقتصر الجزء النصي المجرد حالياً على اللغة الإنجليزية؛ ويهدف العمل المستقبلي إلى التوسع في لغات أخرى.
تركز مجموعة البيانات حالياً على المهام التمييزية؛ وستستكشف الإصدارات المستقبلية المهام التوليدية (التلخيص، الأسئلة والأجوبة) والاستغلال الأكثر تطوراً لمخطط الاستشهاد وبنية TEI.
من المخطط إصدار جزء مرخص بموجب رخصة CC-BY لإعادة التوزيع غير المقيد في الإصدارات المستقبلية.