← أحدث الأبحاث
💬 NLP

SciLaD: A Large-Scale, Transparent, Reproducible Dataset for Natural Scientific Language Processing

تُعد SciLaD مجموعة بيانات جديدة، واسعة النطاق، وشفافة تماماً، تضم أكثر من 10 ملايين منشور علمي منسق باللغة الإنجليزية و35 مليون منشور متعدد اللغات، تم بناؤها باستخدام أطر عمل مفتوحة المصدر لتمكين البحث القابل لإعادة الإنتاج، وتم التحقق من صحتها بواسطة نموذج RoBERTa مُدرب مسبقاً يحقق أداءً يضاهي النماذج اللغوية العلمية الحالية.

المؤلفون الأصليون: Luca Foppiano, Sotaro Takeshita, Pedro Ortiz Suarez, Ekaterina Borisova, Raia Abu Ahmad, Malte Ostendorff, Fabio Barth, Julian Moreno-Schneider, Georg Rehm

نُشر 2026-03-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Luca Foppiano, Sotaro Takeshita, Pedro Ortiz Suarez, Ekaterina Borisova, Raia Abu Ahmad, Malte Ostendorff, Fabio Barth, Julian Moreno-Schneider, Georg Rehm

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالم البحث العلمي كمكتبة ضخمة وقديمة. في الداخل، توجد ملايين الكتب (الأوراق العلمية) التي كتبها خبراء. ومع ذلك، فإن معظم هذه الكتب محبوسة خلف واجهات زجاجية (جدران دفع - paywalls)، ومكتوبة بلغة تقنية معقدة للغاية، ومبعثرة عبر رفوف مختلفة وبلغات متنوعة. لكي يتمكن كمبيوتر (ذكاء اصطناعي) من التعلم منها، فإنه يحتاج إلى القدرة على قراءتها، وفهم هيكلها، وعدم الارتباك بسبب التنسيقات المزخرفة.

إليك SciLaD (مجموعة بيانات اللغة العلمية). تخيل SciLaD ليس مجرد مكتبة، بل هو طاقم بناء خارق مفتوح المصدر قام ببناء غرفة قراءة جديدة ومنظمة تماماً للذكاء الاصطناعي، باستخدام أدوات يمكن لأي شخص استخدامها مجاناً.

إليك قصة كيف فعلوا ذلك، مشروحة ببساطة:

1. عملية السطو الكبرى (جمع البيانات)

عادة ما يكون الحصول على الأوراق العلمية مثل محاولة شراء تذكرة لحفل موسيقي للنخبة؛ عليك أن تدفع، وأحياناً تكون الأبواب مغلقة.

  • المشكلة: يتم تدريب معظم نماذج الذكاء الاصطناعي على نصوص الإنترنت العامة (مثل الأخبار والمدونات)، وهي جيدة للدردشة ولكنها سيئة جداً في فهم العلوم المعقدة.
  • الحل: لم يقم فريق SciLaD باقتحام المكتبة. بدلاً من ذلك، استخدموا خريطة "وصول عام" تسمى Unpaywall. تشير هذه الخريطة إلى ملايين الأوراق العلمية التي جعلها المؤلفون متاحة مجاناً للجميع قانونياً.
  • النطاق: جمعوا 35 مليون ورقة (هذا يشبه ملء ملعب بالكتب). كما حصلوا على نسخ إضافية من مصادر مجانية أخرى مثل arXiv وPubMed.

2. عملية التنظيف الكبرى (المعالجة)

تخيل أن لديك كومة من 35 مليون وثيقة. بعضها ملفات PDF (صور ممسوحة ضوئياً)، وبعضها كود خام (LaTeX)، وبعضها ملفات XML مهيكلة. جميعها تبدو مختلفة. إذا وضعتها فقط في خلاط، فستحصل على فوضى.

  • التحدي: لا يمكنك ببساال استخدام روبوت فاخر وباهظ الثمن (ذكاء اصطناعي بصري) لقراءة كل صفحة لأن ذلك سيستغرق وقتاً طويلاً وسيكلف ثروة.
  • الأداة: استخدموا أداة متخصصة ومفتوحة المصدر تسمى Grobid. فكر في Grobid كأمين مكتبة سريع للغاية ولا يكل، يعرف تماماً كيف يأخذ ملف PDF فوضوي، وينزع منه الرؤوس والتذييلات، ويستخرج فقط النص الصافي والهيكل المهم (مثل "هذا جدول"، "هذا اقتباس").
  • النتيجة: قاموا بتحويل كل تلك التنسيقات المختلفة إلى تنسيق واحد نظيف ومعياري يسمى TEI XML. إنه يشبه ترجمة كل كتاب في المكتبة إلى نفس اللغة والخط حتى يتمكن الذكاء الاصطناعي من قراءتها جميعاً دون إصابة بصداع.

3. الفلتر (ضبط الجودة)

حتى مع وجود 35 مليون كتاب، فأنت لا تريد تدريب ذكائك الاصطناعي على القمامة.

  • العملية: قاموا بتصفية أي شيء ليس باللغة الإنجليزية (للنموذج الرئيسي الخاص بهم) وأزالوا المكررات (مثل العثين على نفس الكتاب مطبوعاً مرتين). كما تحققوا من أن النصوص ليست مشوهة أو مشفرة.
  • المنتج النهائي: انتهى بهم المطاف بـ "معيار ذهبي" يتكون من 10 ملايين ورقة علمية إنجليزية عالية الجودة.

4. تجربة القيادة (تدريب الذكاء الاصطناعي)

الآن بعد أن أصبح لديهم المكتبة النظيفة، أرادوا معرفة ما إذا كان ذلك سيساعد الذكاء الاصطناعي على التعلم فعلياً.

  • التجربة: بنوا عقلاً جديداً للذكاء الاصطناعي (نموذج يسمى SciLaD-M) من الصفر باستخدام مجموعة البيانات الجديدة الخاصة بهم فقط. إنه يشبه تعليم طفل القراءة باستخدام الكتب العلمية فقط، بدلاً من خلطها بالقصص المصورة وقوائم البقالة.
  • المقارنة: أجروا سباقاً بين ذكائهم الاصطناعي الجديد وبين نماذج ذكاء اصطناعي شهيرة أخرى "خبيرة في العلوم" (مثل SciBERT).
  • الفائز: قدم SciLaD-M أداءً يضاهي، وأحياناً يتفوق على، النماذج الأخرى. أثبت هذا أنك لست بحاجة إلى بيانات سرية أو باهظة الثمن أو غير قانونية لبناء ذكاء اصطناعي علمي ذكي. أنت فقط بحاجة إلى مجموعة بيانات شفافة، مفتوحة، ومنظمة جيداً.

لماذا يهم هذا؟ (الصورة الكبيرة)

  • الشفافية: قبل هذا، كانت العديد من نماذج الذكاء الاصطناعي مثل "الصناديق السوداء". لم نكن نعرف بالضبط ما هي البيانات التي تم تغذيتها بها. SciLaD يشبه كتاب الوصفات حيث يمكنك رؤية كل مكون فيه.
  • قابلية التكرار: نظرًا لاستخدامهم أدوات مفتوحة المصدر، يمكن لأي عالم آخر نسخ عملهم، والتحقق من حساباتهم، والبناء عليه.
  • المستقبل: هذه مجموعة البيانات هي أساس. تماماً كما تحتاج إلى أساس متين لبناء ناطحة سحاب، يمكن للباحثين الآن استخدام SciLaD لبناء أدوات أفضل من أجل:
    • إيجاد علاجات للأمراض بشكل أسرع.
    • تلخيص الأبحاث المعقدة للطلاب.
    • الربط بين النقاط في مجالات علمية مختلفة.

باخت-القول: SciLaD هو مشروع ضخم مفتوح المصدر قام بتنظيف 35 مليون ورقة علمية، وتنظيمها بشكل مثالي، وأثبت أنه يمكننا بناء أدوات ذكاء اصطناي ذكية وقوية للعلوم دون الحاجة إلى دفع مقابل بيانات سرية أو استخدام تقنيات مغلقة وباهظة الثمن. يتعلق الأمر بجعل مكتبة المعرفة البشرية متاحة حقاً للآلات التي تساعدنا على فهمها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →