Common Corpus: The Largest Collection of Ethical Data for LLM Pre-Training
تقدم هذه الورقة "Common Corpus"، وهي أكبر مجموعة بيانات مفتوحة لتدريب النماذج اللغوية الكبيرة المكونة من حوالي تريليوني توكن من المحتوى غير الخاضع لحقوق الطبع والنشر أو المرخص مفتوحاً عبر لغات ومجالات متنوعة، والتي تم التحقق من صحتها من خلال تدريب نماذج لغوية صغيرة تؤدي بشكل مماثل للنماذج الحالية ذات الحجم المماثل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يتحدث، ويفكر، ويكتب مثل البشر. وللقيام بذلك، يتعين عليك تغذيته بمكتبة ضخمة من الكتب، والمقالات، والأكواد البرمجية، والمحادثات. وهذا ما نسميه "التدريب المسبق" (Pre-training) لنموذج لغوي كبير (LLM).
لسنوات، كانت الطريقة القياسية لبناء هذه المكتبة هي إرسال مكنسة كهربائية رقمية عملاقة (زاحف ويب - Web Crawler) عبر الإنترنت بأكره لامتصاص كل ما تجده. ولكن تكمن المشكلة في أن: الكثير من هذا المحتوى ليس مجانياً للاستخدام. فهو محمي بحقوق الطبع والنشر، أو مملوك لشركات، أو يحتوي على أسرار شخصية. إن استخدام هذه المواد يشبه بناء منزل باستخدام طوب سرقته من حديقة جارك؛ قد ينجح الأمر، لكنك قد تتعرض للمقاضاة، وقد يُهدم المنزل لاحقاً.
هنا يأتي دور Common Corpus.
"المنتزه العام" مقابل "المول الخاص"
تخيل الإنترنت كمدينة ضخمة.
- الطريقة القديمة: قامت معظم شركات الذكاء الاصطناعي ببناء نماذجها عبر التقاط "طوب" من "المولات الخاصة" (الأخبار، والكتب، والأكواد المحمية بحقوق النشر). وجادلوا قائلين: "نحن فقط ننظر إلى الطوب لنتعلم كيفية البناء، لا نسرق المول!" لكن أصحاب هذه المولات (مثل نيويورك تايمز) يقولون الآن: "توقفوا عن النظر إلى طوبنا!" وبدأوا بإغلاق الأبواب.
- طريقة Common Corpus: يقدم هذا البحث منتزهاً عاماً جديداً وضخماً. كل طوبة في هذا المنتزه تحمل لافتة تقول: "مجانية للأخذ، مجانية للاستخدام، ومجانية للبناء بها". لا دعاوى قضائية، لا رسوم خفية، ولا مناطق قانونية رمادية.
ماذا يوجد داخل المنتزه؟
لم يقم المؤلفون بمجرد إلقاء نفايات عشوائية في المنتزه، بل قاموا بتنسيق مجموعة تضم 2 تريليون "توكن" (Token) (اعتبرها قطع أحجية صغيرة تشكل الكلمات والأفكار). إليك ما يجعل هذا المنتزه مميزاً:
- قرية عالمية: معظم مكتبات الذكاء الاصطناعي هي باللغة الإنجليزية بشكل أساسي. أما Common Corpus فهو يشبه اجتماع الأمم المتحدة؛ فهو يحتوي على أقسام ضخمة بالفرنسية، والألمانية، والإسبانية، وحتى لغات نادرة لا تعرفها نماذج الذكاء الاصطناعي الأخرى إلا قليلاً. إنه ليس صوتاً واحداً، بل هو جوقة من أصوات متعددة.
- لديه آلة زمن: تعود البيانات إلى قرون مضت. فهي تتضمن صحفاً قديمة من القرن الثقبل، وكتباً عتيقة، وتقارير مالية حديثة. هذا يساعد الذكاء الاصطناعي على فهم التاريخ وكيفية تغير اللغة بمرور الوقت، وليس فقط ما يكتبه الناس على تويتر في هذه اللحظة.
- مكتبة برمجية: يحتوي على قسم ضخم من الأكواد البرمجية (مثل بايثون وجافا). هذا يعلم الذكاء الاصطناعي كيف يفكر منطقياً ويحل المسائل الرياضية، وليس فقط كتابة الشعر.
- بيانات "نظيفة": نظراً لأن البيانات قديمة أو مرخصة بشكل مفتوح، فقد تبدو أحياناً غير مرتبة (مثل كتاب ممسوح ضوئياً بنصوص ضبابية). لذا، قام المؤلفون ببناء "عمال نظافة رقميين" (أدوات ذكاء اصطناعي) لإصلاح الأخطاء المطبعية، وتنظيف المسوحات السيئة، وإزالة الأسرار الشخصية (مثل أرقام الهواتف) قبل أن يراها الروبوت.
هل نجح الأمر؟
قام المؤلفون ببناء روبوتين صغيرين (نماذج ذكاء اصطناعي) باستخدام بيانات "المنتزه العام" فقط.
- النتيجة: أدت هذه الروبوتات الصغيرة أداءً يضاهي، أو يتفوق أحياناً على، الروبوتات الأخرى التي غُذيت بـ "الطوب المسروق" من الإنترنت الخاص.
- الدرس المستفاد: لست بحاجة لكسر القانون لبناء ذكاء اصطناعي ذكي. إذا استخدمت بيانات عالية الجودة وقانونية ومفتوحة، يمكنك إنشاء أدوات قوية يمكن للجميع استخدامها بأمان.
لماذا يهم هذا الأمر؟
تخيل لو كان عليك في كل مرة تريد فيها بناء تطبيق جديد، أن تقلق من ظهور محامٍ لإغلاق عملك لأنك استخدمت صورة محمية بحقوق النشر. هذا ما يحدث للذكاء الاصطناعي الآن.
Common Corpus يشبه تسليم العالم صندوق أدوات ضخم، قانوني، ومفتوح المصدر. إنه يسم-ح للباحثين والطلاب والشركات الصغيرة ببناء ذكائهم الاصطناعي الخاص دون خوف. إنه يضمن ألا يكون مستقبل الذكاء الاصطناعي حكراً على عدد قليل من الشركات الكبرى التي تملك كل البيانات، بل يكون مورداً مشتركاً للجميع.
باخت-صار: لقد بنى المؤلفون أكبر مكتبة قانونية ونظيفة في العالم لتعليم الذكاء الاصطناعي. لقد أثبتوا أنه يمكنك بناء روبوت فائق الذكاء باستخدام مكونات "مجانية" فقط، مما يفتح الباب لمستقبل يكون فيه الذكاء الاصطناعي مفتوحاً، آمناً، وينتمي للجميع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.