SEDD: Scalable and Efficient Dataset Deduplication with GPUs
يُعد SEDD إطار عمل عالي الأداء، ومعززاً بمعالجات الرسوميات (GPU)، لإزالة تكرار مجموعات البيانات واسعة النطاق، حيث يتفوق بشكل كبير على الأدوات الحالية التي تعمل بالمعالجات المركزية (CPU) ومعالجات الرسوميات (GPU) عبر استبدال عملية إعادة ترتيب البيانات بأسلوب التدفق (streaming) وتحسين دالات التجزئة (hash functions)، محققاً تسارعاً يصل إلى 375 ضعفاً مع الحفاظ على دقة عالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طالب عبقري (ذكاء اصطناعي) عبر إعطائه مكتبة ضخمة من الكتب ليقرأها. ومع ذلك، تعاني هذه المكتبة من مشكلة: فهي مليئة بآلاف النسخ من نفس القصة، ولكن مع اختلاف بسيط في نوع الخط أو تغيير كلمات قليلة. إذا قرأ الطالب نفس القصة 1,000 مرة، فإنه يضيع وقته في حفظها مراراً وتكراراً بدلاً من تعلم أشياء جديدة. بل قد يبدأ في الاعتقاد بأن هذه القصة هي الشيء الوحيد الذي يهم.
لإصلاح ذلك، تحتاج إلى أمين مكتبة يقوم بالمرور عبر المكتبة، ويجد جميع الكتب المكررة، ويرمي النسخ الزائدة. تسمى هذه العملية إزالة تكرار البيانات (dataset deduplication).
تقدم الورقة البحثية التي قدمتها أميناً جديداً فائق السرعة يُدعى SEDD. وإليك كيف يعمل، مشروحاً ببساطة:
الطريقة القديمة: أمين المكتبة البطيء والمتعب
قبل SEDD، كانت هناك طريقتان رئيسيتان للقيام بهذه المهمة:
- طريقة المعالج المركزي (أمين المكتبة البشري): كانت تشبه إنساناً دقيقاً للغاية يمشي عبر المكتبة، يقرأ كل كتاب، ويقارن بينهم واحداً تلو الآخر. كانت دقيقة ولكنها بطيئة للغاية. إذا كانت لديك مكتبة بحجم الإنترنت (تريليونات الكلمات)، فسيستغرق هذا الإنسان سنوات لينهي عمله.
- طريقة معالج الرسوميات (الروبوت السريع ذو الخطة السيئة): قامت شركة NVIDIA بابتكار روبوت (يُسمى NeMo Curator) يمكنه القراءة بشكل أسرع بكثير من البشر. ومع ذلك، كان لهذا الروبوت عيب: في كل مرة يحتاج فيها إلى مقارنة كتابين، كان عليه الركض ذهاباً وإياباً بين غرف مختلفة لجلب الكتب، وكتابة الملاحظات على الأرض، ونقل أكوام الورق. هذا "الركض ذهاباً وإياباً" (الذي يسمى تبادل البيانات أو data shuffling) كان يهدر الكثير من الوقت، لدرجة أن سرعة الروبوت الفائقة كانت تُهدر غالباً في الانتظار في الطوابير.
الطريقة الجديدة: SEDD (أمين المكتبة فائق الكفاءة)
بنى مؤلفو هذه الورقة نظام SEDD، وهو نظام جديد مصمم خصيصاً للعمل على شرائح حاسوبية قوية تسمى وحدات معالجة الرسوميات (GPUs) (وهي نفس الشرائح المستخدمة في ألعاب الفيديو عالية الأداء). لقد أصلحوا مشاكل الروبوت باستخدام ثلاث حيل ذكية:
1. الختم "المتدحرج" (التجزئة الذكية - Smarter Hashing)
للعثور على التكرارات، يجب على النظام تحويل كل كتاب إلى "بصمة" فريدة (كود).
- الطريقة القديمة: تخيل ختم كل صفحة من صفحات الكتاب بختم حبري ثقيل وبطيء.
- طريقة SEDD: يستخدم SEDD "ختماً متدحرجاً". إذا كان لديك جملة مثل "القط جلس"، ثم انتقلت إلى الجملة التالية "القط جلس على الحصيرة"، فإن SEDD لا يعيد ختم الجملة بأكملة. بل يقوم فقط بمسح كلمة "القط" وختم الجزء الجديد "على الحصيرة". إنه يعيد استخدام العمل الذي قام به للتو. هذا يجعل إنشاء البصمات أسرع بـ 375 مرة من طرق الكمبيوتر القديمة.
2. خط الإنتاج "بدون تبادل" (البث - Streaming)
هذا هو الابتكار الأكبر لـ SEDD.
- الطريقة القديمة: كان الروبوت يجمع كل الكتب، ويرتبها في أكوام على الأرض، ثم يبتعد، ويعود، ويرتبها مرة أخرى، ويكتب النتائج. كانت دورة مستمرة من نقل الصناديق الثقيلة ذهاباً وإياباً.
- طريقة SEDD: يستخدم SEDD نهج البث (streaming). تخيل حزاماً ناقلاً. بينما تتحرك الكتب عبر الحزام، يقوم الروبوت بالإمساك بها، وفحصها، ورمي النسخ المكررة فوراً في سلة المهملات. إنه لا يتوقف أبداً لفرز الكومة بأكملها أولاً. كما أنه يقوم بشيئين في وقت واحد: بينما يفحص كتاباً ما، يكون قد بدأ بالفعل في سحب الكتاب التالي إلى الحزام. هذا يلغي عملية "الركض ذهاباً وإياباً" التي أبطأت الروبوت السابق.
3. الحاويات "ذات الحجم المثالي" (الأوعية الذكية - Smart Buckets)
عند فرز الكتب، تحتاج إلى حاويات. إذا كان لديك الكثير من الحاويات، فستقضي يومك في التنقل بينها. وإذا كان لديك عدد قليل جداً، فستفيض الحاويات وتصبح فوضوية.
- يستخدم SEDD خدعة رياضية خاصة لتحديد العدد المثالي من الحاويات لحجم المكتبة التي يعمل عليها تحديداً. هذا يضمن أن الروبوت مشغول دائماً ولا ينتظر أبداً حتى تفرغ حاوية ما.
النتائج: ما مدى سرعته؟
اختبرت الورقة البحثية نظام SEDD على مكتبات ضخمة (مجموعات بيانات) تحتوي على ملايين المستندات وتريليونات الكلمات.
- مقابل البشر (CPU): كان SEDD أسرع بـ 158 مرة.
- مقابل الروبوت السابق (GPU): كان SEDD أسرع بـ 7.8 مرة.
- الفوز الكبير: تمكن SEDD من تنظيف مكتبة تحتوي على 1.2 تريليون كلمة (كمية هائلة من البيانات المستخدمة لتدريب الذكاء الاصطناعي) في 3 ساعات فقط باستخدام مجموعة مكونة من 32 بطاقة رسوميات قوية.
هل فاته أي تكرار؟
السرعة رائعة، لكن الدقة مهمة أيضاً. إذا رمى أمين المكتبة كتاباً فريداً عن طريق الخطأ، فإن الطالب يفقد المعرفة.
- تظهر الورقة البحثية أن SEDD دقيق للغاية. فقد وجد نفس التكرارات التي وجدها طريقة البشر البطيئة والدقيقة بنسبة 95% أو أكثر.
- عندما اختبروا طالب الذكاء الاصطناعي باستخدام الكتب التي نظفها SEDD، وجدوا أن الطالب أدى بشكل جيد (أو أفضل) من طريقة التدريب على الكتب التي نظفتها الطرق القديمة الأبطأ.
الملخص
SEDD يشبه ترقية طاقم تنظيف المكتبة من إنسان بطيء يحمل لوحة ملاحظات إلى روبوت خط إنتاج عالي السرعة لا يتوقف أبداً عن الحركة، ويعيد استخدام أدواته، ويعرف تماماً كيفية تنظيم الرفوف دون أن يتعب أبداً. إنه يجعل تجهيز البيانات لنماذج الذكاء الاصطناعي الضخمة أمراً سريعاً، وغير مكلف، وفعالاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.