Lakestream: A Consistent and Brokerless Data Plane for Large Foundation Model Training
تُعد Lakestream طبقة بيانات (data plane) خالية من الوسيط (brokerless) وأصلية في تخزين الكائنات (object-store-native) لتدريب النماذج التأسيسية الضخمة، حيث تقدم دفعات عالمية معاملاتية (Transactional Global Batches) وخوارزمية التزام تكيفي لامركزية (Decentralized Adaptive Commit) لتوفير اتساق شبيه بخصائص ACID، وعزل للفشل، واستيعاب عالي الإنتاجية مع زمن انتقال أقل من الحلول الحالية القائمة على طوابير الرسائل أو الحلول المتمركزة (colocated).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت عملاق فائق الذكاء (نموذج تأسيسي ضخم) كيف يفهم العالم. وللقيام بذلك، تحتاج إلى تغذيته بكميات هائلة من البيانات، مثل الفيديوهات والصور والنصوص، "دفعة" واحدة في كل مرة.
في الماضي، كان إطعام هذا الروبوت يشبه حزامًا ناقلًا بسيطًا في مصنع؛ حيث كانت البيانات معبأة مسبقًا في صناديق، وكان الحزام ينقلها إلى الروبوت بوتيرة ثابتة. لكن الذكاء الاصطناعي الحديث مختلف تمامًا. فالبيانات فوضوية، وضخمة، ويتغير حجمها بناءً على ما تحتويه. أحيانًا، يحتاج ملف فيديو واحد إلى تفكيك وتوسيع ليصبح أكبر بـ 1,000 مرة قبل أن يتمكن الروبوت من استخدامه.
السيور الناقلة القديمة (الأنظمة الموجودة حاليًا) لم تستطع التعامل مع ذلك. فإما أن تنسد، أو إذا أسقط أحد العمال صندوقًا واحدًا، يتوقف المصنع بأكمله.
إليك Lakestream: مستوى البيانات "الذكي واللامركزي" (Brokerless).
قام مؤلفو هذه الورقة البحثية ببناء نظام جديد يسمى Lakestream. فكر في Lakestream كطريقة ثورية لتنظيم عملية تسليم البيانات لهذه النماذج الضخمة للذكاء الاصطيعي. وإليك كيف يعمل، باستخدام تشبيهات بسيطة:
1. المشكلة في الطرق القديمة
- مشكلة "التواجد في نفس المكان" (المطبخ داخل الصالة الرياضية): تخيل أن الروبوت (المدرب) يرفع الأثقال، والشخص الذي يجهز طعامه (محمل البيانات) يقف بجانبه تمامًا في نفس الغرفة الصغيرة. إذا استغرق تجهيز الطعام وقتًا طويلاً، سيتعين على الروبوت التوقف عن رفع الأثقال. وإذا تعثر شخص تجهيز الطعام وسقط، سيتوقف الروبوت للأبد. إنهما متشابكان للغاية.
- مشكلة "طابور الرسائل" (الساعي المرتبك): تخيل استخدام مكتب بريد مركزي (مثل Kafka) لتوصيل البيانات. يتعامل مكتب البريد مع كل ورقة كرسالة منفصلة، لكن الروبوت يحتاج إلى وجبة كاملة (دفعة/Batch) دفعة واحدة. إذا قام مكتب البريد بتسليم جزء "الدجاج" من الوجبة إلى ذراع روبوت واحدة، وجزء "الأرز" إلى ذراع أخرى في أوقات مختلفة، فسيصاب الروبوت بالارتباك ويتعلم أشياء خاطئة. كما أن مكتب البريد يمثل نقطة فشل واحدة؛ فإذا مرض مدير مكتب البريد، لن يتلقى أحد طعامه.
2. حل Lakestream: مستودع رقمي مشترك
يتخلص Lakestream من مكتب البريد المركزي والمطبخ الضيق. بدلاً من ذلك، يستخدم تخزين كائنات (Object Storage) مشتركًا وضخمًا (مثل مستودع رقمي لا نهائي، مثل Amazon S3) وسجل بيانات إصداري (Versioned Manifest) (سجل رئيسي).
إليك "الخدع السحرية" الثلاث التي يستخدمها Lakestream:
أ. "الدفعة العالمية المتكاملة والمعاملاتية" (الوجبة المثالية)
في الأيام الخوالي، كانت البيانات مجرد تدفق من السجلات الفردية. أما Lakestream فيعامل "الدفعة" الكاملة من البيانات كوحدة واحدة غير قابلة للتجزئة تسمى الدفعة العالمية المتكاملة والمعاملاتية (TGB).
- التشبيه: تخيل طباخًا يجهز مأدبة كاملة. الطعام مطهو وموضوع على الطاولة، لكنه مغطى بغطاء. الغطاء مغلق بإحكام. لا يمكن لأحد رؤية الطعام بعد.
- السحر: عندما يتأكد الطباخ من جاهزية المأدبة بأكملها، يقوم بتبديل مفتاح في السجل الرئيسي (Manifest). فجأة، يُرفع الغطاء، وترى كل أذرع الروبات الوجبة الكاملة والمثالية في اللحظة ذاتها تمامًا. إذا أسقط الطباخ طبقًا قبل تبديل المفتاح، يظل الغطاء مغلقًا ولا يرى أحد الفوضى. هذا يضمن أن الجميع يعمل دائمًا مع نفس البيانات.
ب. "الالتزام التكيفي اللامركزي" (إشارة المرور الذكية)
عندما يحاول العديد من الطهاة (المنتجين) تحديث السجل الرئيسي في نفس الوقت، قد يحاولون الكتابة على نفس الصفحة، مما يسبب تعارضًا.
- الطريقة القديمة: كانوا سيستمرون في الطرق على الباب حتى يسمح لهم أحد بالدخول، مما يهدر الوقت.
- طريقة Lakestream (DAC): يمتلك الطهاة إيقاعًا ذكيًا يعلمونه بأنفسهم. يراقبون مدى انشغال السجل. إذا أصبح السجل ضخمًا وأصبحت التحديثات بطيئة، فإنهم ينتظرون تلقائيًا لفترة أطول قليلًا قبل محاولة الكتابة مرة أخرى. وإذا كان الوضع هادئًا، يكتبون بشكل أسرع. يفعلون ذلك دون التحدث مع بعضهم البعض، فقط من خلال مراقبة السجل. هذا يحافظ على تدفق حركة المرور بسلاسة حتى عندما يعمل مئات الطهاة في آن واحد.
ج. "دورة الحياة المتوافقة مع نقاط التحقق" (صندوق حفظ الزمن)
غالبًا ما تحتاج نماذج الذكاء الاصطناعي إلى "حفظ تقدمها" (Checkpoint) وأحيانًا العودة إلى نقطة حفظ سابقة لتجربة مسار مختلف.
- المشكلة: في الأنظمة القديمة، بمجرد استهلاك البيانات، تختفي. إذا احتجت للعودة، فلن تستطيع.
- طريقة Lakestream: يحتفظ النظام بتاريخ كل وجبة تم تقديمها، مرتبطة بنقطة "حفظ" محددة للروبوت. عندما يحفظ الروبوت تقدمه، فإنه يكتب أيضًا "علامة مائية" (خط أمان) في السجل. يعرف النظام أنه يجب عليه الاحتفاظ بكل البيانات قبل هذا الخط آمنة ومحفوظة. وهو يحذف البيانات القديمة فقط عندما يتأكد من أن لا نقطة حفظ لأي روبوت تحتاج إليها. هذا يعني أنه يمكنك إعادة الزمن إلى الوراء تمامًا دون فقدان بياناتك، ودون أن تدفع ثمن تخزين بيانات لا يحتاجها أحد.
3. النتائج
اختبر الباحثون هذا النظام على 64 وحدة معالجة رسومية (GPUs) قوية مع مجموعات ضخمة من بيانات الفيديو والصور.
- السرعة: كان أسرع بمقدار 2.7 إلى 7.7 مرة من أفضل الأنظمة "المتواجدة في نفس المكان" (حيث يتم إعداد البيانات والتدريب معًا).
- الموثوقية: تعامل مع حالات الفشل بشكل أفضل بكثير. إذا تعطل أحد عمال إعداد البيانات، يستمر الروبوت في التدريب دون توقف.
- الكفاءة: كان أسرع بكثير من استخدام طابور رسائل مركزي (مثل Kafka)، الذي عانى لمواكبة حجم وتعقيد البيانات.
ملخص
Lakestream يشبه استبدال طريق ضيق وفوضوي بنظام طريق سريع ذكي ولامركزي. فهو يستخدم مستودعًا مشتركًا وسجلًا رئيسيًا لضمان ما يلي:
- يحصل الجميع على نفس "الدفعة" من البيانات في نفس الوقت تمامًا.
- يظل النظام يتحرك بسرعة حتى عندما تصبح حركة المرور كثيفة.
- يمكنك إعادة عملية التدريب إلى أي نقطة في التاريخ دون فقدان بياناتك.
يحقق كل هذا دون الحاجة إلى مدير مركزي (وسيط) ليخبر الجميع بما يجب فعله، مما يجعله أسرع، وأرخص، وأكثر موثوقية لتدريب أكبر نماذج الذكاء الاصطناعي في العالم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.