← أحدث الأبحاث
💻 computer science

Versioned Late Materialization for Ultra-Long Sequence Training in Recommendation Systems at Scale

تقدم هذه الورقة نموذجًا للمواد المتأخرة بنظام الإصدارات (versioned late materialization) يقضي على تكرار البيانات في تدريب التسلسلات فائقة الطول عبر تخزين سجل تفاعلات المستخدم لمرة واحدة وإعادة بناء التسلسلات في الوقت المناسب، مما يتغلب على اختناقات التخزين والإدخال/الإخراج لتمكين نماذج التوصية بالتعلم العميق القابلة للتوسع وعالية الجودة.

المؤلفون الأصليون: Liang Guo, Ge Song, Litao Deng, Jianhui Sun, Chufeng Hu, Lu Zhang, Zhen Ma, Shouwei Chen, Weiran Liu, Sarang Masti Sreeshylan, Xiaoxuan Meng

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Liang Guo, Ge Song, Litao Deng, Jianhui Sun, Chufeng Hu, Lu Zhang, Zhen Ma, Shouwei Chen, Weiran Liu, Sarang Masti Sreeshylan, Xiaoxuan Meng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مكتبة ضخمة حيث تريد تعليم روبوت فائق الذكاء (نموذج الذكاء الاصطناعي) كيفية ترشيح الفيلم المثالي لكل شخص يدخل إليك.

وللقيام بذلك، يحتاج الروبوت إلى معرفة تاريخ المستخدم الكامل: ما الذي شاهده، وما الذي أعجبه، أو ما الذي تجاوزه خلال السنوات القليلة الماضية. وهذا ما يسمى تاريخ تفاعل المستخدم (UIH).

الطريقة القديمة: مشكلة "الصف العريض"

في الماضي، كان لدى المكتبة طريقة غير فعالة للغاية في تنظيم هذا الأمر. فكلما احتاج الروبوت إلى دراسة مستخدم ما، كان أمناء المكتبة يقومون بتصوير تاريخ ذلك المستخدم بالكامل ولصقه في ورقة واحدة لجلسة الدراسة المحددة تلك.

إذا احتاج الروبوت لدراسة 1,000 مستخدم مختلف، وكان لكل مستخدم تاريخ يتكون من 10,000 حدث، فسيتعين على أمناء المكتبة إنشاء 1,000 ورقة منفصلة، كل منها يحتوي على 10,000 حقيقة مكررة.

  • المشكلة: أدى هذا إلى إنشاء "صف عريض" من البيانات. نفدت مساحة الأرفف في المكتبة (التخزين) وقضى أمناء المكتبة وقتهم في نسخ الأوراق (الإدخال/الإخراج) بدلاً من تعليم الروبوت فعلياً.
  • عنق الزجاجة: أصبحت تكلفة نسخ وتخزين هذه التواريخ الضخمة والمكررة عالية جداً لدرجة أنها أصبحت تكلف أكثر من أجهزة الكمبيوتر (GPUs) المستخدمة لتدريب الروبوت. لقد كان الأمر أشبه بإنفاق المزيد من المال على تصوير الورق أكثر مما ينفق على المعلم.

الحل الجديد: التجسيد المتأخر المعتمد على الإصدارات (Versioned Late Materialization)

أدرك الباحثون في ميتا (Meta) أنهم ليسوا بحاجة لتصوير التاريخ في كل مرة. أدركوا أن تاريخ المستخدم يشبه شارعاً باتجاه واحد: أنت تضيف أحداثاً جديدة في النهاية، لكنك لا تعود أبداً لتغيير الماضي.

لقد ابتكروا نظاماً جديداً يسمى التجسيد المتأخر المعتمد على الإصدارات. وإليك كيف يعمل باستخدام تشبيه بسيط:

1. الكتاب الرئيسي الواحد (التخزين الطبيعي - Normalized Storage)
بدلاً من تصوير التاريخ لكل طالب، تحتفظ المكتبة بكتاب رئيسي واحد مثالي لكل تاريخ مستخدم. يتم تحديث هذا الكتاب مرة واحدة يومياً ولا يتم تغييره بعد ذلك (إنه "غير قابل للتغيير" - immutable).

2. بطاقة الفهرس الصغيرة (المؤشرات المعتمدة على الإصدارات - Versioned Pointers)
عندما يحتاج الروبوت لدراسة مستخدم معين في وقت محدد (على سبيل المثال، "ماذا عرف المستخدم (أ) يوم الثلاثاء الساعة 2 ظهراً؟")، لا يقوم أمناء المكتبة بنسخ الكتاب بأكمله. بدلاً من ذلك، يكتبون بطاقة فهرس صغيرة لهذه الجلسة التدريبية.

  • تقول البطاقة ببساطة: "اذهب إلى الكتاب الرئيسي، وانظر في الصفحات من 100 إلى 500، وتوقف عند المدخل الخاص بالساعة 2 ظهراً."
  • هذه البطاقة صغيرة (بيانات وصفية خفيفة الوزن) مقارنة بالكتاب بأك ফুল.

3. إعادة البناء في الوقت المناسب (Just-in-Time Reconstruction)
عندما يكون الروبوت مستعداً للتعلم، يقوم النظام بسرعة بقلب الصفحات المحددة في الكتاب الرئيسي باستخدام بطاقة الفهرس ويقوم بتجميع التاريخ في تلك اللحظة تحديداً. هذا هو "التجسيد المتأخر" (Late Materialization)—أي بناء البيانات فقط عندما تكون مطلوبة فعلياً، وليس مسبقاً.

لماذا يعد هذا تغييراً جذرياً

حل مشكلة "تسرب المستقبل" (مشكلة السفر عبر الزمن)
في أنظمة الترشيح، يجب أن تكون حذراً حتى لا تجعل الروبوت "يغش" برؤية أحداث وقعت بعد اللحظة التي كان من المفترض أن يتخذ فيها قراراً.

  • يستخدم النظام الجديد بروتوكول "السفر عبر الزمن". تقوم بطاقة الفهرس بقفل الوقت. حتى لو تم تحديث الكتاب الرئيسي بأحداث جديدة لاحقاً، فإن الروبوت سيرى فقط نسخة الكتاب التي كانت موجودة في تلك اللحظة المحددة في الماضي. هذا يضمن أن الروبوت يتعلم بالضبط ما كان سيراه البشر في الوقت الفعلي.

فائدة تعدد المستأجرين (فصول دراسية مختلفة)
تخيل أن المكتبة تخدم نوعين من الطلاب:

  • الطالب (أ): يحتاج لقراءة آخر 10,000 صفحة (نموذج معقد).
  • الطالب (ب): يحتاج فقط لآخر 100 صفحة (نموذج بسيط).
  • الطريقة القديمة: حصل كلا الطالبين على نسخة مصورة من الـ 10,000 صفحة كاملة. الطالب (ب) أضاع وقتاً في قراءة صفحات لم يكن بحاجة إليها.
  • الطريقة الجديدة: بطاقة الفهرس الخاصة بالطالب (ب) تقول فقط "اقرأ الصفحات من 100 إلى 200". يقوم النظام بجلب تلك الصفحات المحددة فقط. وهذا يوفر الكثير من الطاقة والوقت.

النتائج

من خلال الانتقال من "تصوير كل شيء" إلى "استخدام بطاقات الفهرس لجلب صفحات محددة"، حققت ميتا:

  1. توفير هائل: قللوا كمية البيانات التي يتعين عليهم تخزينها ونقلها بنسبة تقارب 50%.
  2. تدريب أسرع: توقفت أجهزة الكمبيوتر (GPUs) عن الانتظار للحصول على البيانات وبدأت تتعلم بشكل أسرع.
  3. روبوتات أفضل: لأنهم استطاعوا أخيراً تحمل تكلفة تغذية الروبوت بتواريخ أطول بكثير (ما يصل إلى 64,000 حدث بدلاً من 4,000 فقط)، أصبح الروبوت أفضل بكثير في ترشيح المحتوى.

باختصار: لقد توقفوا عن إضاعة المال والوقت في نسخ نفس التاريخ مراراً وتكراراً. بدلاً من ذلك، بنوا نظام أرشفة ذكياً وقادراً على السفر عبر الزمن، يسمح للذكاء الاصطناعي بقراءة ما يحتاجه بالضبط، في الوقت الذي يحتاجه تماماً، مما يؤدي إلى ترشيحات أذكى دون كسر الميزانية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →