ملخص تقني: الرموز (Tokens) هي كل ما تحتاجه: معرفات دلالية مزدلة الغرض لتحقيق كفاءة إدخال/إخراج بمستوى النماذج اللغوية الكبيرة (LLM) في أنظمة التوصية
1. بيان المشكلة
تواجه أنظمة التوصية واسعة النطاق اختناقًا حرجًا يُعرف بـ "جدار الذاكرة" (Memory Wall)، ناتجًا عن الاعتماد على جداول تضمين (Embedding Tables) كثيفة وضخمة من الأرقام العائمة (Floating-point). وبينما تتوسع النماذج اللغوية الكبيرة (LLMs) بكفاءة بفضل فضاء الرموز المنفصل الموحد وطبيعتها المعتمدة على الحوسبة (Compute-bound)، فإن أنظمة التوصية تتقيد بمتطلبات الإدخال/الإخراج (I/O) ونطاق عرض النطاق الترددي للذاكرة اللازم لاستيعاب وتخزين ودمج المتجهات المستمرة عالية الأبعاد (مثل تاريخ المستخدم، وتضمينات المحتوى) أثناء التدريب والاستنتاج.
يصبح هذا القيد حادًا بشكل خاص مع تطور الأنظمة للتعامل مع الأنشطة المتسلسلة للمستخدمين التي يتوسع طولها ليصل إلى 104 أو أكثر. وتتسبب النهج التقليدية التي تحاول دمج إشارات المحتوى الغنية عبر التضمينات الكثيفة في آثار جسيمة على حجم البيانات وزمن الاستجابة في الخدمة. علاوة على على ذلك، بينما قدمت "الاسترجاع التوليدي" (Generative Retrieval) رموزًا دلالية لاستبدال المعرفات الفئوية، إلا أن الطرق الحالية تعامل هذه الرموز كمعرفات فقط، وتفشل في استغلالها لإعادة بناء ميزات المحتوى المستمرة عالية الأبعاد بكفاءة.
2. المنهجية: المعرفات الدلالية مزدوجة الغرض
يقترح المؤلفون إطار عمل يقوم بتحويل تضمينات المحتوى المستمرة عالية الأبعاد إلى تسلسلات رموز منفصلة ومدمجة. يستلهم هذا النهج من تقنيات ضغط بيانات الرؤية الحاسوبية (تحديدًا VQ-VAE و VQGAN)، مما يثبت أن البيانات المكانية المستمرة يمكن ضغطها إلى رموز منفصلة دون فقدان المعنى الدلالي.
تتكون المنهجية الأساسية من دورين متزامنين للرموز الدلالية (Si) المولدة:
أ. توليد المعرف الدلالي عبر التكميم (Quantization)
يتم ضغط تضمينات المحتوى عالية الأبعاد (ei∈Rd)، المستمدة عادةً من نماذج متعددة الوسائط مسبقة التدريب، إلى تسلسل من K من الرموز المنفصلة باستخدام التكميم الهرمي (مثل التكميم المتبقي أو RQ-VAE).
Si=[ti,1,ti,2,…,ti,K]
يقلل هذا من متطلبات التخزين من d×32 بت إلى K×log2(V) بت، محققًا نسب ضغط تترا-وحول 50-100 ضعف.
ب. إطار العمل مزدوج الغرض
يستخدم إطار العمل هذه الرموز لوظيفتين متزامنتين داخل نموذج التوصية:
الهوية التعاونية (التعلم داخل الرسم البياني - In-Graph Learning): يتم التعامل مع تسلسل الرموز كسمات فئوية (Categorical Features). يتعلم النموذج تضمينات لكل رمز (أو تركيبات n-gram) لالتقاط أنماط التفاعل بين المستخدم والعنصر. وتشمل الاستراتيجيات:
- Unigram: تضمينات الرموز المستقلة.
- Overlapping Bigram: نافذة منزلقة لالتقاط الانتقالات المحلية.
- Nested N-gram: بادئات هرمية لفرض التجميع الدلالي (على سبيل المثال، تشترك جميع فيديوهات "الجاز" في تضمين مستوى علوي واحد).
- نموذج Sentence Piece (SPM): دمج الرموز بشكل تكيفي بناءً على توزيع البيانات.
يتعامل هذا المكون مع الحفظ والتعميم، خاصة بالنسبة للعناصر ذات البداية الباردة (Cold-start) والعناصر ذات الذيل الطويل (Long-tail).
إعادة بناء المحتوى (SiDec): لاستعادة إشارة المحتوى "النقية" دون تكلفة دمج المتجهات الكثيفة، يستخدم النظام مفكك شفرة دلالي (fθ).
- العملية: يتم البحث عن الرموز الدلالية Si في كتاب شفرة ثابت (ϕ) لاسترجاع التضمينات الكامنة، والتي يتم تمريرها بعد ذلك عبر مفكك شفرة خفيف الوزن (MLP أو Transformer ضحل) لإعادة بناء تقريب للتضمين الأصلي (e^i).
- التكامل: تحدث عملية إعادة البناء هذه أثناء التشغيل (On-the-fly) داخل رسم النموذج البياني. وهي تحل محل الحاجة لتخزين أو تسجيل المتجهات الكثيفة في بيانات التدريب. يمكن أن يكون مفكك الشفرة مجمدًا (باستخدام كتاب شفرة مسبق التدريب) أو قابلًا للتدريب (للمواءمة مع مهام لاحقة محددة).
3. المساهمات الرئيسية
- إطار عمل مبتكر مزدوج الغرض: يقدم البحث نظامًا يعالج "جدار الذاكرة" من خلال دمج تعلم المعرف الدلالي القياسي مع فك تشفير المعرف الدلالي (SiDec) أثناء التشغيل. يوازن هذا بين حفظ العناصر النوعي (عبر الرموز المنفصلة) والتعميم المدرك للمحتوى (عبر المحتوى المعاد بناؤه مستمرًا).
- اختراق في كفاءة الإدخال/الإخراج (I/O Efficiency): من خلال استبدال تخزين المتجهات الضخمة بإعادة البناء عند الطلب، يقلل الإطار بشكل كبير من بصمة البيانات والعبء على النظام. إنه ينقل عبء النظام من استرجاع المتجهات الكثيفة المرتبط بالقرص إلى إعادة البناء أثناء التشغيل المرتبط بالحوسبة.
- التحقق على نطاق الإنتاج: يقدم المؤلفون أدلة تجريبية واسعة النطاق من منصة مشاركة فيديو كبرى (YouTube)، مما يثبت فعالية الإطار في كل من نماذج الترتيب والاسترجاع.
4. النتائج التجريبية
تم تقييم الإطار من خلال اختبارات مرجعية غير متصلة (Offline) واختبارات A/B عبر الإنترنت في بيئة الإنتاج.
التقييم غير المتصل (نموذج الاسترجاع)
قارنت الدراسة خمسة أذرع تجريبية لتحليل المقايضة بين دقة التمثيل وإنتاجية التدريب:
- التحكم (Control): معرفات قياسية، بدون تضمينات محتوى (أعلى إنتاجية: 16.80 خطوة/ثانية، أدنى جودة).
- الذراع 1 (Raw Dense): استيعاب مباشر لتضمينات مكونة من 64 بُعدًا (تحسنت الجودة، لكن الإنتاجية انخفضت بنسبة 28.2% إلى 12.07 خطوة/ثانية بسبب اختناقات الإدخال/الإخراج).
- الذراع 2 و3 (SiDec): استخدام مفككات شفرة كتاب الشفرة (v0 و v1). استعادت هذه الأذرع الإنتاجية إلى ~15.3 خطوة/ثانية (قريبة من مستويات التحكم) مع الحفاظ على جودة نهج المتجهات الكثيفة الخام أو تجاوزها.
- الذراع 4 (SiDec + Scaling): الجمع بين كتاب الشفرة v1 وتوسيع البنية المعمارية حقق أفضل خسارة عالمية (2.681) وأفضل معدل إصابة عند 100 (0.2910)، مع تسريع في الإنتاجية بنسبة 20.4% مقارنة بنهج المتجهات الكثافة الخام.
الخلاصة: نجح التقطيع إلى رموز (Tokenization) في كسر اختناق الإدخال/الإخراج، مما سمح بالتوسع المتزامن لعمق النموذج ودقة الاسترجاع.
النشر عبر الإنترنت
تم نشر الإطار في نماذج ترتيب متعددة المهام ونماذج استرجاع ترانسفورمر تأسيسية.
- نماذج الترتيب (Ranking Models): أدى إضافة تدفق إعادة بناء محتوى SiDec إلى سمات المعرف الدلالي الموجودة إلى مكاسب كبيرة في "التفاعل المرضي عبر الإنترنت" (مقياس مركب لوقت المشاهدة والتفاعلات).
- ترتيب صفحة المشاهدة (Watchpage Ranking): تحسن بنسبة +0.80%.
- ترتيب الصفحة الرئيسية (Homepage Ranking): تحسن بنسبة +0.22%.
- نماذج الاسترجاع (Retrieval Models): تحسن بنسبة +0.13% في الصفحة الرئيسية.
- الأثر: كانت التحسينات ذات دلالة إحصائية واستفادت بشكل غير متناسب من الحسابات الناشئة ذات التاريخ الضئيل والمحتوى طويل الذيل، مما خفف بفعالية من انحياز الشعبية.
5. الأهمية والادعاءات
يزعم البحث أن "الرموز (Tokens) هي كل ما تحتاجه" للحصول على توصيات غنية بالمحتوى وعالية الكفاءة. تكمن أهمية هذا العمل في تحوله الفلسفي والمعماري:
- فك الارتباط عن الإدخال/الإخراج المستمر: يجادل المؤلفون بأن التوزيعات المستمرة عالية الأبعاد لا تحتاج إلى معالجتها بتنسيق الأرقام العائمة الأصلي للاحتفاظ بالقوة التنبؤية. من خلال تقطيع مساحة السمات بأكملها (بما في ذلك سياق المستخدم، والكثافات التاريخية، وتضمينات المحتوى) إلى مفردات موحدة من الرموز المنفصلة، يمكن لأنظمة التوصية فك الارتباط عن عمليات الإدخال/الإخراج المستمرة للأرقام العائمة.
- المواءمة مع قوانين توسع النماذج اللغوية الكبيرة (LLM Scaling Laws): يتماشى هذا النهج مع قوانعة توسع الأجهزة المعتمدة على الحوسبة التي تتمتع بها النماذج اللغوية الكبيرة، بعيدًا عن قيود الذاكرة التي تفرضها التضمينات الكثيفة التقليدية.
- المنفعة المزدوجة: يثبت إطار العمل أن الرموز المنفصلة يمكن أن تخدم غرضين: العمل كسمات فئوية مهيكلة للتصفية التعاونية، وكتمثيلات مضغوطة لإعادة البناء أثناء التشغيل، مما يلغي الحاجة إلى جداول تضمين منفصلة وثقيلة.
يخلص المؤلفون إلى أن هذا النموذج يوفر مسارًا للتعامل مع تسلسلات المستخدمين فائقة الطول ومساحات السمات الضخمة دون التكاليف الباهظة المرتبطة بتخزين واسترجاع المتجهات الكثيفة التقليدية.