← أحدث الأبحاث
🤖 machine learning

Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems

تقترح هذه الورقة البحثية "المعرفات الدلالية مزدوجة الغرض" (Dual-purpose Semantic IDs)، وهي طريقة تستخدم التكميم الهرمي لتحويل التضمينات الكثيفة إلى رموز منفصلة لكل من الهوية التعاونية وإعادة بناء المحتوى، مما يحقق كفاءة في الإدخال والإخراج بمستوى النماذج اللغوية الكبيرة (LLM) ويُنجح في النشر ضمن أنظمة التوصية ذات النطاق الإنتاجي للتغلب على اختناقات الذاكرة.

المؤلفون الأصليون: Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong

نُشر 2026-07-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Baolei Li, Yiping Yuan, Yilin Zheng, Likang Yin, Ling Liu, Fabio Soldo, Romer Rosales, Xinyang Yi, Lichan Hong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول بناء محرك توصيات فائق لمنصة فيديو ضخمة، محرك يعرف بالضبط ما تريد مشاهدته تالياً. وللقيام بذلك، يحتاج النظام إلى فهم شيئين: من أنت (تاريخك) وما هي الفيديوهات (محتواها). تقليدياً، كانت الحواسيب تخزن هذه المعلومات كقوائم ضخمة وثقيلة من الأرقام تسمى "التضمينات الكثيفة" (dense embeddings). فكر في هذه التضمينات كأنها مخططات هندسية عالية الدقة لكل فيديو ومستخدم على حد حد. وبينما تعد هذه المخططات مفصلة، إلا أنها ثقيلة للغاية في الحمل. وفي كل مرة يحاول فيها الكمبيوتر تقديم اقتراح، يتعين عليه نقل هذه المخططات الثقيلة من غرفة التخزين إلى المعالج، مما يخلق ازدحاماً مرورياً يُعرف باسم "جدار الذاكرة" (Memory Wall). وهذا يبطئ كل شيء، خاصة عندما يكون لديك مليارات المستخدمين والفيديوهات.

على الجانب الآخر من عالم التكنولوجيا، اكتشفت النماذج اللغوية الكبيرة (LLMs) —وهي العقول التي تقف وراء برامج الدردشة الذكية— حيلة ذكية. فهي لا تستخدم مخططات هندسية ثقيلة، بل تستخدم "رموزاً" (tokens) بسيطة ومنفصلة، تشبه الكلمات في الجملة. هذه الرموز خفيفة، سريعة، وسهلة المعالجة. والسؤال الكبير الذي واجه أنظمة التوصية كان: هل يمكننا استبدال تلك المخططات الهندسية الثقيلة والبطيئة بتلك الرموز الخفيفة والسريعة دون فقدان التفاصيل الغنية اللازمة لتقديم اقتراحات جيدة؟ إذا استطعنا ذلك، فقد نتمكن أخيراً من منح أنظمة التوصية نفس السرعة والكفاءة التي تتمتع بها أكثر نماذج الذكاء الاصطناٍعي ذكاءً.

تقترح هذه الورقة البحثية، التي تحمل عنوان "الرموز هي كل ما تحتاجه" (Tokens are All You Need)، حلاً ذكياً لهذه المشكلة عبر تقديم "معرفات دلالية مزدوجة الغرض" (Dual-purpose Semantic IDs). يقترح المؤلفون، الذين يعملون في منصة كبرى لمشاركة الفيديو، أنه يمكننا ضغط تلك المخططات الهندسية الثقيلة للفيديوهات إلى تسلسل قصير من الرموز، تماماً مثل تحويل صورة عالية الدقة إلى رمز بسيط. ولكن هنا تكمن الخدعة السحرية: هذه الرموز تؤدي وظيفتين. أولاً، تعمل كمعرف فريد يساعد النظام على التعلم من تفاعلات المستخدم (مثل الفيديوهات التي نقرت عليها). وثانياً، وهو الأهم، يمكن "فك تشفيرها" فوراً للعودة إلى تقريب تقريبي لتفاصيل الفيديو الأصلية كلما احتاج الكمبيوتر إليها.

اختبر الباحثون هذه الفكرة في نظام إنتاج حقيقي يحتوي على مليارات الأمثلة. ووجدوا أنه من خلال استخدام طريقة "إعادة البناء الفوري" هذه، تمكنوا من تقليل كمية البيانات التي يتعين على النظام نقلها بشكل كبير. وفي تجاربهم، لم يقتصر هذا النهج على توفير المساحة فحسب، بل جعل النظام أسرع وحسّن جودة التوصيات، لا سيما للمستخدمين الجدد أو الفيديوهات غير المشهورة التي لا يملك النظام عنها الكثير من البيانات بعد. تشير الورقة البحثية إلى أنه من خلال التعامل مع البيانات عالية الأبعاد كرموز، يمكن لأنظمة التوصية التحرر من "جدار الذاكرة" وتصبح بكفاءة أكثر نماذج الذكاء الاصطناعي المتقدمة، مما يثبت أنه في بعض الأحيان، أنت حقاً تحتاج فقط إلى الرموز لإنجاز المهمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →