← أحدث الأبحاث
💬 NLP

RexBERT: Context Specialized Bidirectional Encoders for E-commerce

تقدم الورقة البحثية RexBERT، وهي عائلة من مشفرات نمط BERT المتخصصة التي تم تدريبها على مجموعة بيانات ضخمة للتجارة الإلكترونية مكونة من 350 مليار رمز باستخدام وصفة تدريب مسبق ثلاثية المراحل، والتي تتفوق على النماذج العامة الأكبر حجمًا في المهام الخاصة بالمجال رغم امتلاكها عددًا أقل بكثير من المعلمات.

المؤلفون الأصليون: Rahul Bajaj, Anuj Garg

نُشر 2026-02-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rahul Bajaj, Anuj Garg

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث RexBERT، مترجم إلى لغة بسيطة باستخدام تشبيهات من الحياة اليومية.

الفكرة الكبرى: المعرفة المتخصصة مقابل المعرفة العامة

تخيل أن لديك نوعين من أمناء المكتبات:

  1. أمين المكتبة العام (الذكاء الاصطناعي للأغراض العامة): لقد قرأ كل كتاب تقريبًا في العالم. هو يعرف القليل عن كل شيء—التاريخ، الطبخ، العلوم، والأفلام. إنه بارع في المحادثات العامة.
  2. أمين المكتبة المتخصص (RexBERT): هذا الأمين لم يقرأ سوى الكتب المتعلقة بـ التسوق، والمنتجات، والتجزئة. قد لا يعرف الكثير عن الفيزياء الكمية، لكنه خبير مطلق في فهم الفرق بين "فستان أحمر" و"قميص أحمر"، أو معرفة أن "الشاحن" هو مُكمل للهاتف وليس بديلاً له.

تجادل الورقة البحثية بأنه بالنسبة للتجارة الإلكترونية (التسوق عبر الإنترنت)، فإن أمين المكتبة المتخصص هو في الواقع أفضل من العام، حتى لو كان العام أكبر بكثير وقد قرأ كتبًا أكثر بشكل عام.

المشكلة: أمين المكتبة "العام" يصاب بالارتباك

معظم نماذج الذكاء الاصطناعي اليوم يتم تدريبها على الإنترنت بأكم، ورغم أن هذا يجعلها ذكية، إلا أنها غالبًا ما تغفل عن التفاصيل الدقيقة للتسوق.

  • المشكلة: إذا سألت ذكاءً اصطناعيًا عامًا: "هل البطارية بديل لـ الهاتف؟"، فقد يرتبك. في التسوق، البطارية هي مُكمل (تحتاج لكليهما)، وليست بديلًا (لا تستخدم أحدهما مكان الآخر).
  • النتيجة: تعاني النماذج العامة في التمييز بين المنتجات المتشابهة، والمنتجات التي تتماشى مع بعضها البعض، والمنتجات التي لا علاقة لها ببعضها البعض.

الحل: RexBERT

قام المؤلفون ببناء RexBERT، وهي عائلة من نماذج الذكاء الاصطناعي المصممة خصيصًا للتسوق. لم يقوموا فقط بجعل النموذج أكبر؛ بل جعلوا منه نموذجًا أذكى وأكثر تركيزًا باستخدام ثلاث خطوات رئيسية:

1. "Ecom-niverse" (المكتبة المتخصصة)

لتدريب نموذجهم، لم يستطيعوا استخدام الإنترنت بأكمله. كانوا بحاجة إلى مكتبة مليئة ببيانات التسوق.

  • التشبيه: تخيل البحث في جبل هائل من النفايات (الإنترنت بأكره) للعثور فقط على العملات الذهبية (بيانات التسوق).
  • ماذا فعلوا: أنشأوا مجموعة بيانات ضخمة تسمى Ecom-niverse تحتوي على 350 مليار كلمة. استخدموا عملية تصفية ذكية (مثل المنخل عالي التقنية) لاستخراج المحتوى المتعلق بالأزياء، والجمال، والسيارات، والإلكترونيات فقط من مجموعة بيانات ويب ضخمة تسمى FineFineWeb. حتى أنهم استخدموا نماذج ذكاء اصطناعي أخرى للتحقق من أن البيانات تتعلق بالتسوق بالفعل وليس مجرد إعلانات أو أخبار عشوائية.

2. "وصفة الطهي ذات الثلاث مراحل" (منهج التدريب)

لا يمكنك إلقاء نموذج في مجموعة بيانات التسوق مباشرة؛ يجب أن يتعلم الأساسيات أولًا. استخدم المؤلفون وصفة تدريب مكونة من ثلاث خطوات:

  • المرحلة 1: التعليم العام. أولاً، علموا النموذج مزيجًا من كل شيء (الكتب، البرمجة، الأخبار، ونصوص الويب). منحهم هذا أساسًا متينًا في كيفية عمل اللغة.
  • المرحلة 2: تمديد الأرجل. صفحات التسوق يمكن أن تكون طويلة جدًا (فكر في صفحة منتج تحتوي على عنوان، ووصف طويل، وقائمة تضم 20 ميزة). علموا النموذج التعامل مع النصوص الطويلة جدًا (حتى 8,192 كلمة) حتى لا يضطر لقطع التفاصيل المهمة.
  • المرحلة 3: "معسكر تدريب التسوق" (التسخين/Annealing). أخيرًا، قاموا بتحويل التدريب تدريجيًا للتركيز بالكامل تقريبًا على بيانات التسوق من Ecom-niverse. استخدموا تقنية خاصة تسمى Guided MLM، وهي تشبه معلمًا يشير إلى أهم الكلمات في الجملة (مثل "مقاوم للماء" أو "مقاس 10") ويقول: "انتبه جيدًا لهذه الكلمات!". يساعد هذا النموذج على تعلم لغة المنتجات المحددة.

3. النتيجة: صغير ولكن قوي

بنى المؤلفون نماذج RexBERT بأحجام مختلفة، من الصغير جدًا (17 مليون معلمة) إلى الكبير (400 مليون معلمة).

  • المفاجأة: على الرغم من أن نماذجهم كانت أصغر بمقدار 2 إلى 3 مرات من النماذج العامة الشهيرة والكبيرة، إلا أنها حققت أداءً أفضل في مهام التسوق.
  • الدليل: عند اختبارهم في مهام مثل:
    • ملء الفراغات: تخمين الكلمات المفقودة في عنوان المنتج.
    • مطابقة المنتجات: تحديد ما إذا كان عنصران هما نفس الشيء، أو متشابهان، أو غير مرتبطين.
    • الذكاء العام: حتى في الاختبارات غير المتعلقة بالتسوق (مثل فهم النكات أو القواعد)، كانت هذه الخبراء الصغار في مجال التسوق جيدين بشكل مفاجئ، وغالبًا ما تفوقوا على النماذج العامة الأكبر حجمًا.

لماذا هذا مهم (وفقًا للورقة البحثية)

تدعي الورقة أن جودة البيانات + خطة تدريب جيدة هي أكثر أهمية من مجرد جعل النموذج ضخمًا.

  • التشبيه: من الأفضل أن يكون لديك خبير مدرب تدريبًا عاليًا يعرف القواعد المحددة للعبة، من أن يكون لديك حشد ضخم غير مدرب يعرف القليل عن كل شيء.
  • الخلاصة: إذا كنت تريد ذكاءً اصطناعيًا لوظيفة محددة (مثل الرعاية الصحية، أو القانون، أو التسوق)، فلا تحتاج إلى بناء ذكاء اصطناعي ضخم "شبه إلهي". أنت فقط بحاجة إلى تغذيته بالبيانات الصحيحة والمتخصصة وتعليمه بعناية.

الملخص

RexBERT هو أداة ذكاء اصطناعي جديدة للتسوق عبر الإنترنت. تم بناؤه من خلال:

  1. جمع مكتبة ضخمة ونظيفة من نصوص التسوق.
  2. التدريب في ثلاث خطوات: التعلم العام \leftarrow تعلم النصوص الطويلة \leftarrow تعلم التسوق المتخصص.
  3. إثبات أن نموذجًا أصغر ومتخصصًا يمكنه التغلب على النماذج العامة الأكبر في فهم المنتجات، واستعلامات البحث، ونوايا العملاء.

لقد نشر المؤلفون بياناتهم وطرقهم لكي يتمكن أي شخص من بناء "أمناء مكتبة متخصصين" مماثلين للمجالات الأخرى، وليس فقط للتسوق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →