← أحدث الأبحاث
🤖 AI

Succeeding at Scale: Automated Dataset Construction and Query-Side Adaptation for Multi-Tenant Search

تقدم هذه الورقة DevRev-Search، وهو معيار مؤتمت لاسترجاع الدعم الفني، وتقترح استراتيجية التكيف الحافظ للفهرس (Index-Preserving Adaptation) التي تعمل على ضبط مشفر الاستعلام فقط لتحقيق بحث متعدد المستأجرين عالي الأداء وقابل للتوسع دون التكلفة الباهظة لإعادة الفهرسة.

المؤلفون الأصليون: Prateek Jain, Shabari S Nair, Ritesh Goru, Prakhar Agarwal, Ajay Yadav, Yoga Sri Varshan Varadharajan, Constantine Caramanis

نُشر 2026-03-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Prateek Jain, Shabari S Nair, Ritesh Goru, Prakhar Agarwal, Ajay Yadav, Yoga Sri Varshan Varadharajan, Constantine Caramanis

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مكتبة ضخمة وصاخبة تخدم آلاف الأحياء المختلفة (المستأجرين). لكل حي مجموعته الفريدة من الكتب، والقواعد، واللغة العامية الخاصة به. هدفك هو بناء روبوت أمين مكتبة فائق الذكاء يمكنه العثور فوراً على الكتاب المناسب لأي سؤال يطرحه الزائر.

ومع ذلك، تواجه مشكلتين هائلتين:

  1. مشكلة "البيانات المظلمة": لديك ملايين الكتب، لكن لا أحد كتب "بطاقات مراجعة" توضح أي الكتب هي الإجابات الجيدة لأسئلة محددة. إنه يشبه امتلاك مكتبة حيث الكتب موجودة، لكن الفهرس فارغ. لا يمكنك تدريب الروبوت الخاص بك لأنك لا تعرف ما الذي يبدو "جيداً".

  2. ضريبة "إعادة الرفوف": في كل مرة تريد فيها تعليم روبوتك خدعة جديدة، يتعين عليك عادةً إخراج كل كتاب من الرف، وإعادة قراءته، ثم إعادة ترتيبه في مكان جديد. إذا كان لديك 1,000 حي، فإن القيام بذلك لكل تحديث سيستغرق وقتاً طويلاً وسيكلف ثروة.

تقدم هذه الورقة البحثية، "النجاح على نطاق واسع" (Succeeding at Scale)، طريقة جديدة لحل كلتا المشكلتين. إليك كيف فعلوا ذلك، مشروحاً ببساطة:

1. بناء دليل التدريب بدون بشر (خط إنتاج "المحقق الذكاء الاصطناعي")

عادةً، تحتاج إلى خبراء بشريين لقراءة الأسئلة وتحديد الإجابة الصحيحة لتدريب محرك البحث. لكن هذا بطيء ومكلف.

قام المؤلفون ببناء مصنع آلي لإنشاء بيانات التدريب هذه:

  • رحلة البحث عن الكنز: بدلاً من الاعتماد على أداة بحث واحدة، أرسلوا فريقاً من سبعة "كشافين" مختلفين (بعضهم يبحث عن تطابق الكلمات الدقيقة، والبعض الآخر يبحث عن المعنى). قاموا بجمع كل إجابة ممكنة يمكن لهؤلاء الكشافين العثء عليها.
  • القاضي: بعد ذلك، استخدموا ذكاءً اصطناعياً فائق الذكاء (LLM) ليكون بمثابة "القاضي". نظر هذا القاضي إلى كومة الإجابات وسأل: "هل تجيب هذه حقاً على السؤال، أم أنها مجرد تشتيت يبدو جذاباً؟"
  • النتيجة: قام الذكاء الاصطناعي بتصفية النفايات والاحتفاظ بالذهب فقط. لقد أنشأوا مجموعة بيانات تدريب ضخمة وعالية الجودة (تسمى DevRev-Search) دون أن يضطر إنسان واحد لتصنيف وثيقة واحدة يدوياً.

2. التجميل "من جانب واحد" (التكيف المحافظ على الفهرس)

هذا هو الاختراق الأكبر للورقة البحثية.

في الطريقة القديمة، لجعل أمين المكتبة أكثر ذكاءً، كان عليك إعادة تنظيم المكتبة بأكملها (الوثائق) في كل مرة.

  • الطريقة القديمة: تخيل أنك تريد تعليم أمين المكتبة كيفية فهم لغة حي جديد. عليك إعادة ترتيب كل كتاب في المبنى بأكمله ليتناسب مع اللغة الجديدة. هذا مستحيل في مكتبة ضخمة.
  • الطريقة الجديدة (التكيف المعتمد على الاستعلام فقط): أدرك المؤلفون أنهم بحاجة فقط لتغيير عقل أمين المكتبة (مشفر الاستعلام)، وليس الكتب نفسها.
    • أبقوا رفوف المكتبة كما هي تماماً (فهرس وثائق ثابت).
    • قاموا فقط بإعطاء أمين المكتبة "ترقية لعقله" لفهم الأسئلة المحددة من ذلك الحي.
    • التشبيه: الأمر يشبه إعطاء أمين المكتبة نظارات متخصصة لعميل معين. لا تحتاج إلى تحريك الكتب؛ أنت فقط تغير طريقة "نظر" أمين المكتبة إلى السؤال. وهذا يجعل التحديثات فورية وغير مكلفة.

3. الترقية "خفيفة الوزن" (الضبط الدقيق الفعال للمعلمات)

حتى ترقية عقل أمين المكتبة بالكامل تعتبر عملية ثقيلة. لذا، استخدموا تقنية تسمى PEFT (الضبط الدقيق الفعال للمعلمات).

  • التشبيه: بد instead من إعادة بناء عقل أمين المكتبة بالكامل (الذي يحتوي على مليارات الخلايا العصبية)، قاموا فقط بإضافة بعض الملاحظات اللاصقة الذكية أو ورقة غش صغيرة إلى مكتب أمين المكتبة.
  • وجدوا أن استخدام طريقة تسمى LoRA (التكيف منخفض الرتبة) تشبه إعطاء أمين المكتبة دفتراً صغيراً وفعالاً للغاية.
  • السحر: هذا الدفتر الصغير يسمح لأمين المكتبة بتعلم احتياجات الحي الجديد بقدر كفاءة تعلمه لو أننا أعدنا بناء عقله بالكامل، ولكنه يستخدم طاقة حوسبة وذاكرة أقل بنسبة 99%.

الخلاصة

أثبت المؤلفون أنك:

  1. يمكنك بناء مجموعة بيانات تدريب مثالية باستخدام قضاة الذكاء الاصطناعي بدلاً من البشر.
  2. يمكنك جعل محرك البحث أكثر ذكاءً لعملاء محددين دون لمس قاعدة البيانات الضخمة للوثائق أبداً.
  3. يمكنك القيام بذلك باستخدام "ترقية" صغيرة وفعالة توفر كميات هائلة من المال والوقت.

باختصار: لقد اكتشفوا كيفية تعليم محرك بحث ضخم متعدد المستأجرين ليكون عبقرياً لكل عميل محدد، دون الحاجة أبداً لتحريك كتاب واحد من على الرف. إنه فوز للسرعة، والتكلفة، والجودة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →