Succeeding at Scale: Automated Dataset Construction and Query-Side Adaptation for Multi-Tenant Search
تقدم هذه الورقة DevRev-Search، وهو معيار مؤتمت لاسترجاع الدعم الفني، وتقترح استراتيجية التكيف الحافظ للفهرس (Index-Preserving Adaptation) التي تعمل على ضبط مشفر الاستعلام فقط لتحقيق بحث متعدد المستأجرين عالي الأداء وقابل للتوسع دون التكلفة الباهظة لإعادة الفهرسة.
المؤلفون الأصليون:Prateek Jain, Shabari S Nair, Ritesh Goru, Prakhar Agarwal, Ajay Yadav, Yoga Sri Varshan Varadharajan, Constantine Caramanis
تخيل أنك تدير مكتبة ضخمة وصاخبة تخدم آلاف الأحياء المختلفة (المستأجرين). لكل حي مجموعته الفريدة من الكتب، والقواعد، واللغة العامية الخاصة به. هدفك هو بناء روبوت أمين مكتبة فائق الذكاء يمكنه العثور فوراً على الكتاب المناسب لأي سؤال يطرحه الزائر.
ومع ذلك، تواجه مشكلتين هائلتين:
مشكلة "البيانات المظلمة": لديك ملايين الكتب، لكن لا أحد كتب "بطاقات مراجعة" توضح أي الكتب هي الإجابات الجيدة لأسئلة محددة. إنه يشبه امتلاك مكتبة حيث الكتب موجودة، لكن الفهرس فارغ. لا يمكنك تدريب الروبوت الخاص بك لأنك لا تعرف ما الذي يبدو "جيداً".
ضريبة "إعادة الرفوف": في كل مرة تريد فيها تعليم روبوتك خدعة جديدة، يتعين عليك عادةً إخراج كل كتاب من الرف، وإعادة قراءته، ثم إعادة ترتيبه في مكان جديد. إذا كان لديك 1,000 حي، فإن القيام بذلك لكل تحديث سيستغرق وقتاً طويلاً وسيكلف ثروة.
تقدم هذه الورقة البحثية، "النجاح على نطاق واسع" (Succeeding at Scale)، طريقة جديدة لحل كلتا المشكلتين. إليك كيف فعلوا ذلك، مشروحاً ببساطة:
1. بناء دليل التدريب بدون بشر (خط إنتاج "المحقق الذكاء الاصطناعي")
عادةً، تحتاج إلى خبراء بشريين لقراءة الأسئلة وتحديد الإجابة الصحيحة لتدريب محرك البحث. لكن هذا بطيء ومكلف.
قام المؤلفون ببناء مصنع آلي لإنشاء بيانات التدريب هذه:
رحلة البحث عن الكنز: بدلاً من الاعتماد على أداة بحث واحدة، أرسلوا فريقاً من سبعة "كشافين" مختلفين (بعضهم يبحث عن تطابق الكلمات الدقيقة، والبعض الآخر يبحث عن المعنى). قاموا بجمع كل إجابة ممكنة يمكن لهؤلاء الكشافين العثء عليها.
القاضي: بعد ذلك، استخدموا ذكاءً اصطناعياً فائق الذكاء (LLM) ليكون بمثابة "القاضي". نظر هذا القاضي إلى كومة الإجابات وسأل: "هل تجيب هذه حقاً على السؤال، أم أنها مجرد تشتيت يبدو جذاباً؟"
النتيجة: قام الذكاء الاصطناعي بتصفية النفايات والاحتفاظ بالذهب فقط. لقد أنشأوا مجموعة بيانات تدريب ضخمة وعالية الجودة (تسمى DevRev-Search) دون أن يضطر إنسان واحد لتصنيف وثيقة واحدة يدوياً.
2. التجميل "من جانب واحد" (التكيف المحافظ على الفهرس)
هذا هو الاختراق الأكبر للورقة البحثية.
في الطريقة القديمة، لجعل أمين المكتبة أكثر ذكاءً، كان عليك إعادة تنظيم المكتبة بأكملها (الوثائق) في كل مرة.
الطريقة القديمة: تخيل أنك تريد تعليم أمين المكتبة كيفية فهم لغة حي جديد. عليك إعادة ترتيب كل كتاب في المبنى بأكمله ليتناسب مع اللغة الجديدة. هذا مستحيل في مكتبة ضخمة.
الطريقة الجديدة (التكيف المعتمد على الاستعلام فقط): أدرك المؤلفون أنهم بحاجة فقط لتغيير عقل أمين المكتبة (مشفر الاستعلام)، وليس الكتب نفسها.
أبقوا رفوف المكتبة كما هي تماماً (فهرس وثائق ثابت).
قاموا فقط بإعطاء أمين المكتبة "ترقية لعقله" لفهم الأسئلة المحددة من ذلك الحي.
التشبيه: الأمر يشبه إعطاء أمين المكتبة نظارات متخصصة لعميل معين. لا تحتاج إلى تحريك الكتب؛ أنت فقط تغير طريقة "نظر" أمين المكتبة إلى السؤال. وهذا يجعل التحديثات فورية وغير مكلفة.
حتى ترقية عقل أمين المكتبة بالكامل تعتبر عملية ثقيلة. لذا، استخدموا تقنية تسمى PEFT (الضبط الدقيق الفعال للمعلمات).
التشبيه: بد instead من إعادة بناء عقل أمين المكتبة بالكامل (الذي يحتوي على مليارات الخلايا العصبية)، قاموا فقط بإضافة بعض الملاحظات اللاصقة الذكية أو ورقة غش صغيرة إلى مكتب أمين المكتبة.
وجدوا أن استخدام طريقة تسمى LoRA (التكيف منخفض الرتبة) تشبه إعطاء أمين المكتبة دفتراً صغيراً وفعالاً للغاية.
السحر: هذا الدفتر الصغير يسمح لأمين المكتبة بتعلم احتياجات الحي الجديد بقدر كفاءة تعلمه لو أننا أعدنا بناء عقله بالكامل، ولكنه يستخدم طاقة حوسبة وذاكرة أقل بنسبة 99%.
الخلاصة
أثبت المؤلفون أنك:
يمكنك بناء مجموعة بيانات تدريب مثالية باستخدام قضاة الذكاء الاصطناعي بدلاً من البشر.
يمكنك جعل محرك البحث أكثر ذكاءً لعملاء محددين دون لمس قاعدة البيانات الضخمة للوثائق أبداً.
يمكنك القيام بذلك باستخدام "ترقية" صغيرة وفعالة توفر كميات هائلة من المال والوقت.
باختصار: لقد اكتشفوا كيفية تعليم محرك بحث ضخم متعدد المستأجرين ليكون عبقرياً لكل عميل محدد، دون الحاجة أبداً لتحريك كتاب واحد من على الرف. إنه فوز للسرعة، والتكلفة، والجودة.
إليك ملخص تقني مفصل للورقة البحثية بعنوان "النجاح على نطاق واسع: بناء مجموعات البيانات الآلي والتكيف من جانب الاستعلام للبحث متعدد المستأجرين".
1. بيان المشكلة
تعالج الورقة البحثية عقبتين حرجتين في نشر أنظمة الاسترجاع العصبي الكثيف ضمن البيئات المؤسسية متعددة المستأجرين (Multi-tenant):
ندرة البيانات (مشكلة "البيانات المظلمة"): تمتلك المؤسسات (المستأجرون) مجموعات بيانات خاصة (مثل تذاكر الدعم الفني، الوثائق الداخلية) تحتوي على سجلات استعلام واسعة النطاق، لكنها تفتقر إلى تسميات صلة (Relevance Labels) منسقة. تفشل المعايير القياسية (مثل BEIR) في محاكاة الطبيعة الصاخبة وغير المتجانسة لهذه البيانات. إن التوسيم اليدوي مكلف، وبطيء، وعرضة للنتائج السلبية الخاطئة بسبب عدم القدرة على مراجعة المجموعات الضخمة بشكل شامل.
زمن استجابة التكيف (ضريبة إعادة الفهرسة): يتطلب الضبط الدقيق (Fine-tuning) القياسي للمشفر الثنائي (Bi-encoder) تحديث كل من مشفر الاستعلام ومشفر المستند. وتتطلب عملية تحديث مشفر المستند إعادة توليد التضمينات (Embeddings) للمجموعة الكاملة من المستندات وإعادة بناء الفهرس (مثل HNSW)، وهو أمر مكلف حاسوبياً في أنظمة تعدد المستأجرين التي تضم آلاف الفهارس المعزولة، مما يمنع التكيف السريع والمخصص لكل مستأجر.
2. المنهجية
يقترح المؤلفون إطار عمل موحداً يتكون من مكونين رئيسيين: خط أنابيب لبناء مجموعات البيانات آلياً، واستراتيجية تكيف تحافظ على الفهرس.
أ. بناء مجموعات البيانات آلياً (معيار DevRev-Search)
للتغلب على نقص البيانات المصنفة، بنى المؤلفون خط أنابيب مؤتمتاً بالكامل لتوليد معيار DevRev-Search:
جمع وتنظيف الاستعلامات: تم جمع استعلامات العملاء الحقيقية من تفاعلات الوكلاء في بيئة الإنتاج. وتمت إزالة الضجيج (استعلامات الاختبار، مقاطع الكود) عبر تصفية الطول، وكشف اللغة، وإزالة التكرار، والاختيار القائم على التجميع لضمان التنوع.
تجزئة المستندات: تم تقسيم المستندات المؤسسية الطويلة إلى قطع بحجم 500 حرف باستخدام التقسيم المتكرر للحروف (Recursive Character Splitting) للحفاظ على الحدود الدلالية وتجنب حدود الرموز (Tokens).
دمج أجهزة الاسترجاع المتعددة (توليد المرشحين): لتعظيم الاستدعاء (Recall)، تم استخدام مجموعة من سبعة أجهزة استرجاع متنوعة (6 نماذج كثيفة تشمل متغيرات من Google وOpenAI وCohere وQwen، بالإضافة إلى نموذج BM25 اللغوي) لإنشاء مجمع من النتائج. شكل اتحاد أفضل 60 نتيجة لكل استعلام مجمع مرشحين يصل إلى 420 قطعة لكل استعلام.
التصفية باستخدام النموذج اللغوي الكبير كحكم (LLM-as-a-Judge): تم استخدام نموذج لغوي كبير لتصفية المرشحين المدمجين. وبدلاً من توليد التسميات، عمل النموذج كحكم للاحتفاظ فقط بالقطع التي تجيب فعلياً على الاستعلام، مما أدى لإزالة النتائج الإيجابية الزائفة الناتجة عن التداخل اللفظي السطحي.
التحقق: تم التحقق يدوياً من عينة عشوائية بنسبة 10% لتأكيد دقة خط الأنابيب.
ب. التكيف المحافظ على الفهرس (استراتيجية الاستعلام فقط)
لتجنب "ضريبة إعادة الفهرسة"، يقترح المؤلفون التكيف من جانب الاستعلام فقط (Query-Only Adaptation):
تجميد مشفر المستند: يظل مشفر المستند والفهرس المرتبط به مجمدين، ويتم ضبط مشفر الاستعلام فقط.
هدف التدريب: يستخدم النموذج فقد InfoNCE مع السلبيات الصعبة المستخرجة (Hard Negatives). ولمنع انهيار التمثيل (حيث تصبح السلبيات الصعبة القديمة "سهلة")، استخدموا تدريب ANCE غير متزامن (تحديث السلبيات الصعبة بشكل دوري).
الضبط الدقيق الفعال للمعلمات (PEFT): لتقليل التكاليف وتمكين النشر القابل للتوسع لمتعدد المستأجرين، تم تقييم عدة تقنيات PEFT على مشفر الاستعلام:
إلغاء التجميد الجزئي: إلغاء تجميد الطبقات العليا N فقط من نموذج Transformer.
3. المساهمات الرئيسية
معيار DevRev-Search: معيار استرجاع عالي الدقة ومخصص للمؤسسات، تم بناؤه دون مُصنفين بشريين، ويتميز بكثافة صلة عالية (متوسط 13.6 قطعة ذات صلة لكل استعلام).
التكيف بدون إعادة فهرسة: استراتيجية رسمية تعتمد على ضبط مشفر الاستعلام فقط، مما يلغي العبء الحسابي لإعادة الفهرسة مع الحفاظ على أداء تنافسي.
التحقق من PEFT: إثبات أن الطرق الفعالة للمعلمات (خاصة LoRA) على مشفر الاستعلام يمكن أن تضاهي أو تتجاوز أداء الضبط الدقيق الكامل، مما يتيح توسيع النطاق بتكلفة منخفضة لآلاف المستأجرين.
دراسات الاستئصال الشاملة: تحليل مفصل لمساهمات مجمع المسترجعات، ورتب LoRA، والوحدات المستهدفة، وعدد الطبقات الملغى تجميدها.
4. النتائج التجريبية
تم التحقق من النهج على مجموعات بيانات DevRev-Search و SciFact و FiQA-2018.
الاستعلام فقط مقابل (الاستعلام-المستند) (QD):
أدى تجميد مشفر المستند (الاستعلام فقط) إلى فقدان ضئيل في الأداء مقارنة بالضبط المتماثل (QD).
في مجموعة بيانات SciFact مع نموذج qwen3-4b ، تفوق نهج "الاستعلام فقط" في الواقع على الضبط الدقيق الكامل (QD) في مقياس Recall@10 (بنسبة 0.953 مقابل 0.949).
الضبط الدقيق الفعال للمعلمات (PEFT):
حقق LoRA باستمرار نتائج تضاهي أو تتفوق على الضبط الدقيق الكامل. بالنسبة لـ qwen3-4b على DevRev-Search، حققت أفضل تهيئة لـ LoRA استدعاءً (Recall@10) قدره 0.355 مقابل 0.327 للضبط الدقيق الكامل.
رتبة LoRA: وُجد أن الرتب المثلى تتراوح بين 32 و64. أما الرتب الأعلى (128) فقد أظهرت عوائد متناقصة أو فرط في التخصيص (Overfitting).
الوحدات المستهدفة: حقق ضبط "كل" الوحدات أفضل النتائج، لكن ضبط الطبقات "الكثيفة" (Dense) فقط قدم مقايضة قوية بين الأداء والكفاءة.
إلغاء تجميد الطبقات: زاد الأداء بشكل مطرد مع عدد الطبقات العليا التي تم إلغاء تجميدها، لكن LoRA ظل أكثر فعالية من مجرد إلغاء تجميد الطبقات ذات المعلمات الأكثر عدداً.
مجمع المسترجعات:
لم يحقق أي مسترجع منفرد استدعاءً كاملاً (الأفضل كان 82.48%).
كان نهج المجمع (Ensemble) حاسماً؛ حيث أدى حذف أي مسترجع من خط أنابيب الدمج إلى انخفاض الاستدعاء للمجموعة المدمجة، مما يثبت التكامل بين النماذج المتنوعة.
5. الأهمية
تقدم هذه الورقة خارطة طريق عملية للبحث المؤسسي القابل للتوسع:
الجدوى الاقتصادية: من خلال إلغاء الحاجة إلى التوسيم اليدوي وإعادة الفهرسة الكاملة، فإنها تقلل بشكل كبير من تكلفة وزمن استجابة تكييف أنظمة البحث مع مستأجرين أو نطاقات جديدة.
القابلية للتوسع: يسمح نهج (الاستعلام فقط + PEFT) للمنصات بخدمة آلاف المستأجرين المعزولين بنماذج فريدة دون أعباء حسابية باهظة.
جودة البيانات: تثبت الورقة أنه يمكن تصنيع بيانات عالية الجودة ومتخصصة في النطاق تلقائياً باستخدام النماذج اللغوية الكبيرة والاسترجاع المجمع، مما يحل مشكلة "البيانات المظلمة" في البيئات المؤسسية.
في الختام، يثبت المؤلفون أن التكيف غير المتماثل والفعال للمعلمات ليس ممكناً فحسب، بل هو غالباً متفوق في البحث متعدد المستأجرين، مما يوفر حلاً عالي الجودة ومنخفض زمن الاستجابة لاسترجاع المعلومات في المؤسسات.