ملخص تقني: تطوير قياس الصلة باستخدام نماذج الرؤية واللغة للبحث على نطاق الويب
بيان المشكلة
في أنظمة البحث المخصصة مثل Pinterest، يعد ضمان توافق نتائج البحث مع نية المستخدم (الصلة الدلالية) أمراً بالغ الأهمية. وبينما يسهل جمع مقاييس تفاعل المستخدم (مثل النقرات والحفظ)، إلا أنها غالباً ما تفشل في عكس الصلة الدلالية الحقيقية بسبب عوامل مربكة مثل انحياز الموضع، وتأثيرات العرض، وتشتت الانتباه. وبناءً على ذلك، يعمل تقييم الصلة كـ "حاجز حماية" ضروري في تجارب A/B عبر الإنترنت للكشف عن المقايضات حيث قد يزداد التفاعل بينما تتدهور الصلة.
تقليدياً، يعتمد تقييم الصلة على التوسيم البشري. ومع ذلك، يواجه هذا النهج قيوداً تتمثل في التكاليف المرتفعة، وفترات الانتظار الطويلة، والقدرة المحدودة على التوسع. هذه الاختناقات تفرض تصميمات قياس ذات أحجام عينات صغيرة، والتي لا يمكنها سوى اكتشاف التحركات الكبيرة في المقاييس وتفشل في التقاط التأثيرات العلاجية غير المتجانسة أو التحسينات الصغيرة ذات المعنى. تعالج الورقة البحثية الحاجة إلى نظام تقييم صلة مؤتمت، وقابل للتوسع، وفعال من حيث التكلفة، وموثوق يمكنه العمل على نطاق الويب.
المنهجية
1. نماذج الرؤية واللغة (VLMs) المضبوطة بدقة
يقترح المؤلفون خط معالجة متكامل (end-to-end) يستخدم نماذج الرؤية واللغة مفتوحة المصدر والمضبوطة بدقة (تحديداً سلسلة Qwen3-VL) لأتمتة تسمية الصلة.
- تمثيل المدخلات: يعالج النموذج مدخلاً متعدد الوسائط يتكون من نص استعلام البحث، وصورة الـ Pin، والبيانات الوصفية النصية الشاملة (عنوان ووصف الـ Pin، عنوان ووصف صفحة الهبوط، عناوين اللوحات "boards"، والاستعلامات ذات التفاعل العالي تاريخياً).
- التدريب: يتم ضبط النموذج بدقة باستخدام حوالي 0.8 مليون زوج (استعلام-Pin) موسوم بشرياً باستخدام مقياس تقييم مكون من 5 مستويات (من شديد الصلة إلى شديد عدم الصلة). الهدف هو التنبؤ بدرجة الصلة (1-5) عن طريق تقليل خسارة الإنتروبيا المتقاطعة (cross-entropy loss).
- الاستدلال: يخرج النموذج مستوى الصلة المتوقع عبر عملية الـ argmax فوق لوغاريتمات المخرجات (output logits). يستفيد النظام من القدرات متعددة اللغات لنموذج Qwen3-VL لدعم لغات متعددة.
2. تصميم أخذ العينات الطبقي
إن خفض تكاليف ووقت التوسيم الذي توفره نماذج VLMs يتيح الانتقال من أخذ العينات العشوائي البسيط إلى تصميم أخذ عينات استعلام طبقي أكثر تطوراً.
- المنطق: ينبع التباين في الصلة أساساً من الاختلافات بين الاستعلامات (النية، جودة المحتوى، عمق المخزون). يستهدف التصميم الطبقي هيكل هذا التباين.
- التنفيذ: يتم تقسيم الاستعلامات طبقياً بناءً على فئات الاهتمام وشرائح الشعبية (الرأس Head، الجذع Torso، الذيل Tail، المنفرد Single).
- الفائدة الإحصائية: من خلال القضاء على مكون التباين "بين الطبقات"، يقلل أخذ العينات الطبقي بشكل كبير من تباين متوسط العينة. وهذا يؤدي مباشرة إلى خفض الحد الأدنى المكتشف للأثر (MDE)، مما يسمح للنظام باكتشاف التغييرات الأصغر والأكثر أهمية في أداء ترتيب البحث.
- المقارنة: يشير المؤلفون إلى أن تقنيات تقليل التباين البديلة مثل CUPED أقل ملاءمة هنا بسبب الطبيعة الديناميكية لمخزون Pinterest والمتطلبات المتعلقة بالمتغيرات المسبقة للمعالجة، مما قد يضر بالقدرة على التعميم أو يضاعف تكاليف التوسيم.
3. خط معالجة قياس الصلة
يتضمن خط معالجة التقييم لتجارب A/B ما يلي:
- أخذ العينات: اختيار أزواج الاستعلامات من مجموعات التحكم والمعالجة لحظر الاختلافات بين الاستعلامات.
- التوسيم: يقوم نموذج VLM المضبوط بدقة بتوليد تسميات الصلة لأفضل K (تم ضبطها عند 25) من نتائج البحث لكل استعلام.
- حساب المقياس: يقوم النظام بحساب sDCG@K على مستوى الاستعلام (وهو متغير من nDCG@K يفترض وجود إمداد غير محدود من المستندات شديدة الصلة) ويقوم بتجميع هذه القيم لاستخلاص مقاييس التجربة.
- التحليل: يتم تحليل التأثيرات العلاجية غير المتجانسة عبر الطبقات، مع التحكم في معدلات الاكتشاف الخاطئ عبر إجراء بنجاميني-هوتشبرج (Benjamini-Hochberg).
النتائج الرئيسية
التوافق مع الأحكام البشرية (RQ1)
تم التحقق من صحة النظام بصرامة مقابل التوسيم البشري:
- الدقة: نسبة التطابق التام بين تسميات VLM والتسميات البشرية هي 82.9%، مع وجود 94.2% من التقييمات التي تختلف بمقدار نقطة واحدة فقط.
- الاتفاق: بلغ معامل كابا الموزون التربيعي (QWK) نسبة 0.507، مما يشير إلى اتفاق رتبي جيد.
- ارتباط الترتيب: بلغت قيمة كيندال (Kendall's τ) 0.534 وقيمة سبيرمان (Spearman's ρ) 0.668، مما يظهر توافقاً قوياً في الترتيب.
- مقاييس الخطأ: يظل متوسط الخطأ في sDCG@K على مستوى الاستعلام ضمن 0.03 عبر جميع شرائح الشعبية. والأهم من ذلك، أن خطأ الفرق الزوجي (المستخدم في اختبارات A/B) ذو حجم ضئيل للغاية، مما يلغي التحيز الإيجابي الطفيف الملاحظ في أخطاء المجموعة الواحدة. وهذا يؤكد متانة التصميم التجريبي الزوجي ضد تحيز تسمية VLM.
- اختيار النموذج: بينما قدم نموذج Qwen3-VL-8B أداءً مشابهاً لنسخة 4B، فقد تم اختيار Qwen3-VL-4B للإنتاج نظراً لتوزيع خطئه الضيق وتكلفته الحسابية الأقل. لقد تفوق هذا النموذج بشكل كبير على نموذج XLM-RoBERTa المعتمد على النص فقط، خاصة في تقليل التباين.
حساسية وكفاءة المقياس (RQ2)
أدى الانتقال إلى التوسيم القائم على VLM مع أخذ العينات الطبقي إلى تحسينات جوهرية في حساسية التجربة:
- خفض MDE: انخفض الحد الأدنى المكتشف للأثر (MDE) من نطاق 1.3%–1.5% إلى ≤0.25%، مما يمثل تحسناً في الحساسية بمقدار 6 أضعاف.
- تقليل التباين: قلل التصنيف الطبقي وحده تباين المقياس (σ^) بنسبة 52% مقارنة بأخذ العينات العشوائي البسيط مع نفس حجم العينة (n=2000). وعند دمج التصنيف مع زيادة حجم العينة (n=5000)، وصل إجمالي تقليل التباين إلى 67%.
- الكفاءة التشغيلية:
- وقت الانتظار: تحسن بأكثر من 20 ضعفاً (من يومين إلى ساعتين).
- التكلفة: انخفضت تكلفة التوسيم لكل ملصق بنسبة 99.98% (من 0.10 دولار إلى 2×10−5 دولار).
- النطاق: يتعامل النظام الآن مع 4 أضعاف عدد مهام قياس الصلة مقارنة بالسابق، مما يتيح تقييمات أوسع وأكثر تكراراً.
الأداء متعدد اللغات (RQ3)
تم التحقق من صحة النظام في الأسواق غير الناطقة بالإنجليزية (فرنسا، ألمانيا، البرازيل). وبينما كانت ارتباطات الترتيب أقل قليلاً من الأسواق الناطقة بالإنجليزية، إلا أنها ظلت متوسطة إلى قوية. وظلت أخطاء الفرق الزوجي مركزة بدقة حول الصفر، مما يشير إلى أن النهج يعمم بفعالية على الاستعلامات غير الإنجليزية رغم أن بيانات التدريب كانت باللغة الإنجليزية في الغالب.
الأهمية والمساهمات
تدعي الورقة أن أهميتها الأساسية تكمن في التصميم والنشر المتكامل (end-to-end) لخط معالجة تقييم الصلة القائم على VLM ضمن نظام تجارب A/B حي على نطاق صناعي في Pinterest. وخلافاً للأعمال الأكاديمية السابقة التي تركز على بنية النموذج أو استراتيجيات التلقين (prompting)، يوضح هذا العمل الجدوى العملية لاستبدال التوسيم البشري بنماذج VLM المضبوطة بدقة في بيئة إنتاجية.
تشمل المساهمات الرئيسية ما يلي:
- النشر في بيئة الإنتاج: خط معالجة تم التحقق من صحته يغطي الاعتبارات العملية، بدءاً من الضبط الدقيق وصولاً إلى اختبارات A/B عبر الإنترنت، وهو ما يذكر المؤلفون أنه أول معالجة شاملة لهذه المشكلة في نظام بحث صناعي.
- حساسية التجربة: إثبات أن التقييم القائم على VLM يتيح توسيع مجموعات الاستعلامات وتصميمات أخذ عينات أكثر دقة، مما أدى إلى خفض MDE بمقدار 6 أضعاف وتحسين اكتشاف تحولات الصلة بشكل كبير.
- الموثوقية: إثبات أن نماذج VLM المضبوطة بدقة تنتج مقاييس تتوافق وثيقاً مع الأحكام البشرية، مع انحياز منخفض في الفروق الزوجية، مما يجعلها بديلاً موثوقاً للتوسيم البشي في اتخاذ القرارات عالية المخاطر.
يخلص المؤلفون إلى أن هذا النهج يقدم رؤى عملية للممارسين في الصناعة الذين يسعون لتحسين كفاءة وحساسية قياس الصلة، مع الإشارة إلى أن العمل المستقبلي سيركز على توسيع هذه القدرات لتشمل إعدادات بحث متعددة الوسائط أوسع وإغلاق فجوة الأداء في الأسواق غير الناطقة بالإنجليزية بشكل أكبر.