KoVRE: Training an Efficient Embedding Model for Korean Visual Document Retrieval
تقدم الورقة البحثية نموذج KoVRE، وهو نموذج تضمين أحادي المتجه فعال لاسترجاع المستندات المرئية الكورية، والذي يستفيد من الإشراف الثنائي اللغة المستهدف واستراتيجيات التدريب المتقدمة للتفوق على النماذج الأساسية الأكبر ونماذج المتجهات المتعددة المرجعية دون الحاجة إلى نطاق ضخم.
المؤلفون الأصليون:Yongbin Choi, Gyuho Shim, Youngjoon Jang
تخيل أنك تحاول العثور على صفحة محددة في مكتبة ضخمة وفوضوية، حيث الكتب مصنوعة من الصور وليست مجرد كلمات. إذا سألت أمين مكتبة عن "صفحة بها رسم بياني أحمر وقصة عن المال"، فقد يحاول قراءة النص بصوت عالٍ أولاً. ولكن ماذا لو كان النص ضبابياً، أو كان الرسم البيحي مرسوماً بطريقة لا يمكن للكلمات وصفها؟ هنا يأتي دور الاسترجاع البصري للمستندات (Visual Document Retrieval). فبدلاً من مجرد قراءة الكلمات، تنظر هذه التقنية إلى صورة الصفحة الفعلية — التنسيق، والألوان، والجداول، والصور — لتجد ما تحتاجه بالضبط. الأمر يشبه امتلاك أمين مكتبة يمكنه "رؤية" الصفحة بأكملها، وليس فقط قراءة الحروف.
عادةً، يتم تدريب هؤلاء الأمناء الأذكياء بشكل أساسي على الكتب الإنجليزية. فإذا سألتهم عن مستندات كورية، قد يصابون بالارتباك لأن أشكال الحروف وطريقة تصميم الصفحات مختلفة. كما أن جعل هؤلاء الأمناء فائقين الذكاء يتطلب غالباً أن يكونوا ضخمين، بطيئين، ومكلفين في التشغيل، مثل كمبيوتر خارق عملاق يحاول تذكر كل بكسل في كل كتاب. السؤال الكبير هو: هل يمكننا بناء أمين مكتبة أصغر، وأسرع، وأرخص، تم تدريبه خصيصاً لفهم المستندات البصرية الكورية دون الحاجة لأن يكون عملاقاً؟
هذا هو بالضبط ما سعى الباحثون وراء KOVRE للقيام به. لقد أنشأوا "أمين مكتبة" مدمجاً جديداً (نموذج حاسوبي) مخصصاً للمستندات البصرية الكورية. وبدلاً من جعل أمين المكتبة أكبر، قاموا بتعليمه بذكاء أكبر. لقد دربوه على مجموعة هائلة مكونة من 708,729 زوجاً من الأسئلة وصفحات المستندات، مع خلط اللغتين الكورية والإنجليزية للحفاظ على حدة النموذج. استخدموا عملية تدريب ذكية من خطوتين: أولاً، عرضوا على النموذج أمثلة مخادعة (سلبيات صعبة) لتعليمه ما الذي لا يجب أن يختاره، وثانياً، جعلوا نموذجاً "معلماً" (خبيراً ذكياً جداً ولكنه بطيء) يوضح للنموذج "الطالب" كيفية ترتيب أفضل الإجابات.
كانت النتائج مفاجئة وواعدة. فنموذجهم الجديد المكون من 2 مليار معلمة (وهو صغير نسبياً) لم يكتفِ بأداء جيد فحسب؛ بل تفوق بالفعل على نموذج أكبر بكثير مكون من 8 مليارات معلمة، بل وتفوق حتى على نظام قوي يستخدم طريقة معقدة وكثيفة الذاكرة لتخزين المعلومات. تشير الورقة البحثية إلى أنه من خلال التصميم الدقيق لوصفة التدريب — وتحديداً كيفية تعاملهم مع الأمثلة الصعبة ومعالجة الدرجات أثناء مرحلة التعلم "المعلم-الطالب" — يمكنك إنشاء باحث مستندات كوري فعال للغاية دون الحاجة إلى كمبيوتر ضخم أو نظام تخزين هائل. إنها دليل على أنه مع استراتيجية التدريب الصحيحة، يمكن لنموذج صغير وفعال أن يكون بجودة، أو حتى أفضل من، العمالقة.
ملخص تقني: KOVRE – تدريب نموذج تضمين فعال لاسترجاع المستندات المرئية باللغة الكورية
بيان المشكلة
يهدف استرجاع المستندات المرئية (VDR) إلى مطابقة استعلامات نصية مباشرة مع صور المستندات المُصيغة، مما يحافظ على المعلومات المرئية والهيكلية الحرجة (مثل الجداول، والأشكال، والتنسيق) التي تُفقد غالباً أثناء عمليات التعرف الضوئي على الحروف (OCR) ومسارات استخراج النصوص. وبينما حققت نماذج VDR الحديثة أداءً قوياً، إلا أنها تواجه ثلاث قيود رئيسية:
التحيز المتمحور حول اللغة الإنجليزية: معظم بيانات التدريب والمعايير المرجعية هي باللغة الإنجليزية، مما يترك فجوة في وجود أنظمة عالية الأداء للغة الكورية.
كثافة الموارد: تعتمد النماذج عالية الأداء غالباً على هياكل ضخمة (على سبيل المثال، 8 مليارات بارامتر أو أكثر) أو تمثيلات متعددة المتجهات (تخزين عدة تضمينات لكل صفحة)، مما يؤدي إلى تكاليف تخزين واسترجاع باهظة.
استراتيجيات التدريب غير المستكشفة كفاية: هناك بحث محدود حول كيفية تدريب مسترجعات مدمجة أحادية المتجه (single-vector) بفعالية للغات محددة، لا سيما فيما يتعلق بتكوين بيانات التدريب، واستخراج السلبيات الصعبة (hard-negative mining)، ونقل المعرفة (knowledge distillation) من نماذج إعادة التصنيف (rerankers).
المنهجية
يقدم المؤلفون KOVRE (تضمين استرجاع المستندات المرئية الكورية)، وهو مسترجع مدمج أحادي المتجه مُكيف من نموذج Qwen3-VL-Embedding-2B. تنقسم عملية التدريب إلى مرحلتين متمايزتين:
1. النموذج الأساسي والتمثيل
البنية: يحتفظ النموذج ببنية الرؤية واللغة الأصلية لـ Qwen3-VL-Embedding-2B دون تعديل.
المدخلات: يستقبل استعلامات نصية وصور صفحات مستندات مُصيغة، ويقوم برسم خرائط لها في مساحة كثيفة مشتركة.
تعلم التمثيل الماتريوشكا (MRL): يتم تدريب النموذج لإنتاج تضمينات بأبعاد متعددة (2048، 1024، 768، 512، 256، 128)، مما يسمح بمرونة في المقايضة بين جودة الاسترجاع وكفاءة التخزين.
التشابه: يُستخدم تشابه جيب التمام (Cosine similarity) في كل من التدريب والاستدلال.
2. المرحلة الأولى: التعلم التبايني (CL)
البيانات: يتم تدريب النموذج على 708,729 زوجاً من (الاستعلام-الصفحة) تتكون من بيانات كورية وإنجليزية.
الكورية: تجمع بين بيانات KoViDoRe العامة ومجموعات AI Hub الخاصة.
الإنجليزية: تم تجميعها من خمسة موارد VDR موجودة (تقارير، شرائح، جداول) لمنع النسيان الكارثي للقدرات متعددة اللغات للهيكل الأساسي.
استخراج السلبيات الصعبة (Hard-Negative Mining): يتم استخراج سبعة سلبيات صعبة لكل استعلام باستخدام نموذج أكبر وهو Qwen3-VL-Embedding-8B.
التصفية الواعية بالإيجابيات (Positive-Aware Filtering): يتم استبعاد المرشحين الذين سجلوا أكثر من 95% من تشابه الإيجابي المحدد مسبقاً لتقليل السلبيات الخاطئة.
التصفية ذاتية التوجيه (Self-Guide Filtering): يتم استبعاد السلبيات التي سجلت درجات أعلى بكثير من الإيجابي (بناءً على عتبة إيقاف التدرج) من حساب الخسارة.
دالة الخسارة: يتم تحسين هدف InfoNCE مع توزين الصعوبة (hardness weighting). تحصل السلبيات المستخرجة صراحةً على حد إضافي لإيقاف التدرج (stop-gradient) بوزن قدره (α=2.0) للتأكيد على الأمثلة الصعبة، بينما تظل السلبيات الموجودة داخل الدفعة (in-batch negatives) بدون وزن.
الهدف: تُحسب الخسارة بشكل مشترك عبر جميع أبعاد الماتريوشكا.
3. المرحلة الثانية: نقل المعرفة (KD)
البيانات: تستخدم فقط المجموعة الفرعية الكورية من المتن.
النموذج المعلم (Teacher Model): يقوم Qwen3-VL-Reranker-8B بتقييم مجموعة مرشحة مكونة من 64 صفحة (32 من السلبيات الصعبة المستخرجة + 32 عينة عشوائية) لكل استعلام.
بناء الهدف: يتم اختيار أفضل 8 سلبيات (بناءً على درجات المعلم) جنباً إلى جنب مع الإيجابي لتشكيل حالة التدريب.
تطبيع الدرجات (Score Normalization): تتضمن الخطوة الحرجة إجراء تطبيع الحد الأدنى والأقصى لكل صف (per-row min-max normalization) لكل من درجات الطالب والمعلم إلى النطاق [0, 1] قبل تطبيق softmax. يعالج هذا الأمر المقياس غير المحدود والمعتمد على الاستعلام لدرجات إعادة التصنيف، مما يحافظ على شكل توزيع الصلة.
دالة الخسافة: يقلل الطالب من تباعد KL (KL-divergence) بين توزيع درجاته وتوزيع درجات المعلم المُنظم عبر جميع أبعاد الماتريوشكا.
المساهمات الرئيسية
نموذج KOVRE: تطوير مسترجع مدمج أحادي المتجه للمستندات المرئية الكورية يحقق أداءً تنافسياً دون الحاجة إلى هيكل أكبر أو مؤشرات متعددة المتجهات.
وصفة تدريب منهجية: تحليل شامل لمكونات التدريب، مما يوضح فعالية:
الإشراف ثنائي اللغة (الكورية + الإنجليزية) للحفاظ على القدرات متعددة اللغات.
تطبيع الحد الأدنى والأقصى للدرجات من أجل نقل معرفة فعال.
فائدة تمثيلات الماتريوشكا للاسترجاع المدمج.
النتائج
عند تقييمه على معايير VDR الكورية (KoViDoRe و SDS KoPub VDR)، أظهر KOVRE تحسينات كبيرة:
مكاسب الأداء: يتفوق نموذج KOVRE النهائي (2B) بشكل كبير على هيكله الأساسي Qwen3-VL-Embedding-2B.
المقارنة بالنماذج الأكبر: يتفوق KOVRE على نظيره 8B أحادي المتجه (Qwen3-VL-Embedding-8B) وعلى خط الأساس القوي 4B متعدد المتجهات (Jina Embeddings v4) في الأداء الإجمالي (nDCG@10).
كفاءة الأبعاد: حتى عند الأبعاد المنخفضة (مثل 256)، يحتفظ KOVRE بأداء قوي، متفوقاً قليلاً على نموذج Qwen3-VL-Embedding-8B ذي الـ 4096 بُعداً.
رؤى الدراسة الاستقصائية (Ablation Insights):
التدريب ثنائي اللغة يتفوق على التدريب الكوري فقط.
إضافة مجموعات نصوص كورية إضافية (بدون سياق مرئي) قلل من الأداء.
كان تطبيع الحد الأدنى والأقصى في المرحلة الثانية أمراً حاسماً؛ فبدونه، أدى نقل المعرفة إلى إلحاق الضرر بالأداء.
الأهمية والادعاءات
يزعم البحث أن الإشراف ثنائي اللغة المستهدف واستراتيجيات التدريب المصممة بعناية يمكن أن تنتج نموذج VDR كوري فعال للغاية عبر مجالات متنوعة دون زيادة حجم النموذج أو اعتماد تمثيلات متعددة المتجهات كثيفة التخزين.
يضع المؤلفون KOVRE كحل عملي للغات التي لا تحظى بالاهتمام الكافي من قبل النماذج الحالية، موضحين أن النموذج المدمج جيد التدريب يمكن أن ينافس أو يتجاوز الأنظمة الأكبر والأكثر تعقيداً. يوفر العمل وصفة تدريب قابلة لإعادة الإنتاج تؤكد على أهمية تكوين البيانات، واستراتيجيات استخراج السلبيات، وتطبيع الدرجات في نقل المعرفة لاسترجاع المستندات المرئية.
القيود الملحوظة: يقر المؤلفون بأن متن التدريب الكوري يحتوي على صور صفحات أقل تميزاً مقارنة بالإنجليزية، مما قد يحد من تنوع التنسيقات وأنواع المستندات الملاحظة أثناء التدريب. ويقترحون أن العمل المستقبلي يجب أن يركز على توسيع تنوع صور الصفحات الكورية بدلاً من مجرد زيادة عدد الاستعلامات.