Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings
تقترح الورقة البحثية إطار عمل "Reason What Matters (ReWAM)"، وهو إطار استدلال قائم على الاسترجاع يعزز التضمينات متعددة الوسائط الشاملة باستخدام تغذية راجعة من الاسترجاع لتنقيح تخصيص الائتمان على مستوى الرمز وتمكين التوقف المبكر لمسارات الاستدلال، مما يحقق أداء استرجاع رائد مع تحسين كفاءة الاستدلال بشكل كبير.
المؤلفون الأصليون:Mingzhou Jiang, Peixi Wu, Hang Cheng, Yunhao Zhou, Biao Yang, Wei Yuan, Yun Li, Fan Yang, Wenwu Ou, Honghui He
في المشهد الرقمي الشاسع حيث تتعايش الصور والفيديوهات والنصوص، تواجه الحواسيب تحديًا مستمرًا: فهم كيفية ارتباط هذه الأشكال المختلفة من المعلومات ببعضها البعض. لسنوات، بنى الباحثون أنظمة يمكنها ترجمة صورة إلى وصف أو العثور على صورة تطابق استعلامًا مكتوبًا. تعمل هذه الأنظمة عن طريق إنشاء خريطة مشتركة، لغة مشتركة حيث تهبط صورة قطة وكلمة "قطة" في نفس الحي. تُعرف هذه القدرة على توحيد أنواع البيانات المختلفة باسم التضمين متعدد الوسائط الشامل (universal multimodal embedding). وبينما كانت النسخ الأولى من هذه الأنظمة سريعة، إلا أنها غالبًا ما كانت تعاني في المهام المعقدة التي تتطلب تفكيرًا عميقًا، مثل رصد الاختلافات الدقيقة بين مشهدين متشابهين أو فهم تسلسل الأحداث. ولحل هذه المشكلة، بدأ العلماء في تعليم هذه الأنظمة "التفكير بصوت عالٍ" قبل اتخاذ القرار، عبر توليد سلسلة من الاستدلال خطوة بخ بعد خطوة لتوجيه إجابتهم النهائية. ومع ذلك، أدى هذا النهج الجديد إلى تكلفة باهظة: فعملية التفكير استغرقت وقتًا طويلاً لدرجة أنها أبطأت النظام بأكمله، مما جعله غير عملي للبحث عبر مكتبات ضخمة من البيانات.
لقد طور فريق من الباحثين الآن إطار عمل جديدًا يسمى "فكر فيما يهم" (Reason What Matters)، أو ReWAM، والذي يعلم هذه الأنظمة التفكير بكفاءة دون التضحية بالدقة. تمثلت المشكلة الجوهرية التي عالجوها في أن الطرق السابقة كانت تجبر الحاسوب على كتابة شرح كامل وطويل لكل عملية بحث، حتى عندما تكون بضع جمل كافية للعثور على الإجابة الصحيحة. كان هذا يشبه مطالبة أمين مكتبة بكتابة سيرة ذاتية كاملة لكل كتاب قبل تسليمه إلى الزائر، بغض النظر عما إذا كان الزائر يحتاج فقط إلى العنوان. علاوة على على ذلك، كانت الطرق القديمة تعامل كل كلمة في ذلك الشرح على أنها متساوية في الأهمية، ففشلت في التمييز بين الحقائق التي ساعدت بالفعل في العثجول الهدف وبين الكلمات الحشوية التي لا تضيف أي قيمة. يحل ReWAM هذه المشكلة من خلال تقديم ابتكارين رئيسيين يسمحان للنظام بأن يكون أكثر ذكاءً وسرعة في آن واحد.
الابتكار الأول هو طريقة تسمى "التقطير الذاتي المدرك للاسترجاع" (Retrieval-aware Self-Distillation). فبدلاً من التعامل مع سلسلة الاستدلال ككتلة واحدة من المعلومات، تعمل هذه التقنية كأنها محرر دقيق؛ فهي تنظر إلى حقائق محددة في المدخلات التي ساعدت في تمييز الإجابة الصحيحة عن الإجابات الخاطئة الشبيهة بها. ومن خلال مقارنة الإجابة الصحيحة مقابل الإجابات الخاطئة الأكثر إرباكًا، يتعلم النظام بالضبط أي أجزاء من استدلاله كانت مدعومة بالأدلة وأيها لم تكن كذلك. ثم يستخدم هذه الرؤية لمنح الفضل فقط للكلمات التي كانت مهمة حقًا، مما يعلم النموذج التركيز على التفاصيل التي تساعده فعليًا في العثور على المطابقة الصحيحة. يضمن ذلك أن يتعلم النظام توليد استدلال قائم على المحتوى الفعلي للصورة أو النص، بدلاً من التخمين أو تكرار عبارات عامة.
أما الابتكار الثاني فهو "الاستدلال المتكيف مع الاسترجاع" (Retrieval-adaptive Inference)، والذي يعالج مسألة السرعة. في الماضي، بمجرد أن يبدأ النظام في التفكير، كان يستمر حتى ينتهي من طول محدد مسبقًا، حتى لو كان قد وجد الإجابة في منتصف الطريق. يغير ReWAM هذا من خلال إضافة فحص للثقة يراقب عملية الاستدلال في الوقت الففر. فبينما يولد النظام أفكاره، فإنه يسأل نفسه باستمرار: "هل لدي معلومات كافية للعثين على الهدف بعد؟". إذا كانت الإجابة نعم، فإنه يتوقف فورًا، مما يوفر الوقت والطاقة اللازمين لكتابة بقية الشرح. وإذا كان النظام لا يزال غير متأكد، فإنه يستمر. ولجعل هذه العملية أسرع، يستخدم النظام أيضًا تقنية تتنبأ بعدة كلمات مستقبلية دفعة واحدة وتتحقق منها فورًا، بدلاً من كتابتها واحدة تلو الأخرى. وهذا يسمح للنظام بالتحرك عبر عملية الاستدلال بسرعة أكبر بكثير دون أن يفقد مساره.
نتائج هذا النهج كبيرة؛ فعند اختباره على مجموعة واسعة من المهام التي تشمل الصور والفيديوهات والمستندات، حقق النظام الجديد أعلى درجات الدقة المسجلة لهذا النوع من التكنولوجيا. لقد تفوق على الأساليب السابقة التي اعتمدت على سلاسل استدلال صريحة وطويلة، وكذلك الأساليب الأحدث التي حاولت إخفاء الاستدلال داخل الحسابات الداخلية للحاسوب. ولعل الأهم من ذلك هو أن النظام الجديد كان أسرع بخمس مرات من أقرب منافسيه. وهذا يعني أنه يمكنه معالجة واسترجاع المعلومات من مجموعات ضخمة من البيانات بسرعة تجعل استخدامه عمليًا في العالم الحقيقي، مما يسد الفجوة بين الفهم عالي الجودة والحاجة إلى السرعة. لقد أثبت الباحثون أنه من خلال تعليم النظام تحديد ما يهم حقًا والتوقف عن التفكير عندما يمتلك ما يكفي، من الممكن الحصول على كل من الذكاء العميق والأداء السريع، مما يجعل قدرات البحث المتقدمة قابلة للتطبيق في مجموعات البيانات الهائلة التي تدعم الحياة الرقمية الحديثة.
ملخص تقني: التفكير فيما يهم (ReWAM)
بيان المشكلة
تهدف التضمينات متعددة الوسائط الشاملة (UME) إلى تعلم تمثيلات موحدة عبر الوسائط لدعم مهام الاسترجاع المتنوعة. وبينما تدمج الطرق الحديثة "سلسلة التفكير" (Chain-of-Thought - CoT) في التضمينات متعددة الوسائط الشاملة للتعامل مع مهام الاسترجاع المعقدة، والتركيبية، والدقيقة، فإن هناك قيدين حرجين يعيقان نشرها على نطاق المجموعات النصية الضخمة (Corpus Scale):
تخصيص الائتمان الخشن (Coarse Credit Assignment): غالبًا ما تستخدم الطرق الحالية تحسين السياسة النسبي للمجموعات (GRPO) مع مكافآت قائمة على الاسترجاع. هذا النهج يخصص قيمة ميزة (advantage) قياسية واحدة لجميع رموز (tokens) سلسلة التفكير ضمن مسار واحد. وبناءً على ذلك، فإنه يفشل في التمييز بين خطوات التفكير المدعومة حقًا بالأدلة من المدخلات وتلك التي تمثل "هلوسة" أو غير ذات صلة. كما أنه لا يحدد بشكل صريح الفروق النوعية التي تفصل بين الأهداف الإيجابية والسلبيات الصعبة (hard negatives). هذا النقص في الدقة يحد من المكاسب في الأداء، لا سيما في المهام خارج نطاق التوزيع (OOD).
زمن انتقال الاستنتاج (Inference Latency): تتطلب النهج الحالية عادةً توليد مسار كامل لسلسلة التفكير قبل إنتاج التضمين، حتى عندما يحتوي المسار الجزئي بالفعل على أدلة كافية للاسترجاع. هذا التوليد التكراري (autoregressive) لمسارات كاملة يؤدي إلى زمن انتقال كبير يتناسب طرديًا مع طول المسار وحجم المجموعة النصية، مما يجعل التفكير الصريح غير عملي للأنظمة واسعة النطاق.
المنهجية: التفكير فيما يهم (ReWAM)
ReWAM هو إطار عمل للتفكير القائم على الاسترجاع، صُمم لتحسين جودة التفكير وكفاءة الاستنتاج معًا. يبني الإطار على بنية منفصلة من "المُفكّر" و"المُضمِّن"، حيث يوفر مُضمِّن ثابت مشروط بسلسلة التفكير إشارة استرجاع مستقرة. يقدم الإطار مكونين أساسيين:
1. التقطير الذاتي المدرك للاسترجاع (RASD)
يعالج RASD مشكلة تخصيص الائتمان الخشن من خلال بناء "توجيه مميز" لتنقية الإشراف على مستوى الرموز (token-level).
بناء المعلومات المميزة: يقوم محلل متعدد الوسائط بمقارنة الهدف الإيجابي مقابل السلبيات الصعبة المسترجعة لاستخراج نوعين من المعلومات المميزة: (1) الأدلة المستندة إلى الواقع (الحقائق المدعومة بالمدخلات متعددة الوسائط) و(2) حدود القرار (الفروق التي تفصل الهدف عن المرشحين المربكين).
التحقق من الادعاءات: يقوم المحلل بالتحقق من مسارات سلسلة التفكير التي تم أخذ عينات منها مقابل هذه المعلومات المميزة لتحديد الادعاءات المدعومة والبيانات المتعارضة، مما يشكل "معلومات الأدلة التباينية المميزة" (CEPI).
إعادة وزن الرموز: يستخدم "معلم ذاتي" (self-teacher) أثناء التشغيل (on-policy) معلومات CEPI لإعادة تسجيل درجات المسارات المأخوذة. يقوم بحساب فرق احتمالية اللوغاريتم (log-likelihood difference) لكل رمز مع ومع غياب التوجيه المميز. يعمل هذا الفرق كإشارة "إيقاف التدرج" (stop-gradient) لتوليد أوزان خاصة بكل رمز.
الهدف: تعمل هذه الأوزان على تعديل الميزة على مستوى المسار المستمدة من مكافآت الاسترجاع. يضمن ذلك أن تحديثات السياسة تركز على خطوات التفكير التي تكون مدعومة بالمدخلات وتمييزية في آن واحد، بدلاً من تعزيز المسار بأكمله بشكل موحد.
2. الاستنتاج المتكيف مع الاسترجاع (RAI)
يعالج RAI زمن انتقال الاستنتاج من خلال التحكم التكيفي في طول سلسلة التفكير وتسريع توليد الرموز.
رأس ثقة الاسترجاع: يتنبأ رأس MLP خفيف الوزن بـ "المنفعة الاسترجاعية المتبقية" لسلسلة التفكير الجزئية. وهو يقدر مقدار الربح الإضافي في الاسترجاع الذي يمكن تحقيقه من خلال الاستمرار في التفكير مقابل التوقف.
القطع المبكر: أثناء الاستنتاج، إذا كانت المنفعة المتبقية المتوقعة أقل من عتبة معينة، يتم قطع توليد سلسلة التفكير فورًا، لتجنب خطوات التفكير غير المنتجة.
التوليد الاستنباطي (Speculative Decoding): لتسريع توليد التتابعات المفيدة، يستخدم ReWAM التوليد الاستنباطي. حيث يقترح نموذج مسودة شبه تكراري عدة رموز بالتوازي، والتي يتم التحقق منها بواسطة المُفكّر المستهدف المجمد. وهذا يقلل تكلفة التوليد لكل رمز مع الحفاظ على جودة سلسلة التفكير الصريحة.
المساهمات الرئيسية
إطار عمل ReWAM: إطار عمل جديد قائم على الاسترجاع يسد الفجوة بين جودة الاسترجاع وكفاءة الاستنتاج للتضمينات متعددة الوسائط الشاملة، مما يجعل التفكير الصريح نموذجًا قابلًا للتوسع للمجموعات النصية الضخمة.
التقطير الذاتي المدرك للاسترجاع (RASD): طريقة لتخصيص الائتمان على مستوى الرمز تستفيد من التحقق من أدلة الاسترجاع للتمييز بين التفكير المدعوم بالمدخلات والهلوسة، مما يصقل إشارة التدريب بما يتجاوز مكافآت المسار القياسية.
الاستنتاج المتكيف مع الاسترجاع (RAI): استراتيجية استنتاج تكيفية تجمع بين قطع المسار (الموجه بالمنفعة المتبقية المتوقعة) وتسريع المستوى الرمزي (عبر التوليد الاستنباطي) لتقليل زمن الانتقال بشكل كبير دون التضحية بأداء الاسترجاع.
النتائج التجريبية
أُجريت تجارب واسعة النطاق على معايير MMEB-V2 (الاسترجاع متعدد الوسائط للأغراض العامة) و MRMR (الاسترجاع المكثف بالتفكير).
أداء الاسترجاع: يحقق ReWAM أداءً هو الأفضل في فئته (SOTA) عبر كلا المعيارين.
في MMEB-V2، يحقق ReWAM (باستخدام Qwen2-VL-2B) درجة إجمالية قدرها 66.5، متفوقًا على أفضل طريقة سابقة تعتمد التفكير الصريح (Embed-RL)، ويتجاوز طريقة التفكير الضمني PLume بمقدار 4.9 نقطة مع الاحتفاظ بقابلية التفسير لسلسلة التفكير الصريحة.
في MRMR، يحقق Reકમ أعلى الدرجات في المهام المكثفة بالتفكير، متصدرًا بفوارق كبيرة (على سبيل المثال، +3.1 نقطة عن RIME، و+6.5 نقطة عن Embed-RL)، ويظهر أداءً قويًا في المهام المتخصصة مثل الرياضيات والفيزياء والهندسة.
كفاءة الاستنتاج: يقدم ReWAM تحسينات جوهرية في الإنتاجية (throughput).
يحقق ما يصل إلى 5 أضعاف إنتاجية طرق التضمين (UME) المنافسة التي تعتمد التفكير الصريح (مثل Embed-RL).
يتفوق على طريقة التفكير الضمني الموجهة نحو الكفاءة PLUME في كل من أداء الاسترجاع والإنتاجية.
تؤكد دراسات الاستئصال (Ablation studies) أن رأس ثقة الاسترجاع يقلل طول سلسلة التفكير بنسبة 26-36% مع زيادة الإنتاجية بنسبة إضافية تتراوح بين 26-64% مقارنة باستخدام التوليد الاستنباطي وحده.
الأهمية
تجادل الورقة بأن التفكير الصريح غالبًا ما يتم استبعاده باعتباره مكلفًا للغاية للنشر واسع النطاق بسبب زمن الانتقال وإشارات التحسين الخشنة. يثبت ReWAM أنه من خلال ربط التفكير بالتغذية الراجعة للاسترجاع (عبر RASD) والتحكم التكيفي في الاستنتاج (عبر RAI)، يمكن جعل التفكير الصريح فعالاً وفعالاً في آن واحد. تشير النتائج إلى أن التضمينات متعددة الوسائط المعززة بالتفكير هي أمر عملي للأنظمة الواقعية التي تعمل على مجموعات نصية ضخمة، مما يوفر مسارًا لاسترجاع عالي الجودة دون التضحية بالقدرة على التفسير والقدرة على التفكير التركيبي التي توفرها آثار النصوص الصريحة.