← أحدث الأبحاث
💻 computer science

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

تقدم هذه الورقة البحثية OraRL، وهو إطار عمل للتعلم التعزيزي القابل للتوسع لنماذج اللغات الكبيرة متعددة الوسائط للفيديو (video MLLMs)، والذي يعامل التوصيفات كمسارات أوراكل (oracle rollouts) ضمن آلية تقدير ميزة مفككة للتغلب على انقلاب الميزة (advantage inversion)، محققاً بذلك أداءً فائقاً في الاختبارات المعيارية الزمنية والمكانية مع كفاءة تدريب أعلى بكثير واستدلال أسرع مقارنة بالطرق الحالية.

المؤلفون الأصليون: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

نُشر 2026-08-24
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

ملخص تقني: التوصيفات كعمليات تدفق (OraRL)

بيان المشكلة

يتطلب الإدراك الموحد للفيديو من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) أداء مهام دقيقة مثل التحديد الزمني، والتمركز المكاني، وتتبع الأجسام، والتقطيع (segmentation). وبينما تدمج النماذج العامة الحديثة هذه القدرات، إلا أنها غالبًا ما يكون أداؤها أقل من المتخصصين في مهام محددة، مما يشير إلى أن حجم النموذج وحده ليس كافيًا، وأن محاذاة ما بعد التدريب هي العائق الحرج.

تواجه نماذج ما بعد التدريب الحالية عائقين رئيسيين:

  1. الضبط الدقيق الخاضع للإشراف (SFT): يعامل الـ SFT التوصيفات (annotations) كأهداف للاحتمالية القصوى، مما يفرض تنسيقات المخرجات ولكنه يفشل في التمييز بين التنبؤات القريبة من الصحة والتنبؤات الخاطئة تمامًا. كما يفتقر إلى الإشراف على مستوى المهمة لتوجيه النموذج نحو فترات زمنية أو أقنعة (masks) دقيقة.
  2. التعلم التعزيزي (RL) باستخدام تحسين السياسة النسبي للمجموعة (GRPO): تعتمد طرق الفيديو الحالية للتعلم التعزيزي (مثل GRPO) على أخذ عينات من عمليات تدفق متعددة داخل السياسة (on-policy rollouts) لكل مطالبة ومقارنة مكافآتها. ومع ذلك، تعتمد هذه الطرق فقط على جودة مجموعة العينات المستخرجة من السياسة؛ وبما أن عمليات التدفق داخل السياسة نادرًا ما تستعيد الفترات الزمنية أو الصناديق أو الأقنعة الدقيقة المحددة في توصيفات الحقيقة الأرضية (GT)، فإن العديد من مجموعات التدريب تفتقر إلى مرجع إيجابي موثوق.
  3. قيود سلسلة الأفكام (CoT): بينما تُستخدم توليد سلسلة الأفكام لتحسين الاستنتاج، إلا أنها تزيد من طول عمليات التدفق، مما يرفع تكاليف التدريب والاستدلال دون ضمان مكاسب في الأداء لمهام الإدراك الدقيقة.

إن المحاولة المباشرة لدمج توصيفات الحقيقة الأرضية (GT) في مجموعة تدفق التعلم التعزيزي كعمليات تدفق "أوراكل" (oracle rollouts) تفشل بسبب انعكاس الميزة (advantage inversion). فعند تضمين "أوراكل" عالي المكافأة في تطبيع المجموعة، فإنه يرفع خط الأساس للمكافأة. ونتيجة لذلك، فإن عمليات التدفق داخل السياسة التي تكون أفضل من السياسة الأصلية (ولكنها أسوأ من الأوراكل) تتلقى ميزات سالبة، مما يقمع الاستكشاف المفيد ويؤدي إلى انهيار التعلم نحو التقليد البسيط.

المنهجية: OraRL

يقدم البحث OraRL (التعلم التعزيزي للتوصيف كعملية تدفق)، وهو نموذج يعامل كل توصيف كهدف إيجابي موثوق (عملية تدفق أوراكل) مع منع إزاحة خط الأساس التي تسبب انعكاس الميزة.

الآليات الجوهرية

  1. بناء التوصيف كعملية تدفق:
    بدلاً من استخدام التوصيفات كمجرد مراجع للتقييم، يقوم OraRL بتسلسل كل توصيف yy إلى تنسيق استجابة النموذج لإنشاء عملية تدفق أوراكل ogto_{gt}. يتم إلحاق هذا الأوراكل بمجموعة من nn من عمليات التدفق داخل السياسة، مما يخلق مجموعة معززة بحجم n+1n+1. يوفر هذا هدفًا إيجابيًا موثوقًا لكل استعلام دون تقليل الاستكشاف داخل السياسة.

  2. تقدير الميزة المنفصل (Decoupled Advantage Estimation):
    لحل مشكلة انعكاس الميزة، يقوم OraRL بفصل حساب الميزة:

  • خط أساس السياسة: يتم حساب خط الأساس μop\mu_{op} والانحراف المعياري فقط من مكافآت السياسة (on-policy rewards)، باستثناء الأوراكل. يضمن هذا أن أي عملية تدفق داخل السياسة تتفوق على السياسة الحالية تتلقى ميزة غير سالبة.
  • الربح الاتجاهي: يتم ترميز الفجوة بين مكافأة الأوراكل وتوزيع السياسة كربح اتجاهي gqg_q. يقوم هذا الربح بتوسيع نطاق ميزات عمليات التدفق داخل السيطة التي تكون فوق متوسط السيطة، مما يضخم الإشارة عندما يكون الأوراكل أفضل بكثير من السياسة الحالية.
  • ميزة الأوراكل المنفصلة: يتم حساب حد ميزة منفصل ومحدد AgtA_{gt} لعملية تدفق الأوراكل نفسها. يتم معايرة مقياسه بواسطة وزن wqw_q (بناءً على الفجوة المتبقية بين السياسة والأوراكل) ويتم سقفها بحد أقصى من أقوى إشارة داخل السياسة لمنع الأوراكل من الهيمنة على التحديث.
  1. التقليم المتوازن للإشارة (Sign-Balanced Pruning):
    لتحسين الكفاءة، يقوم OraRL بتقليم مجموعة التدفق قبل الانتشار العكسي (back-propagation). وخلافًا للتقليم القائم على المقدار فقط (الذي قد يحتفظ فقط بالعينات الإيجابية أو السلبية)، يستخدم OraRL تقليماً متوازناً للإشارة:
  • يتم الاحتفاظ بالأوراكل دائمًا.
  • يتم ملء المناصب المتبقية عن طريق الاحتفاظ بأقوى عمليات التدفق الإيجابية والسلبية داخل السياسة، مما يضمن أن تحديث التدرج يحافظ على كل من الإشارات المعززة والمثبطة.
  • يتم تطبيق تصحيح اللحظة بعد الاختيار لإعادة تمركز الميزات وإعادة تحجيمها لتطابق إحصائيات ما قبل التقليم، مما يمنع التحيز في مقدار التحديث.
  1. الكفاءة:
    من خلال تقليم المجموعة (على سبيل المثال، الاحتفاظ بـ 4 من أصل 9 عمليات تدفق) وتجنب توليد سلسلة الأفكام (CoT)، يحقق OraRL زمن خطوة يبلغ 2.2×2.2\times فقط من زمن SFT، مقارنة بـ 4.9×4.9\times لـ GRPO مع CoT.

المساهمات الرئيسية

  1. التوصيف كعملية تدفق: آلية مستقلة عن المهام تحول التوصيفات إلى عمليات تدفق أوراكل، مما يوفر إشرافًا إيجابيًا موثوقًا دون الحاجة إلى CoT أو التضحية بالاستكشاف داخل السياسة.
  2. تحليل انعكاس الميزة: تحديد ظاهرة "انعكاس الميزة" في خلط الأوراكل الساذج وحلها عبر تقدير الميزة المنفصل الذي يفصل ميزات السياسة عن توجيه الأوراكل.
  3. التقليم المتوازن للإشارة: استراتيجية تقليم تحتفظ بكل من إشارات الميزة والأوراكل، مقترنة بتصحيح اللحظة، مما يحقق تسريعًا قدره 1.48×1.48\times مقارنة بالتحسين الكامل للمجموعة.
  4. Video-ORA: نموذج إدراك فيديو موحد تم تدريبه باستخدام OraRL، يظهر تحسينات متسقة عبر جميع أحجام النماذج (0.8B إلى 9B) وميزانيات البيانات.

النتائج التجريبية

قام المؤلفون بتدريب Video-ORA (المستند إلى نماذج Qwen3.5 الأساسية) وقاموا بتقييمه عبر سبع عائلات من المهام: التمركز الزمني، التمركز المكاني، التقطيع، التتبع البصري، التمركز الزماني-المكاني، الأسئلة والأجوبة للفيديو، والذكاء المكاني.

  • مكاسب الأداء:

    • التمركز الزمني: حقق Video-ORA-9B درجة mIoU بلغت 61.8، 63.6، و72.5 على اختبارات TimeLens الثلاثة، متفوقًا على متخصص التمركز الزمني TimeLens2-8B والنماذج المملوكة مثل GPT-5 وGemini-3-Pro.
    • التتبع البصري: في GOT-10k، حقق Video-ORA-9B متوسط تداخل (AO) قدره 78.2، متفوقًا على أفضل نموذج مفتوح المصدر سابق (OneThinker-8B) بمقدار 5.2 نقطة.
    • التقطيع: حقق درجات رائدة في RefCOCO (cIoU 79.4) وMeViS (J&F 61.3).
    • الذكاء المكاني: في VSI-Bench، سجل Video-ORA-9B درجة 73.1، متفوقًا على GPT-5 (55.0) وGemini-3-Pro (55.1).
    • الأسئلة والأجوبة للفيديو: احتل المرتبة الأولى بين النماذج مفتوحة المصدر في خمسة من أصل سبعة اختبارات للأسئلة والأجوبة للفيديو.
  • التوسع والكفاءة:

    • توسع النموذج: تحسن Video-ORA فوق هيكله الأساسي في جميع الأحجام (0.8B، 2B، 4B، 9B)، مع زيادة مكاسب المتوسط الكلي مع حجم النموذج.
    • توسع البيانات: تفوق OraRL على GRPO وSFT عبر ميزانيات البيانات حتى 100 ألف مطالبة.
    • زمن استجابة الاستدلال: بدون CoT، قلل Video-ORA-9B متوسط زمن الاستجلال النهائي لفيديوهات مدتها 10 دقائق من 29.0 ثانية (النموذج الأساسي مع CoT) إلى 24.3 ثانية.

الأهمية والادعاءات

يزعم البحث أن OraRL يرسخ مبدأ "التوصيف كعملية تدفق" كآلية تعلم تعزيزي فعالة وقابلة للتوسع للإدراك الموحد للفيديو. ويرى المؤلفون أن:

  • الدقة الدقيقة في إدراك الفيديو تتحدد بشكل أساسي من خلال ما بعد التدريب المتوافق مع المهمة وليس من خلال حجم النموذج وحده.
  • التكامل المباشر للأوراكل، عند التعامل معه بشكل صحيح (عبر الميزات المنفصلة)، يوفر هدفًا إيجابيًا موثوقًا يتغلب على ندرة عمليات التدفق عالية الجودة داخل السياسة.
  • استنتاج سلسلة الأفكار (CoT) ليس ضروريًا لهذه المهام؛ حيث يوفر الإشراف المباشر للأوراكل دقة وكفاءة أفضل.
  • الطريقة قابلة للتعميم عبر عائلات النماذج المختلفة (Qwen3-VL، Qwen3.5) وأنواع المهام (التمركز، التتبع، الأسئلة والأجوبة، الاستدلال المكاني).

يشير المؤلفون إلى بعض القيود، وتحديدًا أن الصيغة الحالية تفترض أن التوصيفات يمكن تسلسلها كعمليات تدفق أوراكل صالحة وتقييمها بواسطة مكافآت عددية، كما لم يتم تقييم السلوك تحت الإشراف الغامض أو المشوش. كما يقرون بأنه بينما يتصدر Video-ORA في العديد من المقارنات مفتوحة المصدر، إلا أن بعض مهام الاستدلال المكاني المعقدة لا تزال تتخلف عن أقوى النماذج المملوكة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →