← أحدث الأبحاث
🤖 AI

Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation

تقدم هذه الورقة البحثية OmniClean، وهو معيار مرجعي مُنزّه بصرياً يكشف عن مكاسب مضخمة في النماذج متعددة الوسائط، ويُظهر أن وصفة تدريب لاحق ثلاثية المراحل (OmniBoost) تمكّن نموذجاً صغيراً بحجم 3 مليارات معلمة من التفوق على نظيره الأكبر بكثير بحجم 30 مليار معلمة عبر دمج الأدلة السمعية والبصرية واللغوية بفعالية دون الاعتماد على الاختصارات البصرية.

المؤلفون الأصليون: Che Liu, Lichao Ma, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Xuerui Yang, Fei Tian

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Che Liu, Lichao Ma, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Xuerui Yang, Fei Tian

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تخوض اختباراً لتثبت أنك "محقق خارق" يمكنه حل الألغاز باستخدام الرؤية، والسمع، والمنطق في آن واحد.

معظم نماذج الذكاء الاصطناكن اليوم تشبه الطلاب الذين يجيدون قراءة الغرفة لكنهم سيئون جداً في الاستماع. إذا عرضت عليهم صورة لكلب ينبح وسألتهم: "ما هذا الصوت؟"، فقد يخمنون "نباح" لمجرد أنهم رأوا فم الكلب مفتوحاً، دون الحاجة فعلياً لسماع الملف الصوتي. إنهم "يغشون" باستخدام اختصارات بصرية.

هذه الورقة البحثية، التي أعدها فريق StepFun-Audio، تتحدث عن إصلاح مشكلتين كبيرتين: كيف نختبر هذه النماذج وكيف نعلمها أن تستمع حقاً.

1. المشكلة: "شفرة الغش البصرية"

لاحظ الباحثون أن العديد من معايير قياس الذكاء الاصطناعي (الاختبارات) منحازة. فهي تحتوي على أسئلة تكون إجابتها واضحة بمجرد النظر إلى الصورة أو الفيديو.

  • الاستعارة: تخيل اختبار رياضيات حيث الإجابة مكتوبة بخط عريض في خلفية ورقة الأسئلة. إذا حصل الطالب على درجة كاملة، فهل قام بحل المسائل الرياضية، أم أنه قرأ ما في الخلف فقط؟
  • الحل (OmniClean): ابتكر الفريق اختباراً جديداً وأكثر صرامة يسمى OmniClean. لقد فحصوا آلاف الأسئلة وتساءلوا: "هل يمكن للنموذج الإجابة على هذا السؤال دون سماع الصوت؟". إذا كانت الإجابة "نعم"، فقد استبعدوا ذلك السؤال.
  • النتيجة: بدأوا بما يقرب من 17,000 سؤال واحتفظوا بحوالي 8,500 سؤال فقط. هذه الأسئلة المتبقية هي أسئلة "الوضع الصعب" حيث تحتاج حقاً للاستماع إلى الصوت للحصول على الإجابة الصحيحة.

2. الحل: "وصفة الطبخ ذات المراحل الثلاث" (OmniBoost)

أراد الفريق معرفة ما إذا كان بإمكانهم تعليم نموذج ذكاء اصطناعي صغير (يسمى Qwen2.5-Omni-3B) ليكون محققاً خارقاً حقيقياً باستخدام وصفة تدريب محددة تسمى OmniBoost. لقد جربوا ثلاث طرق مختلفة للطبخ:

  • المرحلة 1: "بوفيه السلطة" (SFT ثنائي الوسائط المختلط)

    • ماذا فعلوا: قدموا للنموذج نظاماً غذائياً متوازناً من النصوص والصور والصوت بشكل منفصل. كان الأمر يشبه إعطاء الطالب كتاباً مدرسياً، وكتاب صور، وراديو، لكن دون خلطهم معاً أبداً.
    • النتيجة: تحسن النموذج قليلاً، لكنه كان غير متسق. كان يشبه طالباً يعرف كيف يقرأ وكيف يستمع، لكنه لا يعرف كيف يفعل الاثنين في وقت واحد.
  • المرحلة 2: "مدرب الصرامة" (RLVR متعدد الوسائط المختلط)

    • ماذا فعلوا: بدأوا في استخدام تقنية تسمى RLVR (التعلم المعزز بالمكافآت القابلة للتحقق). فكر في هذا كمدرب صارم لا يعطي "إبهاماً للأعلى" إلا إذا استخدم النموذج كلاً من الصورة والصوت لحل اللغز. إذا غش بالاعتماد على النظر فقط، فلن يحصل على أي نقاط.
    • النتيجة: كان هذا هو الاختراق الأكبر. تعلم النموذج أخيراً دمج الحواس. بدأ في حل أسئلة "الوضع الصమైన" بشكل صحيح.
  • المرحلة 3: "مجموعة الدراسة" (التقطير الذاتي)

    • ماذا فعلوا: قام النموذج بتوليد أسئلة وإجابات تدريبية خاصة به بناءً على ما تعلمه في المرحلة الثانية، ثم تدرب عليها مرة أخرى. إنه يشبه طالباً يصنع بطاقات استذكار خاصة به ويختبر نفسه لترسيخ المعرفة.
    • النتيجة: ساعد هذا النموذج على أن يصبح أكثر اتساقاً، خاصة في الاختبارات الكبيرة والمعقدة للغاية.

3. المفاجأة الكبرى: الصغير يمكن أن يكون قوياً

عادةً، تحتاج إلى "عقل حاسوبي" ضخم ومكلف للغاية (نموذج ضخم) لحل هذه المشكلات الصعبة.

  • الادعاء: أخذ الباحثون نموذجاً صغيراً نسبياً (3 مليارات بارامتر) وطبقوا عليه "وصفة المراحل الثلاث".
  • النتيجة: بعد كل التدريب، أدى هذا النموذج الصغير أداءً يضاهي، بل ويتفوق أحياناً، على نماذج أكبر بكثير ومشهورة (مثل Qwen3-Omni الذي يمتلك 30 مليار بارامتر) في اختبار "OmniClean" الصارم.
  • الملاحظة: لقد فعلوا ذلك دون نسخ الإجابات من معلم أكبر وأذكى؛ بل بنوا بيانات التدريب الخاصة بهم من الصفر.

الملخص

تجادل الورقة البحثية بأن:

  1. توقفوا عن الغش: العديد من اختبارات الذكاء الاصطناعي سهلة للغاية لأنها تسمح للنماذج بالتخمين بناءً على الصور. نحن بحاجة إلى اختبارات (مثل OmniClean) تجبرهم على الاستماع فعلياً.
  2. علموهم الطريقة الصحيحة: مجرد تغذية النموذج بمزيد من البيانات ليس كافياً. أنت بحاجة إلى عملية تدريب محددة (OmniBoost) تجبر النموذج على دمج الرؤية والصوت.
  3. الحجم ليس كل شيء: يمكن لنموذج صغير مدرب جيداً أن يهزم نموذجاً عملاقاً مدرباً بشكل سيء إذا ركز التدريب على الفهم الحقيقي بدلاً من الاختصارات.

باختصار: لا تكتفِ بجعل الذكاء الاصطناعي ينظر إلى الصورة فحسب؛ بل اجعله يستمع إلى القصة أيضاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →