← أحدث الأبحاث
🤖 AI

Group Preference Collapse in Personalized Multimodal Large Language Models

تقدم هذه الورقة البحثية إطار عمل PrefMoE، وهو إطار عمل متمحور حول التفضيلات يعالج مشكلة "انهيار التفضيل الجماعي" في النماذج اللغوية الكبيرة متعددة الوسائط المخصصة، وذلك من خلال تفكيك التفضيلات إلى نماذج أولية مشتركة وبواقي مخصصة، مما يعزز توليد الاستجابات الفردية مع التخفيف من الانجراف نحو الخيارات السائدة على مستوى السكان.

المؤلفون الأصليون: Fan Lyu, Wenqi Zhang, Joost van de Weijer

نُشر 2026-07-28
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Fan Lyu, Wenqi Zhang, Joost van de Weijer

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدخل مكتبة سحرية ضخمة، حيث يمكن للكتب أن تتحدث إليك. هذه ليست مجرد كتب عادية؛ إنها "نماذج لغوية كبيرة متعددة الوسائط" (MLLMs). فكر فيهم كأمناء مكتبة فائقي الذكاء يمكنهم رؤية الصور، وقراءة النصوص، وفهم العالم من حولهم. عادةً، إذا طرحت عليهم سؤالاً، سيعطونك إجابة جيدة وعامة تصلح لأي شخص تقريباً. ولكن ماذا لو أردت من أمين المكتبة أن يعرفك أنت تحديداً؟ ماذا لو أردت منه أن يعرف أنك تكره الطعام الحار، وتحب الموضة الكلاسيكية، وتفضل دائماً التنزه في الطبيعة على السباحة؟ هذا هو هدف "الذكاء الاصطناعي الشخصي": أن تجعل النموذج يتصرف كصديق يعرف أذواقك الفريدة، وليس كروبوت يعرف أذواق الشخص المتوسط.

ومع ذلك، هناك مشكلة معقدة عندما تحاول تعليم أمين مكتبة واحد معرفة مئات الأشخاص المختلفين في آن واحد. الورقة البحثية التي ستطالعها الآن تغوص في ركن من أركان علوم الحاسوب يسمى "النماذج اللغوية الكبيرة متعددة الوسائط ذات الطابع الشخصي". وهي تعالج صداعاً محدداً: عندما يحاول الذكاء الاصطناعي تعلم تفضيلات العديد من المستخدمين، فإنه غالباً ما يصاب بالارتباك ويتوقف عن الاستماع إلى الفرد. فبدلاً من أن يتذكر أنك تحب موسيقى الجاز وأن صديقك يحب الروك، يبدأ الذكاء الاصطناعي في الاعتقاد بأن الجميع يحبون نوع الموسيقى الأكثر شعبية. الأمر يشبه النادل الذي، بعد خدمة الكثير من الطاولات، يقرر تقديم "الطبق الأكثر شعبية" للجميع، ناسياً أنك طلبت السلطة تحديداً. تبحث هذه الورقة في سبب حدوث ذلك وتحاول إصلاحه لكي يتمكن الذكاء الاصطناعي أخيراً من تذكر ذوقك الخاص في الحياة.

مشكلة "العناق الجماعي" العظيم

اكتشف مؤلفو هذه الورقة خللاً أسموه "انهيار التفضيل الجماعي" (Group Preference Collapse). تخيل فصلاً دراسياً يسأل فيه المعلم كل طالب عن لونه المفضل. إذا كان المعلم جيداً حقاً، فسيتذكر أن أليكس يحب الأزرق، وسام يحب الأخضر، وجوردان يحب الأرجواني. ولكن في سيناريو "الانهيار" هذا، يصاب المعلم بالإرهاق. يلاحظ أن "الأزرق" هو الإجابة الأكثر شيوعاً في الغرفة، فيبدأ بافتراض أن الجميع يحب اللون الأزرق. حتى لو رفع سام يده وقال: "لا، أنا حقاً أحب الأخضر!"، سيهز المعلم رأسه ويقول: "جميل، أنت تحب الأزرق أيضاً".

في عالم الذكاء الاصطناعي، يحدث هذا عندما يحاول النموذج التعلم من مستخدمين متعددين. فالتفضيلات "الصاخبة" أو الشائعة (مثل حب اليوغا أو ارتداء الملابس غير الرسمية) تطغى على التفضيلات الأهدأ والأكثر تحديداً. يصبح النموذج غير حساس للسمات الفردية وينجرف نحو الخيار "المتوسط". تُظهر الورقة أنه حتى لو قلت للذكاء الاصطناعي: "مهلاً، أنا أندرسون، وأنا أحب البستنة"، فقد يخمن الذكاء الاصطناعي أنك تفضل اليوغا لأن، حسناً، الكثير من الناس في بيانات التدريب يحبون اليوغا. ليس الأمر أن الذكاء الاصطناعي يتجاهلك؛ بل إنه نسي كيف يستمع إلى الإشارات الفريدة التي تجعل منك شخصاً متميزاً.

الحل: PrefMoE (أمين المكتبة الذكي)

لإصلاح ذلك، بنى الباحثون نظاماً جديداً يسمى PrefMoE. فكر في هذا كمنح أمين مكتبة الذكاء الاصطناعي نظام أرشفة فائق التنظيم ومجموعة من المساعدين المتخصصين.

1. فصل "مَن" عن "ماذا"
أولاً، يقوم النظام بتقسيم معلومات المستخدم إلى حاويتين مختلفتين:

  • حاوية الملف الشخصي (الـ "مَن"): تحتوي على الحقائق الثابتة عنك، مثل صورتك أو وصف يقول "أنا طالب يبلغ من العمر 25 عاماً". هذه الحقائق لا تتغير كثيراً.
  • حاوية التفضيلات (الـ "ماذا"): تحتوي على أذواقك الخاصة، مثل "أنا أحب الموضة البوهيمية" أو "أنا أكره أفلام الرعب". هذه هي الأشياء التي تجعلك فريداً.

حاولت الطرق القديمة دمج كل هذه المعلومات في كومة واحدة كبيرة، مما تسبب في مشكلة "العناق الجماعي". أما PrefMoE فيبقيها منفصلة حتى لا يرتبك الذكاء الاصطناعي.

2. النموذج الأصلي والباقي (المتوسط مقابل اللمسة المميزة)
هنا يكمن الذكاء. يدرك النظام أن الجميع يتشاركون بعض الأذواق ("النموذج الأصلي" أو Prototype). على سبيل المثال، قد يحب معظم الناس "السفر". لكن PrefMoE لا يتوقف عند هذا الحد، بل يبحث عن "الباقي" (Residual)؛ تلك اللمسة الفريدة والصغيرة التي تجعل أسلوب سفرك مختلفاً. ربما تحب السفر، لكنك تحديداً تكره التخييم وتحب فقط الرحلات البحرية الفاخرة.

  • النموذج الأصلي: "أنا أحب السفر." (مشترك بين الكثيرين)
  • الباقي: "لكنني فقط أحب الرحلات البحرية الفاخرة." (فريد بالنسبة لك)

وجدت الورقة أنه بدون حماية خاصة، يميل الذكاء الاصطناعي إلى تجاهل "الباقي" والتمسك بـ "النموذج الأصلي" فقط. يستخدم PrefMoE خدعة رياضية خاصة تسمى "التعزيز التضادي" (Counterfactual Augmentation). تخيل أن الذكاء الاصطناعي ينشئ "مستخدمين أشباح" عبر خلط وتوفيق أذواق أشخاص مختلفين (على سبيل المثال، أخذ حب أندرسون للبستنة وحب بيلا لليوجا). من خلال التدريب على هذه التوليفات المصنوعة، يتعلم الذكاء الاصطناعي الانتباه للتفاصيل المحددة بدلاً من مجرد متوسط المجموعة. كما يستخدم تقنية "إزالة الارتباط" (Decorrelation)، وهي تشبه قولك للذكاء الاصطناعي: "مهلاً، لا تخلط بين تفضيلات السفر وتفضيلات الموضة لديك؛ أبقِ كل منهما في صندوق خاص به".

3. المساعدون المتخصصون (موجه MoE)
أخيراً، يستخدم PrefMoE نظام "خليط من الخبراء" (Mixture of Experts - MoE). تخيل أن لدى الذكاء الاصطناعي فريقاً من المتخصصين. عندما تطرح سؤالاً، يقوم "موجه" ذكي بالنظر في سؤالك ويقرر أي متخصص سيستدعي.

  • إذا سألت: "ماذا يرتدي هذا الشخص؟"، يستدعي الموجه "متخصص الملف الشخصي" (الذي ينظر إلى صورتك).
  • إذا سألت: "ما هو النشاط الذي قد يستمتع به هذا الشخص؟"، يستدعي الموجه "متخصص التفضيلات" (الذي يتحقق من أذواقك وما تحبه وتكرهه).

يضمن هذا أن الذكاء الاصطناعي لا يخمن بناءً على ما هو شائع فحسب، بل يسترجع بنشاط المعلومة الصحيحة عنك من أجل السؤال المحدد.

ماذا تقول الأرقام؟

اختبر الباحثون هذا النظام الجديد على عدة نماذج مختلفة للذكاء الاصطناعي، بما في ذلك بعض النماذج الشهيرة جداً مثل LLaVA و Qwen. وقارنوا طريقتهم الجديدة بالطرق القياسية لتدريب الذكاء الاصطناعي.

كانت النتائج واضحة تماماً. في اختبار باستخدام نموذج يسمى LLaVA-1.5-7B، حصلت طريقة التدريب القياسية (الضبط الدقيق الكامل) على الإجابة الصحيحة حوالي 44.13% من الوقت عندما يتعلق الأمر بتخمين تفضيل محدد للمستخدم. ومع استخدام PrefMoE، قفز هذا الرقم إلى 67.33%.

والأهم من ذلك، قاموا بقياس عدد المرات التي يرتكب فيها الذكاء الاصطناعي خطأ "العناق الجماعي" (التنبؤ بالخيار الشعبي بدلاً من خيار المستخدم). الطريقة القياسية انهارت في التفضيل الجماعي بنسبة 34.25% من المرات. بينما قلل PrefMoE هذا الكارثي إلى 12.33% فقط. وفي أقوى النماذج التي اختبروها، حقق PrefMoE دقة بلغت 78.93% مع إبقاء معدل الانهيار عند 10.96%.

الخلاصة

تشير الورقة إلى أنه لجعل الذكاء الاصطناعي شخصياً حقاً، لا يمكننا فقط تغذيته بمزيد من البيانات أو إخباره بأن "يكون أكثر ذكاءً". يجب علينا تعليمه كيفية الفصل بين الجمهور العام والفرد. ومن خلال تقسيم معلومات المستخدم إلى ملفات شخصية ثابتة وتفضيلات فريدة، وباستخدام نظام ذكي لتوجيه الأسئلة إلى "الخبير" المناسب، يمكننا منع الذكاء الاصطناعي من التخمين بناءً على ما يريده الأغلبية والبدء في مساعدتنا على فهم ما تريده أنت بالفعل.

بالطبع، يعترف المؤلفون بأنه ليس مثالياً بعد. إذا لم تقدم للذكاء الاصطناعي تعليمات واضحة حول تفضيلاتك، أو إذا لم تكن الصورة توفر أدلة كافية، فقد يخطئ الذكاء الاصطناعي في النهاية. لكن هذا النهج الجديد يقترح مساراً واعداً للمستقبل: مسار حيث يتذكر أمين المكتبة الرقمي أخيراً أنك، أنت تحديداً، تفضل مقهى الكتب الهادئ على الحفل الموسيقي الصاخب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →