← أحدث الأبحاث
💻 computer science

POPI: Personalizing LLMs via Optimized Natural Language Preference Inference

إنَّ POPI هو إطار عمل للتخصيص على مستوى المستخدم يوظف واجهة لغة طبيعية لاستخلاص إشارات المستخدم غير المتجانسة وتحويلها إلى ملخصات تفضيلات قابلة لإعادة الاستخدام، مما يتيح تحسين جودة التخصيص وتقليل عبء السياق بشكل كبير عبر مختلف النماذج اللغوية.

المؤلفون الأصليون: Yizhuo Chen, Xin Liu, Ruijie Wang, Zheng Li, Pei Chen, Changlong Yu, Qingyu Yin, Priyanka Nigam, Meng Jiang, Bing Yin

نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yizhuo Chen, Xin Liu, Ruijie Wang, Zheng Li, Pei Chen, Changlong Yu, Qingyu Yin, Priyanka Nigam, Meng Jiang, Bing Yin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث "POPI: تخصيص النماذج اللغوية الكبيرة عبر الاستنتاج الأمثل لتفضيلات اللغة الطبيعية" باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: المقاس الواحد لا يناسب الجميع

تخيل أنك دخلت مطعماً ضخماً عالي التقنية (النموذج اللغوي الكبير، أو LLM). الشيف هناك موهوب للغاية ويمكنه طهي أي شيء تقريباً. ومع ذلك، فإن الشيف يطهو للشخص "المتوسط". إذا كنت تحب شريحة اللحم مطهوة جيداً وحارة، لكن الشيف يقدمها دائماً نصف مطهوة وخفيفة لأن هذا ما يريده معظم الزبائن، فلن تكون سعيداً.

حالياً، جعل الشيف يطهو خصيصاً لك هو كابوس. سيتعين عليك توظيف شيف كامل جديد من أجلك فقط، أو قضاء ساعات في تعليم الشيف الحالي أذواقك الخاصة في كل مرة تطلب فيها الطعام. هذا مكلف وبطيء للغاية.

الحل: POPI (الخبير الشخصي - Sommelier)

يقدم المؤلفون POPI، وهي طريقة جديدة لجعل نماذج الذكاء الاصطناعي تتصرف وكأنها تعرفك، دون الحاجة لتوظيف شيف جديد أو إعادة تدريب المطبخ بالكامل.

فكر في POPI على أنه خبير شخصي (Sommelier) (خبير في تقديم المشروبات والأطعمة) يعمل بينك وبين الشيف.

  1. أنت (المستخدم): تعطي الخبير بعض الأدلة حول ذوقك. ربما كتبت بعض المراجعات، أو دردشت مع الذكاء الاصطناعي من قبل، أو قلت له ببساطة: "أحب الإجابات القصيرة والمرحة".
  2. الخبير (نموذج الاستنتاج): بدلاً من تسليم الشيف كومة فوضوية من ملاحظاتك، يقوم الخبير بقراءتها وكتابة ملخص موجز بلغة طبيعية على بطاقة صغيرة.
    • مثال: بدلاً من تسليم الشيف 50 صفحة من تاريخ دردشاتك، يكتب الخبير: "يفضل هذا المستخدم الردود المبهجة، وتجنب المصطلحات التقنية، والحفاظ على الشروحات في أقل من ثلاث جمل".
  3. الشيف (المولد): يأخذ الشيف هذه البطاقة الصغيرة، وينظر إلى طلبك (الأمر/Prompt)، ويطهو وجبة مصممة خصيصاً لتلك التعليمات.

كيف يعمل الأمر: سحر "التحسين" (Optimization)

تدعي الورقة البحثية أن الطرق السابقة كانت تشبه إعطاء الشيف قائمة غير منظمة وفوضوية بتفضيلاتك. أما POPI فهو مميز لأنه يدرب الخبير على كتابة بطاقة الملخص المثالية.

  • عملية التدريب: الخبير والشيف يتدربان معاً. يحاول الخبير كتابة ملخصات مختلفة. إذا صنع الشيف وجبة رائعة بناءً على ملخص ما، يحصل الخبير على "مكافأة". وإذا صنع الشيف وجبة سيئة، يتعلم الخبير كتابة ملخص أفضل في المرة القادمة.
  • النتيجة: يتعلم الخبير ضغط تاريخك المعقد في ملاحظة صغيرة وفعالة للغاية. هذه الملاحظة جيدة جداً لدرجة أنها تتسع في جيب الشيف (مما يوفر المساحة) وتخبره بالضبط بما يجب فعله.

لماذا يعد هذا تغييراً جذرياً للعبة؟

تسلط الورقة الضوء على ثلاث قدرات خارقة لهذا النهج:

1. "المحول العالمي" (قابلية نقل المولد - Generator Transferability)
لأن الخبير يكتب بـ اللغة الطبيعية (الإنجليزية)، لا يحتاج الشيف لتعلم شفرة سرية.

  • التشبيه: تخيل أن لديك خبيراً يكتب ملاحظة باللغة الإنجليزية. يمكنك أخذ نفس الملاحظة إلى شيف فرنسي، أو شيف ياباني، أو حتى شيف آلي. طالما يمكنهم قراءة الإنجليزية، يمكنهم الطهي لك.
  • الادعاء في الواقع: اختبر المؤلفون ذلك عبر أخذ الملخصات التي تم تعلمها من ذكاء اصطناعي واحد واستخدامها مع نماذج ذكاء اصطناعي تجارية مختلفة ومجمدة (مثل GPT-4o أو Claude). وقد نجح الأمر دون الحاجة لإعادة تدريب النماذج الجديدة.

2. توفير المساحة (عبء السياق - Context Overhead)
عادةً، لتخصيص الذكاء الاصطناعي، يتعين عليك لصق تاريخك الكامل في الدردشة في كل مرة. هذا يشبه إحضار سيرة ذاتية مكونة من 500 صفحة لمقابلة مدتها 5 دقائق.

  • ادعاء POPI: يقوم الخبير بضغط تلك السيرة الذاتية المكونة من 500 صفحة إلى ملاحظة من 50 كلمة. وتدعي الورقة أن هذا يقلل من "عبء السياق" (كمية النص التي يجب على الذكاء الاصطناعي قراءتها) بمقدار يصل إلى 10 أضعاف.

3. يعمل على نماذج "الصندوق الأسود" (Black Box Models)
لا تحتاج لامتلاك المطبخ لتتمكن من استخدامه. حتى لو كان الشيف عبارة عن "صندوق أسود" (واجهة برمجة تطبيقات تجارية لا يمكنك تغييرها أو إعادة تدريبها)، يمكنك استخدام ملاحظة الخبير الخاصة بك للحصول على نتائج مخصصة.

ما الذي أثبتته الورقة البحثية بالفعل؟

اختبر المؤلفون هذا النظام في أربعة "مطابخ" (معايير اختبار):

  • كتابة المراجعات: جعل الذكاء الاصطناعي يكتب مراجعات الأفلام بأسلوبك الخاص.
  • شرح العلوم: جعل الذكاء الاصطناعي يشرح مواضيع معقدة بالمستوى المناسب (على سبيل المثال، لطفل مقابل خبير).
  • تقمص الأدوار (Roleplay): جعل الذكاء الاصطناعي يتصرف كشخصية محددة.
  • مناقشات المنتديات: جعل الذكاء الاصطناعي يكتب تعليقات تبدو وكأنها صادرة عن شخص معين.

النتائج:

  • جعل POPI ردود الذكاء الاصطناعي أكثر توافقاً مع تفضيلات المستخدم مقاروت مجرد لصق التاريخ الخام.
  • فعل ذلك باستخدام نص أقل بكثير (مساحة).
  • عملت "ملاحظات الخبير" حتى عندما تم تغيير "شيف الذكاء الاصطناعي" إلى علامة تجارية أو حجم مختلف.

ما الذي لا تدعيه الورقة؟

  • هي لا تدعي حل مشكلات الخصوصية (فهي لا تزال بحاجة لبياناتك لعمل الملخص).
  • هي لا تدعي أن الذكاء الاصطنا_س سيتذكرك للأبد دون تقديم الإشارات الأولية.
  • هي لا تدعي أنها تعمل للتفضيلات التي تتغير بشكل جذري كل ثانية (فهي تفترض أن تفضيلاتك الأساسية مستقرة نسبياً).

الملخص

POPI يشبه توظيف مساعد ذكي يقرأ مذكراتك الفوضوية، ويكتب "ورقة غش" مثالية عن شخصيتك، ثم يسلم ورقة الغش تلك لأي ذكاء اصطناعي تريد استخدامه. هذا يجعل الذكاء الاصطناعي يشعرك بأنه يعرفك، ويوفر مساحة هائلة من ذاكرة الكمبيوتر، ويعمل حتى لو انتقلت إلى شركة ذكاء اصطنا آخر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →