← أحدث الأبحاث
🤖 AI

A Better Spur Should Start From Each Objective

تقترح الورقة البحثية تحسين التفضيل متعدد الهوامش (MMPO)، وهو إطار عمل دقيق المعالم يعالج مشكلات المكافآت الشحيحة وتضاربات التحسين في التعلم التعزيزي متعدد الأهداف في العالم الحقيقي من خلال التدخل على مستويات البيانات والتدرج والقيود لتحقيق محاذاة مستقرة وعالية الأداء عبر مهام متنوعة.

المؤلفون الأصليون: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

نُشر 2026-09-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في السوق الرقمية، غالبًا ما تكون صفحة المنتج عبارة عن جدار كثيف من النصوص، المليئة بالمواصفات الفنية والمصطلحات التسويقية التي يمكن أن ترهق المتسوق. ولتجسير الفجوة بين المعلومات المعقدة والفهم البشري، تُكلف تقنية الذكاء الاصطناًعي بشكل متزايد بمهمة مزدوجة: تحديد الكلمات الأكثر أهمية في وصف المنتج، ثم كتابة شرح قصير وواضح لها. هذه ليست مجرد عملية تحرير نصوص؛ بل هي عملية توازن دقيق. يجب على النظام استيفاء قواعد صارمة "خارج الإنترنت" (offline)، مثل ضمان دقة الكلمات المستخرجة وتغطيتها لكامل ميزات المنتج، بينما يسعى في الوقت نفسه لتحقيق أهداف "على الإنترنت" (online) مثل زيادة نقرات المستخدمين وتقليل حالات عدم الإعجاب. وغالبًا ما تسحب هذه الأهداف في اتجاهات متعارضة؛ فالميزة التي تولد الكثير من النقرات قد تكون عامة جدًا بحيث تفتقر للدقة، بينما المصطلح التقني عالي الدقة قد يكون غامضًا جدًا بحيث لا يثير اهتمام المتصفح العادي. وعندما تحاول البرامج الحاسوبية تحسين جميع هذه الأهداف المتضاربة في وقت واحد، فإنها غالبًا ما تتعثر، أو تتذبذب بعنف، أو تقع في حلقة مفرغة حيث يؤدي تحسين أحد المقاييس إلى انهيار مقياس آخر.

قام باحثون من معهد هاربين للتكنولوجيا، وشركة JD.com، والأكاديمية الصينية للعلوم، بتطوير طريقة جديدة لحل هذه المشكلة المحددة المتمثلة في الأهداف المتضاربة. وقد أطلقوا على نهجهم اسم "تحسين التفضيل متعدد الهوامش" (Multi-Marginal Preference Optimization)، وهو نظام مصمم لمنع الكمبيوتر من معاملة جميع الأهداف كمجموعة واحدة فوضوية من التعليمات. وبدلاً من إجبار النموذج على إيجاد إجابة واحدة "مثلى" تساوم على كل شيء، يعامل هذا الإطار الجديد كل هدف كمسار منفصل على طريق سريع. يقوم النظام أولاً بتنقية البيانات التي يتلقاها، مما يؤدي إلى تنعيم الإشارات الضوضائية والمتفرقة الناتجة عن سلوك المستخدم الحقيقي، مثل النقرات والإعجابات، والتي يمكن أن تكون مضللة إذا أُخذت على قيمتها الظاهرية. ومن خلال ضبط كيفية رؤية الكمبيوتر لهذه المكافآت، يضمن النظام عدم تجاهل المعلومات النادرة ولكن القيمة لمجرد أنها تظهر بشكل أقل من المصطلحات الشائعة.

يكمن الابتكار الجوهري في كيفية تعامل النظام مع عملية التعلم نفسها. فعندما يحاول الكمبيوتر تحسين أدائه، فإنه يولد تحديثات رياضية بناءً على أهدافه. وفي الطرق القديمة، كانت هذه التحديثات تُجمع ببساطة، مما كان يؤدي غالبًا إلى إلغاء تعليمات هدف ما لتعليمات هدف آخر أو تشويهها. أما الطريقة الجديدة، فتقوم بفصل هذه التحديثات قبل تطبيقها؛ إذ تحدد الأجزاء الضرورية من إشارة التعلم للدقة الأساسية، والأجزاء الخاصة بتفضيلات المستخدم، ثم تسقط إشارات التفضيل في مساحة لا تتعارض فيها مع القواعد الجوهرية. وهذا يسمح للنموذج بأن يتعلم كيف يكون أكثر إثارة لاهتمام المستخدمين دون أن ينسى بالخطأ كيفية الحفاظ على الدقة.

علايًا، أضاف الباحثون آلية سلامة لمنع النظام من أن يصبح عدوانيًا للغاية في مراحل متأخرة من التدريب. فمع تحسن النماذج، قد تركز أحيانًا على هدف واحد بكثافة شديدة لدرجة أنها تهمل الأهداف الأخرى، مما يؤدي إلى انخفاض مفاجئ في الجودة الإجمالية. يستخدم النظام الجديد قدرة النموذج الخاصة على اتباع التعليمات لوضع حدود؛ حيث يطلب من النموذج إنشاء أمثلة للسلوك المثالي في ظل ظروف مثالية، ويستخدم تلك الأمثلة لتحديد "منطقة آمنة" للتحديثات المستقبلية. فإذا حاول النموذج الدفع بقوة كبيرة في اتجاه واحد، يقوم هذا المرشد الداخلي بسحبه بلطف للوراء، مما يضمن بقاء التقدم ثابتًا ومتوازنًا عبر جميع المقاييس.

تم اختبار نتائج هذا النهج على مجموعة بيانات لمنتجات تجارة إلكترونية حقيقية، شملت 65,232 منتجًا للتدريب و8,879 منتجًا للتقييم، بالإضافة إلى بيانات سلوك المستخدم التي تم جمعها على مدار الأشهر الثلاثة الماضية. تمت مقارنة النظام بعدة طرق متقدمة أخرى، ووجد أنه أكثر استقرارًا وفعالية بشكل ملحوظ. في الاختبارات "خارج الإنترنت"، حقق درجة اكتمال بلغت 94.11 بالمائة ودقة بلغت 73.43 بالمائة، متفوقًا على الطرق السابقة بفوارق كبيرة. والأهم من ذلك، نجح في الوصول إلى معدل تغطية مستهدف قدره 22.82 بالمائة، وهو معدل يقترب من المثالية، بينما أخفقت الطرق الأخرى أو تجاوزت العلامة المطلية. ولم تكن هذه التحسينات نظرية فحسب؛ فعند نشره في اختبار "على الإنترنت" مباشر مع متسوقين حقيقيين، أدى النظام المدفوع بهذه الطة الجديدة إلى زيادة عدد الطلبات المقدمة بنسبة 3.14 بالمائة وإجمالي قيمة تلك الطلبات بنسبة 5.07 بالمائة مقارنة بالمعيار السابق.

يمتد نجاح هذا الإطار إلى ما وراء التسوق عبر الإنترنت؛ فقد طبقه الباحثون أيضًا على مهام تتعلق باستخدام الأدوات وتوليد أكواد الكمبيوتر، وهي مجالات يجب فيها تلبية قيود متعددة في آن واحد. وفي هذه الاختبارات، أنتجت الطريقة باستمرار نتائج أفضل من النهج القياسية، لا سيما في تجنب "انهيار النمط" (mode collapse) حيث يجد النموذج حلاً سهلاً واحدًا ويكرره بلا نهاية. بدلاً من ذلك، حافظ النظام الجديد على نطاق متنوع من المخرات عالية الجودة مع الالتزام بالقواعد الصارمة. ومن خلال فصل الأهداف المتضاربة وتوفير طريقة منظمة لموازنتها، يقدم هذا العمل حلاً عمليًا لجعل الذكاء الاصطناعي أكثر موثوقية في البيئات المعقدة في العالم الحقيقي، حيث تكون الأهداف المتعددة والمتنافسة هي القاعدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →