← أحدث الأبحاث
💬 NLP

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback

تقدم الورقة البحثية إطار عمل WildFeedback، وهو إطار عمل مبتكر يقوم ببناء مجموعات بيانات التفضيلات تلقائياً من خلال استخراج وتصنيف ملاحظات المستخدمين المباشرة من المحادثات متعددة الأدوار، مما يمكّن النماذج اللغوية الكبيرة من تحقيق تحسن ملحوظ في التوافق مع تفضيلات المستخدمين في العالم الحقيقي مع التغلب على قيود القابلية للتوسع والتحيز التي تعيب طرق التوسيم التقليدية.

المؤلفون الأصليون: Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

نُشر 2026-04-20
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم مساعد آلي ذكي جداً، ولكنه عنيد قليلاً، كيف يتحدث مع البشر.

الطريقة القديمة: أسلوب "المعلم الصارم"
تقليدياً، لتعليم هذه الروبوتات (النماذج اللغوية الكبيرة أو LLMs)، كان البشر يعملون كمعلمين صارمين. كانوا يجلسون ويكتبون آلاف الأمثلة على الإجابات "الجيدة" و"السيئة"، ويصححون واجبات الروبوت المنزلية.

  • المشكلة: هذا الأمر مكلف، بطيء، وقد لا يمثل المعلمون الجميع. الأمر يشبه استئجار لجنة من نقاد الطعام لتقرير ما يريده العالم أجمع. قد يحبون هم الطعام الحار، لكن بقية العالم قد يفضلون طعاماً خفيفاً. أيضاً، إذا طلبت من الروبوت أن يصحح واجبه المنزلي بنفسه (باست مستخدم الذكاء الاصطنا Artificial Intelligence لإنشاء البيانات)، فإنه سيبدأ فقط في تكرار تحيزاته الخاصة، مثل طالب يدرس فقط الإجابات التي يعرفها بالفعل.

الطريقة الجديدة: "WildFeedback" (أسلوب "الجمهور المباشر")
يقدم هذا البحث إطار عمل جديداً يسمى WildFeedback. بدلاً من وجود فصل دراسي مع معلم، تخيل أن الروبوت هو كوميدي يقدم عرضاً مباشراً في نادٍ مزدحم.

  1. الاستماع إلى الجمهور (التغذية الراجعة في الموقع):
    بدلاً من انتظار المعلم ليصحح للروبوت لاحقاً، يقوم WildFeedback بالاستماع إلى الجمهور أثناء حدوث العرض.
  • إذا ضحك الجمهور، أو صفقوا، أو قالوا: "كان ذلك رائعاً!" (الرضا)، فإن الروبوت يعرف أنه على المسار الصحيح.
  • إذا تذمر الجمهور، أو تفقدوا ساعاتهم، أو قالوا: "هل يمكنك تجربة ذلك مجدداً؟ كان ذلك مربكاً" (عدم الرضا)، فإن الروبوت يعرف أنه أخطأ.
  • السر السحري: يقوم النظام تلقائياً بمسح ملايين المحادثات الحقيقية للعثور على هذه اللحظات. هو لا يحتاج إلى إنسان ليكتب "هذا كان سيئاً"؛ بل يبحث فقط عن المستخدم وهو يقول: "لا، ليس هذا ما قصدته".
  1. وضع خطة الدرس (بيانات التفضيل):
    بمجرد أن يرصد النظام لحظة عدم رضا المستخدم (إشارة DSAT)، فإنه ينشئ مثالاً للتعلم.
  • الأمر (Prompt): "إليك ما طلبه المستخدم".
  • الخطأ: "إليك الإجابة التي قدمها الروبوت والتي جعلت المستخدم غير راضٍ".
  • الإصلاح: "إليك ما أراده المستخدم فعلياً (ملخصاً من ملاحظاته)، وإليك إجابة جديدة وأفضل".
  • الأمر يشبه الكوميدي الذي يشاهد تسجيلاً لنكتة لم تنجح، فيدرك أن الجمهور أراد نهاية أقصر، ثم يتدرب على النسخة الصحيحة من أجل المرة القادمة.
  1. قاضي "قائمة التحقق" (التقييم):
    عادةً، نختبر الروبوتات عبر جعلها تقيم بعضها البعض، وهذا أمر متحيز (فهي تميل للإعجاب بالإجابات الطويلة والمنمقة). يقدم WildFeedback حكماً يسمى قائمة التحقق (Checklist).
  • تخيل قاضياً يقيم الروبوت ليس فقط بناءً على "هل هو ذكي؟"، بل على "هل استمع إلى هذا المستخدم تحديداً؟".
  • يأخذ النظام ملاحظات المستخدم الفعلية (على سبيل المثال: "كنت أريد صوتاً بنبرة قرصان، وليس صوت قرصان يبدو كأنه روبوت") ويحولها إلى قائمة تحقق. ثم يستخدم القاضي هذه القائمة ليرى ما إذا كان الروبوت قد تحسن بالفعل. هذا يضمن أن الروبوت يتعلم ما يريده البشر الحقيقيون، وليس فقط ما يبدو جيداً بالنسبة للكمبيوتر.

النتيجة
اختبر الباحثون هذا الأسلوب على مجموعة بيانات ضخمة من المحادثات الحقيقية (WildChat). ووجدوا أن الروبوتات التي تدربت باستخدام أسلوب "الجمهور المباشر" هذا أصبحت أفضل بكثير في فهم ما يريده البشر الحقيقيون فعلياً. لقد أصبحوا أقل عرضة لتقديم إجابات آلية عامة، وأكثر قدرة على التكيف مع الاحتياجات المحددة، والمثيرة للغرابة أحياناً، للشخص الذي يتحدث معهم.

باخت-صار:

  • الطريقة القديمة: اطلب من بعض الخبراء كتابة كتاب مدرسي حول كيفية التحدث مع الناس.
  • WildFeedback: شاهد ملايين المحادثات الحقيقية، وانظر أين ينزعج الناس أو يسعدون، وعلم الروبوت من خلال إظهار ما أراده هؤلاء الناس بالضبط. إنه يشبه تعلم الرقص من خلال مراقبة رد فعل الجمهور تجاه حركاتك، بدلاً من قراءة دليل تعليمي عن الرقص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →