← أحدث الأبحاث
💬 NLP

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

تقدم الورقة البحثية Skywork-Reward-V2، وهي مجموعة من نماذج المكافأة المتطورة التي تم تدريبها على مجموعة بيانات SynPref-40M المكونة من 40 مليون زوج، والتي تم إنشاؤها باستخدام مسار تآزري بين الإنسان والذكاء الاصطناعي للتغلب على قيود بيانات التفضيل الحالية وتحقيق أداء فائق عبر معايير قياس متعددة.

المؤلفون الأصليون: Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

نُشر 2026-03-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت ذكي جداً ولكنه عنيد أحياناً كيف يكتب قصة، أو يحل مسألة رياضية، أو حتى كيف يتحدث بلطف مع الناس. لا يمكنك ببساطة أن تقول للروبوت: "كن جيداً". عليك أن تريه أمثلة لما يبدو عليه "الشيء الجيد" وما يبدو عليه "الشيء السيئ".

في عالم الذكاء الاصطناعي، تسمى هذه العملية "التعلم التعزيزي من التغذية الراجعة البشرية" (RLHF). يحتاج الروبوت إلى "نموذج مكافأة" (RM) — فكر فيه كأنه "معلم الذوق" الخاص بالروبوت. هذا المعلم ينظر إلى إجابتين مختلفتين قدمهما الروبوت ويقول: "أنا أفضل هذه لأنها أكثر فائدة"، أو "أنا أكره هذه لأنها وقحة".

لفترة طويلة، كانت هذه "معلمي الذوق" تعاني. كانت هشة، وسهلة الارتباك، ولا تستطيع التعامل مع الطريقة المعقدة والفوضوية التي يفكر بها البشر فعلياً. كانت تشبه ناقد طعام يعرف فقط كيف يقيم البيتزا، لكنه يصاب بالارتباك عندما تقدم له السوشي.

Skywork-Reward-V2 هو "معلم ذوق" جديد وفائق القدرة يعالج هذه المشكلات. وإليك كيف فعلوا ذلك، مشروحاً ببساطة:

1. المشكلة: الكثير من النفايات، والقليل من الذهب

أدرك الباحثون أن المشكلة لم تكن في عقل الروبوت، بل في بيانات التدريب.

  • الطريقة القديمة: حاولوا تغذية المعلم بملايين الأمثلة، لكن الكثير منها تم تصنيفه بواسطة روبوتات أخرى (ذكاء اصطناعي) أو كانت مجرد تعليقات عشوائية من الإنترنت. كان الأمر يشبه محاولة تعليم طاهٍ من خلال إظهار مزيج من وصفات حائزة على نجمة ميشلان وخبز محروق من محطة وقود. أصاب ذلك المعلم بالارتباك.
  • الرؤية الجديدة: افترضوا أنه إذا استطاعوا العثور على "الذهب" وسط النفايات، فبإمكانهم صنع معلم أفضل بكثير.

2. الحل: خط إنتاج "التآزر بين الإنسان والذكاء الاصطناعي"

بدلاً من مجرد توظيف آلاف البشر (وهو أمر بطيء ومكلف) أو ترك الروبوتات تصنف كل شيء (وهو أمر غير دقيق)، قاموا ببناء خط إنتاج من مرحلتين يجمع بين أفضل ما في العالمين.

المرحلة الأولى: ورشة عمل "المعيار الذهبي" (بقيادة البشر)

تخيل فريقاً صغيراً ونخبوياً من المحررين البشر الخبراء.

  • يأخذون مجموعة صغيرة من البيانات ويقومون بتصنيفها بعناقة فائقة.
  • السر المذهل: هؤلاء البشر لا يخمنون فقط. يُسمح لهم باستخدام محركات البحث، وأدوات الرياضيات، وحتى ذكاء اصطناعي آخر فائق الذكاء للتحقق من صحة إجاباتهم قبل تصنيفها.
  • التشبيه: يشبه الأمر حكماً في مسابقة طبخ لا يتذوق الطعام فحسب، بل يتحقق أيضاً من الوصفة، ودرجة حرارة الفرن، وطزاجة المكونات قبل إعطاء الدرجة.
  • النتيجة: مجموعة صغيرة من "البيانات الذهبية" الموثوقة بنسبة 100%.

المرحلة الثانية: مصنع "الإنتاج الضخم" (بقيادة الذكاء الاصطناعي)

الآن، لدينا "المعيار الذهبي" من المرحلة الأولى. يستخدمون هذا لتدريب "معلم ذهبي" (نموذج مكافأة).

  • يأخذون جبلاً هائلاً من البيانات "البرية" من الإنترنت (40 مليون زوج!).
  • ينظر "المعلم الذهبي" إلى هذا الجبل ويقول: "هذا يبدو مثل المعيار الذهبي، احتفظ به". أو "هذا يبدو خاطئاً، اقلبه". أو "هذا مربك، دعنا نسأل روبوتاً آخر للتحقق منه باستخدام المعيار الذهبي كدليل".
  • التشبيه: فكر في "المعلم الذهبي" كأنه رئيس عمال في موقع بناء. هو لا يضع كل طوبة بنفسه، بل يدرب مجموعة من الروبوتات لوضع الطوب، لكنه يتحقق باستمرار من عملهم مقابل مخططاته الخاصة. إذا ارتكب روبوت خطأً، يقوم رئيس العمال بتصحيحه.
  • النتيجة: حولوا ذلك الجبل الفوضوي المكون من 40 مليون زوج إلى مجموعة نظيفة ومنقحة من 26 مليون مثال عالي الجودة.

3. النتيجة: سلسلة Skywork-Reward-V2

باستخدام هذه البيانات فائقة النقاء، قاموا بتدريب عائلة من 8 "معلمي ذوق" جدد (نماذج مكافأة).

  • الحجم: تتراوح أحجامهم من صغيرة جداً (0.6 مليار معلمة) إلى متوسطة الحجم (8 مليارات معلمة).
  • الأداء: حتى النماذج الصغيرة منها أذكى من المعلمين الضخمين (70 مليار معلمة) من الشركات الأخرى.
  • لماذا؟ لأن الجودة > الكمية. معلم تدرب على 26 مليون مثال مثالي أفضل من معلم تدرب على 100 مليون مثال مربك.

4. لماذا هذا مهم (ما هي الفائدة؟)

  • روبوتات أفضل: يمكن لهؤلاء المعلمين الجدد الآن توجيه الذكاء الاصطناعي ليكون أكثر فائدة، وأماناً، وصدقاً. فهم لا يُخدعون بالإجابات التي تبدو براقة ولكنها خاطئة (المقاومة لـ "تحيز الأسلوب").
  • فعالية التكلفة: لا تحتاج لإنفاق ملايين الدولارات لتوظيف البشر لتصنيف كل شيء. تحتاج فقط لفريق صغير من الخبراء لوضع القواعد، ثم يمكن للذكاء الاصطناعي القيام بالعمل الشاق.
  • قوة "أفضل من N": إذا طلبت من ذكاء اصطناعي توليد 10 إجابات مختلفة واختيار الأفضل من بينها، فإن هؤلاء المعلمين الجدد بارعون جداً في رصد الفائز، حتى لو كان الفرق ضئيلاً جداً.

الخلاصة الكبرى

يثبت هذا البحث أننا لسنا بحاجة لانتظار حواسيب أكبر وأكثر تكلفة لصنع ذكاء اصطناعي أفضل. بدلاً من ذلك، نحن بحاجة إلى تنقية أفضل للبيانات.

من خلال الجمع بين الخبرة البشرية (لوضع المعيار) مع نطاق الذكاء الاصطناعي (لمعالجة البيانات)، خلق Skywork نظاماً يطلق العنان للإمكانات الكامنة في البيانات الموجودة. الأمر يشبه إدراك أن المحيط بأكمله مليء بالأسماك، لكنك كنت تحتاج فقط إلى شبكة أفضل لصيد الأسماك الجيدة.

باخت مختصر: لقد بنوا "معلم ذوق" أفضل من خلال تعليمه كيف يتعلم من أفضل الخبراء البشر، ثم تركوه يعلم ملايين الروبوتات الأخرى كيف تكون جيدة أيضاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →