← أحدث الأبحاث
🤖 AI

Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training

تقدم هذه الورقة نظرية تمييز التوزيع (DDT) لتمكين الضبط الدقيق الخاضع للإشراف أثناء السياسة (On-Policy)، مقترحةً تقنيتي "الضبط الدقيق داخل التوزيع" و"فك التشفير الملمّح" اللتين تحققان أداء تعميم يتجاوز خوارزميات التعلم المعزز غير المتصل بالسياسة مثل DPO وSimPO، مع الاحتفاظ بالكفاءة الحسابية للضبط الدقيق الخاضع للإشراف (SFT).

المؤلفون الأصليون: Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baining Guo

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Miaosen Zhang, Yishan Liu, Shuxia Lin, Xu Yang, Qi Dai, Chong Luo, Weihao Jiang, Peng Hou, Anxiang Zeng, Xin Geng, Baining Guo

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً عبقرياً، ولكنه دقيق للغاية (وهو الذكاء الاصطناعي)، كيفية حل المسائل الرياضية. لديك طريقتان رئيسيتان لتعليمه:

  1. طريقة "الكتاب المدرسي" (الضبط الدقيق الخاضع للإشراف / SFT): أنت تعطي الطالب مجموعة من مفاتيح الإجابات من كتاب مدرسي، وتقول له: "احفظ هذه الإجابات تماماً".

    • المشكلة: قد تكون إجابات الكتاب مكتوبة بأسلوب لا يستخدمه الطالب بشكل طبيعي، أو قد تحتوي على أخطاء بسيطة. إذا أجبرت الطالب على حفظها بشكل أعمى، فقد ينسى طريقة تفكيره الطبيعية أو يبدأ في اختلاق هراء لمجرد مطابقة الكتاب. سيصبح "ببغاءً" بدلاً من أن يكون مفكراً.
  2. طريقة "الاختبار التجريبي" (التعلم التعزيزي / RL): أنت تترك الطالب يحاول حل المسائل بمفرده. عندما يصيب، تعطيه نجمة ذهبية. وعندما يخطئ، تسحبها منه.

    • المشكلة: هذه الطريقة بطيئة للغاية ومكلفة. عليك إجراء آلاف الاختبارات التجريبية للحصول على بضع نجمات ذهبية فقط. وأيضاً، إذا تعثر الطالب، فقد لا تعرف لماذا فشل، مما يجعل من الصعب إصلاح الأمر.

الفكرة الكبرى:
تساءل مؤلفو هذه الورقة البحثية: "هل يمكننا الحصول على سرعة طريقة الكتاب المدرسي، ولكن مع التفكير الطبيعي والذكي لطريقة الاختبار التجريبي؟"

أدركوا أن الإجابة هي نعم، ولكن فقط إذا توقفنا عن إجبار الطالب على حفظ كل شيء في الكتاب المدرسي، وبدأنا في تعليمه فقط الأجزاء التي تتوافق مع عقله الطبيعي.

إليكم كيف فعلوا ذلك، مقسماً إلى ثلاثة مفاهيم بسيطة:

1. "اختبار النغمة" (نظرية التمييز التوزيعي - DDT)

تخيل أن لدى الطالب "نغمة" أو إيقاعاً طبيعياً خاصاً به عند التحدث. بعض الإجابات في الكتاب المدرسي تبدو وكأنها كُتبت بواسطة روبوت؛ وبعضها الآخر يبدو وكأن بشراً كتبها.

ابتكر المؤلفون "اختبار نغمة" رياضياً (يسمى DDT). وهي أداة تمسح كل كلمة في إجابة الكتاب المدرسي وتسأل: "هل تبدو هذه الكلمة وكأنها شيء قد يقوله طالبنا بشكل طبيعي؟"

  • إذا كانت الكلمة تبدو طبيعية (داخل التوزيع - In-Distribution)، تقول الأداة: "جيد! احتفظ بها".
  • إذا كانت الكلمة تبدو متكلفة أو غريبة (خارج التوزيع - Out-of-Distribution)، تقول الأداة: "انتظر، هذا لا يشبهك. دعنا نتجاهل هذا الجزء".

التشبيه: فكر في الأمر كمنسق موسيقى (DJ) يمزج الأغاني. إذا كانت الأغنية ذات إيقاع يتصادم مع النغمة الحالية، فإن المنسق لا يقوم فقط برفع صوتها، بل يخفضها تدريجياً أو يتخطاها ليبقى جو الرقص متناغماً.

2. "قلم التحديد الذكي" (الضبط الدقيق داخل التوزيع / IDFT)

بمجرد حصولهم على "اختبار النغمة"، بنوا طريقة تدريب جديدة تسمى IDFT.

في التدريب العادي، إذا أخطأ الطالب في كلمة مقارنة بالكتاب المدرسي، يصرخ المعلم: "لا! غير دماغك!" وهذا يسبب ذعراً للطالب ويجعله ينسى كل ما يعرفه بالفعل (وهذا ما يسمى النسيان الكارثي).

مع IDFT، يكون المعلم أكثر ذكاءً:

  • الكلمات السهلة/العادية: "عمل رائع! استمر فيما تفعله". (يعزز أسلوبه الطبيعي).
  • الكلمات الغريبة/غير المتناغمة: "هذا ليس أسلوبك تماماً. دعنا لا نضغط بشأن هذه الكلمة المحددة الآن". (يحمي دماغه من الارتباك).

التشبيه: تخيل أنك تتعلم الرسم. المعلم العادي يجبرك على نسخ لوحة فنية بدقة، حتى ضربات الفرشاة الفوضوية التي لا تفهمها. معلم الـ IDFT يقول لك: "انسخ الألوان والأشكال التي تفهمها جيداً، ولكن إذا استخدم الفنان تقنية غريبة لا تستوعبها، فاترك مساحة فارغة هناك في الوقت الحالي. لا تفسد أسلوب رسمك الخاص في محاولة لفرض ذلك".

3. "الكاتب الخفي" (التشفير الموجه بالهبات / Hinted Decoding)

أحياناً، تكون إجابة الكتاب المدرسي صحيحة، لكن الطالب لا يستطيع إنتاجها لأنه يبدو غريباً جداً عليه. ابتكر المؤلفون خدعة تسمى Hinted Decoding.

تخيل أن الطالب يكتب مقالاً. هو يعرف الحقائق (الإجابة صحيحة)، لكنه يعاني من الأسلوب (كيفية قولها).

  • الطريقة القديمة: يحاول الطالب تقليد أسلوب الكتاب المدرسي ويفشل.
  • الطريقة الجديدة (التشفير الموجه بالهبات): يهمس المعلم بالحقائق للطالب ("الإجابة هي 42")، لكنه يخبره: "الآن، اكتب بقية القصة بصوتك الخاص".

يقوم الذكاء الاصطناعي بتوليد الإجابة باستخدام أسلوبه الطبيعي، ولكن مسترشداً بالحقائق الصحيحة. إنه يشبه امتلاك كاتب خفي يعرف الحقائق ولكنه يكتب بصوت المؤلف الفريد.

لماذا يعد هذا أمراً هاماً؟

  • إنه سريع: إنه سريع مثل قراءة الكتاب المدرسي (SFT)، وليس بطيئاً مثل إجراء آلاف الاختبارات التجريبية (RL).
  • إنه آمن: يمنع الذكاء الاصطناعي من "نسيان" كيف يكون مساعداً مفيداً أثناء تعلم مهارات رياضية جديدة.
  • إنه أفضل من RL: للمفاجأة، أدت طريقتهم أداءً أفضل من طرق التعلم التعزيزي (RL) المكلفة في مهام الرياضيات والبرمجة، باستخدام قدر أقل بكثير من طاقة الحاسوب.

باختصار:
تقول الورقة البحثية: "لا تجبروا الذكاء الاصطناعي على أن يكون روبوتاً يقلد الكتب المدرسية. بدلاً من ذلك، علموه باستخدام مرشح (فلتر) يسمح فقط بدخول المعرفة التي تناسب شخصيته الطبيعية. بهذه الطريقة، سيتعلم بشكل أسرع، ويتذكر أكثر، ويظل ذكياً".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →