Unified Data Selection for LLM Reasoning
تقدم هذه الورقة "مجموع الإنتروبيا العالية" (HES)، وهو مقياس لا يتطلب تدريباً يعمل على تحديد بيانات الاستدلال عالية الجودة بكفاءة من خلال جمع الإنتروبيا لأعلى الرموز، مما يحسن بشكل كبير أداء النماذج اللغوية الكبيرة عبر نماذج الضبط الدقيق الخاضع للإشراف، والضبط الدقيق بالرفض، والتعلم التعزيزي، مع تقليل التكاليف الحسابية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم طالب صغير جداً ولكنه عبقري (نموذج لغوي كبير) كيفية حل الألغاز المعقدة، مثل المسائل الرياضية المتقدمة. يتعلم الطالب من خلال قراءة آلاف الحلول النموذجية. ولكن هنا تكمن المشكلة: ليست كل الحلول متساوية في الجودة. فبعضها عبارة عن روائع واضحة ومنطقية، بينما البعض الآخر عبارة عن هراء مشوش ومربك. إذا قمت بتغذية الطالب بكل تلك الأمثلة المشوشة جنباً إلى جنب مع الأمثلة الجيدة، فقد يصاب بالارتباك أو يكتسب عادات سيئة.
لفترة طويلة، حاول الباحثون تصفية الأمثلة السيئة من خلال النظر في أشياء بسيطة، مثل مدى طول الحل أو مدى "المفاجأة" التي شعر بها النموذج أثناء الكتابة. لكن الورقة البحثية تجادل بأن هذه الأساليب تشبه الحكم على فيلم كامل بناءً على متوسط سطوعه؛ فهي تغفل اللحظات الأكثر أهمية وإثارة.
الفكرة الجوهرية: العثور على "التحولات الدرامية"
يقترح المؤلفون في هذه الورقة طريقة جديدة لإيجاد أفضل بيانات التدريب، تسمى مجموع الإنتروبيا العالية (High-Entropy Sum - HES).
فكر في عملية الاستدلال (مثل حل مسألة رياضية) كأنها رحلة برية طويلة.
- الرموز ذات الإنتروبيا المنخفضة (Low-Entropy Tokens): هي الأجزاء المملة والمتوقعة من الرحلة. "انعطف يساراً"، "سِر بشكل مستقيم"، "السماء زرقاء". النموذج يعرف تماماً ما سيأتي بعد ذلك. إنه وضع الطيار الآلي.
- الرموز ذات الإنتروبيا العالية (High-Entropy Tokens): هي نقاط القرار الحاسمة. "انتظر، هل يجب أن أنعطف هنا؟ أم ربما أسلك طريقاً جانبياً؟ ماذا لو جربت هذا المسار الغريب؟" هنا حيث يفكر النموذج حقاً، ويزن الخيارات، ويتخذ قراراً صعباً.
اكتشاف الورقة الكبير هو أن جودة مسار الاستدلال لا تتعلق بعدد الخطوات "المملة" التي يتضمنها، بل بعدد "نقاط القرار الحرجة" هذه التي ينجح في تجاوزها.
المقياس الجديد: "مجموع الإنتروبيا العالية"
بدلاً من حساب "متوسط مستوى المفاجأة" للرحلة بأكملها (مما يؤدي إلى تمييع اللحظات المهمة بالأجزاء المملة)، ابتكر المؤلفون درجة جديدة تسمى HES.
التشبيه: تخيل أنك ناقد سينمائي تراجع فيلماً.
- الطريقة القديمة (متوسط الإنتروبيا): أنت تقيم الفيلم بناءً على متوسط مستوى الإثارة في كل ثانية. إذا كان الفيلم يحتوي على 90 دقيقة من الحوار الممل و5 دقائق من الانفجار، فإن متوسط الدرجة سيكون منخفضاً. قد تفوتك حقيقة أن الانفجار كان تحفة فنية.
- طريقة HES: أنت تتجاهل الـ 90 دقيقة المملة. تنظر فقط إلى أفضل 0.5% من اللحظات الأكثر إثارة وغير المتوقعة (الانفجارات، التحولات الدرامية). تقوم بجمع شدة تلك اللحظات فقط. إذا كان لدى فيلم بعض المشاهد المذهلة وعالية المخاطر، فإنه يحصل على درجة عالية. أما إذا كان مجرد رحلة مسطحة ومملة بلا مفاجآت، فسيحصل على درجة منخفضة.
تظهر الورقة أن هذا "مجموع أفضل اللحظات" هو الطريقة المثالية للتمييز بين مسار استدلال عالي الجودة وآخر منخفض الجودة.
كيف استخدموا ذلك (أساليب التدريب الثلاثة)
اختبر الفريق مقياس التصفية "HES" هذا على ثلاث طرق مختلفة لتعليم الذكاء الاصطنا، وقد نجح الأمر بشكل رائع في جميعها:
الضبط الدقيق الخاضع للإشراف (SFT) - "طريقة الكتاب المدرسي":
- السيناريو: لديك مكتبة ضخمة من المسائل المحلولة. تريد اختيار أفضلها لتعليم الذكاء الاصطناعي.
- النتيجة: عندما استخدموا HES لاختيار أفضل 20% فقط من الأمثلة الأفضل، تعلم الذكاء الاصطناعي بنفس جودة قراءته للمكتبة بأكملها. في الواقع، إذا اختاروا أسوأ 20% (أقل HES)، أصبح الذكاء الاصطناعي أسوأ بكثير. لقد أثبت ذلك أن الأقل هو الأكثر، طالما أنك تختار "الأقل" الصحيح.
- ميزة إضافية: وجدوا أنه يمكنهم استخدام نموذج حاسوبي صغير ورخيص للقيام بعملية التصفية لنموذج ضخم ومكلف، مما يوفر مبالض هائلة من المال.
الضبط الدقيق بالرفض (RFT) - "طريقة الاختيار من متعدد":
- السيناريو: يقوم الذكاء الاصطناعي بتوليد 32 إجابة مختلفة لسؤال واحد. أنت بحاجة لاختيار الأفضل منها للاحتفاظ به.
- النتيجة: بدلاً من الاختيار عشوائياً أو اختيار الإجابة الأطول، استخدموا HES لاختيار الإجابة التي تحتوي على أكبر عدد من "لحظات التفكير النقدي". وقد تفوق هذا الأسلوب باستمرار على التخمين العشوائي.
التعلم التعزيزي (RL) - "طريقة التجربة والخطأ":
- السيناريو: يحاول الذكاء الاصطناعي حل مسألة، ويحصل على مكافأة إذا كان صحيحاً، ويتعلم من التجربة.
- النتيجة: تركوا الذكاء الاصطناعي يولد محاولات عديدة. استخدموا HES لاختيار أفضل 50% فقط من المحاولات الناجحة لتعليم الذكاء الاصطناعي. جعل هذا الذكاء الاصطناعي يتعلم بشكل أسرع وأفضل مما لو استخدموا جميع المحاولات (بما في ذلك المتوسطة).
لماذا هذا مهم (بدون مبالغة)
تدعي الورقة أن هذه الطريقة هي حل "موحد". فهي لا تتطلب تدريب ذكاء اصطناعي جديد ومكلف فقط للقيام بعملية التصفية. إنها عملية حسابية بسيطة تعتمد على مستويات "المفاجأة" الداخلية للنموذج نفسه.
- إنها سريعة: لا تبطئ عملية التدريب.
- إنها رخيصة: يمكنك استخدام نموذج صغير لتصفية البيانات لنموذج كبير.
- إنها فعالة: تساعد باستمرار الذكاء الاصطناعي على تعلم مهارات الاستدلال بشكل أفضل، من خلال التركيز على "مفترقات الطرق الحرجة" حيث يحدث التفكير الحقيقي، بدلاً من الأجزاء المملة والمتوقعة.
باخت-الاختصار، تقول الورقة: لا تحكم على مسار الاستدلال بطوله أو بجودته المتوسطة. احكم عليه بكثافة لحظاته الأصعب والأكثر حرجاً. من خلال التركيز فقط على تلك اللحظات، يمكننا تعليم الذكاء الاصطناعي التفكير بشكل أفضل، وأسرع، وبتكلفة أقل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.