← أحدث الأبحاث
🤖 machine learning

Compute Aligned Training: Optimizing for Test Time Inference

تقدم هذه الورقة "التدريب المتوافق مع الحوسبة" (Compute Aligned Training)، وهو إطار عمل مبتكر يعمل على مواءمة أهداف التدريب للنماذج اللغوية الكبيرة مع استراتيجيات الاستدلال في وقت الاختبار عبر اشتقاق دوال خسارة جديدة، مما يؤدي إلى تحسين توسع الأداء بشكل كبير مقارنة بأساليب الضبط الدقيق الموجه للتعليمات (SFT) والتعلم المعزز (RL) القياسية.

المؤلفون الأصليون: Adam Ousherovitch, Ambuj Tewari

نُشر 2026-04-29
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Adam Ousherovitch, Ambuj Tewari

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتدريب طالب من أجل امتحان نهائي محدد للغاية.

الطريقة القديمة (التدريب القياسي):
تقليديًا، عندما نعلم نماذج الذكاء الاصطناعي (مثل تلك التي تكتب المقالات أو تحل المسائل الرياضية)، فإننا نتصرف كمعلم صارم يصحح كل واجب منزلي بشكل فردي. إذا أجاب الطالب بشكل صحيح، نقول له "أحسنت!"، وإذا أخطأ، نقول له "حاول مرة أخرى". نحن نريد من الطالب أن يكون مثاليًا في الحصول على الإجابة الأولى الصحيحة في كل مرة.

المشكلة هي أن هذا لا يهيئهم للاختبار الحقيقي. في العالم الحقيقي، لا نطلب من النموذج إجابة واحدة فقط؛ بل نطلب منه توليد إجابات عديدة (مثل طلب كتابة 10 مسودات مختلفة لمقال من طالب) ثم نختار الأفضل منها، أو نصوت على الإجابة الأكثر شيوعًا.

إذا دربت طالبًا ليكون مثاليًا في المسودة الأولى، فقد يصبح واثقًا جدًا من نفسه ويتوقف عن استكشاف أفكار جديدة. قد يعلق في طريقة تفكير "آمنة". وعندما تطلب منه توليد 10 مسودات لاحقًا، قد يكتب فقط 10 نسخ مختلفة قليلاً عن نفس الإجابة "الآمنة"، ولن تكون أي منها هي الحل العبقري والمبدع الذي كنت تحتاجه.

الطريقة الجديدة (التدريب المتوافق مع الحوسبة - CAT):
يقترح مؤلفو هذه الورقة البحثية طريقة تدريب جديدة تسمى التدريب المتوافق مع الحوسبة (Compute Aligned Training - CAT). بدلاً من تقييم الطالب بناءً على واجب منزلي واحد، يتم تقييمه بناءً على مدى جودة أدائه في شكل الامتحان الفعلي.

إليك كيف يعمل ذلك، باستخدام بعض التشبيهات:

1. تشبيه "Pass@N" (تذكرة اليانصيب)

تخيل أن الامتحان يسمح لك بشراء N من تذاكر اليانصيب (لنقل 64 تذكرة) لسؤال واحد. أنت تفوز إذا كانت أي من تذاكرك الـ 64 هي الرقم الفائز.

  • التدريب القياسي: إذا كان لدى الطالب بالفعل فرصة 50% للفوز بتذكرة واحدة، يستمر المعلم في دفعه للوصول إلى 90% أو 99%. لكن في يانصيب مكون من 64 تذكرة، بمجرد امتلاكك لفرصة 50%، فإن شراء المزيد من التذاكر يضمن الفوز على أي حال. هنا يستهلك المعلم طاقة في محاولة جعل طالب "جيد" يصبح "مثاليًا" في سؤال سهل، بينما يتجاهل الأسئلة الصعبة حيث يمتلك الطالب فرصة 1% فقط.
  • تدريب CAT: يدرك المعلم قائلًا: "مهلًا، هذا الطالب من المرجح أن يفوز بـ 64 تذكرة بالفعل. سأتوقف عن تقييم هذا السؤال السهل بقوة شديدة". بدلاً من ذلك، يركز كل طاقته على الأسئلة الصعبة حيث يفشل الطالب حاليًا. إنه يعلم الطالب كيف يوزع فرص نجاحه، لضمان أن تكون واحدة على الأقل من التذاكر الـ 64 هي الفائزة، بدلاً من محاولة جعل تذكرة واحدة محددة مثالية.

2. تشبيه "تصويت الأغلبية" (الانتخابات)

تخيل أن الامتحان يطلب من النموذج توليد 10 إجابات، وتقوم الفئة بالتصويت على الإجابة الأكثر شعبية.

  • التدريب القياسي: يحاول المعلم جعل إجابة الطالب الأولى هي الأكثر شعبية حتى لو كانت تفوز بالفعل بفارق ساحق. هذا يشبه المرشح الذي يفوز بالفعل بـ 90% من الأصوات؛ يستمر المعلم في إخباره بأن يحمل حملة انتخابية أقوى، وهو أمر مضيعة للوقت.
  • تدريب CAT: ينظر المعلم إلى "نقطة التحول". إذا كانت إجابة الطالب تخسر حاليًا بفارق ضئيل، فإنه يمنحه دفعة كبيرة لمساعدته على تجاوز خط النهاية. أما إذا كان الطالب فائزًا بارتياح، فإن المعلم يتوقف عن إعطائه نقاطًا إضافية. هذا يجبر النموذج على التركيز على أسئلة "المناطق المتنازع عليها" حيث يمكن لجهد إضافي بسيط أن يقلب نتيجة التصويت.

3. تشبيه "أفضل X من N" (عرض المواهب)

تخيل أن النموذج يولد 10 أغاني، وأنت تحتفظ بأفضل أغنية واحدة فقط.

  • التدريب القياسي: يحاول المعلم جعل متوسط الأغاني يبدو جيدًا. يؤدي هذا إلى موسيقى "متوسطة" آمنة ومملة، ليست سيئة أبدًا، ولكنها ليست مذهلة أيضًا.
  • تدريب CAT: يخبر المعلم النموذج: "لا بأس إذا كانت 9 من أغانيك سيئة، طالما أن الأغنية العاشرة هي تحفة فنية". هذا يشجع النموذج على المخاطرة وتجربة أفكار غريبة وذات تباين عالٍ. يتعلم النموذج إنتاج مجموعة متنوعة من المخرجات، مدركًا أن عملية "البحث" (اختيار الأفضل) ستقوم بتصفية الإخفاقات والاحتفاظ بالفائز.

ماذا فعلوا حقًا؟

اختبر الباحثون هذه الفكرة بثلاث طرق محددة:

  1. المسائل الرياضية: قاموا بتدريب نماذج الذكاء الاصطناعي لحل المسائل الرياضية. عندما استخدموا CAT لإعداد النماذج لعملية "Pass@N" (توليد إجابات عديدة واختيار الصحيحة منها)، أصبحت النماذج أفضل بكثير في حل المسائل الصعبة مقارنة بالطريقة القياسية.
  2. التصويت: قاموا بتدريب النماذج لتوليد إجابات لعملية "تصويت الأغلبية". ومرة أخرى، أدت نماذج CAT أداءً أفضل عند تطبيق استراتيجية التصويت.
  3. تصميم البروتينات: حتى أنهم اختبروا هذا على نوع مختلف تمامًا من الذكاء الاصطناعي يصمم البروتينات (لبنات بناء الحياة). في سيناريو كان على الذكاء الاصطناعي فيه العثور على بنية بروتينية نادرة وعالية الجودة من بين العديد من البنيات السيئة، كانت نماذج CAT المدربة بطريقة CAT أفضل بكثير في العثور على "الجائزة الكبرى" (البروتين المثالي) مقارنة بالنماذج القياسية.

الخلاصة

تجادل الورقة البحثية بأن طريقة تدريب النموذج يجب أن تتوافق مع طريقة استخدامه.

إذا كنت تخطط لاستخدام النموذج لتوليد خيارات عديدة واختيار الأفضل منها، فلا ينبغي تدريبه ليكون مثاليًا من المحاولة الأولى. بل يجب تدريبه ليكون جيدًا في إنشاء مجموعة من الخيارات التي من المرجح العثور فيها على الأفضل.

إنهم يسمون هذا "التدريب المتوافق مع الحوسبة" لأنهم يوفقون بين عملية التدريب وبين "الحوسبة" (قوة التفكير الإضافية) المستخدمة وقت الاختبار. إنها طريقة للحصول على نتائج أفضل دون الحاجة إلى أجهزة كمبيوتر أقوى أو وقت تدريب أطول؛ أنت فقط تغير قواعد اللعبة لتتطابق مع واقع كيفية استخدام النموذج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →