← أحدث الأبحاث
💬 NLP

QuestA: Expanding Reasoning Capacity in LLMs via Question Augmentation

تقدم الورقة البحثية QuestA، وهي استراتيجية للتعلم التعزيزي تعمل على تعزيز قدرات الاستنتاج في النماذج اللغوية الكبيرة من خلال تعزيز أسئلة التدريب بحلول جزئية، محققةً بذلك نتائج جديدة هي الأفضل في فئتها على معايير الاختبار الرياضية الصعبة حتى مع نماذج ذات 1.5 مليار معلمة.

المؤلفون الأصليون: Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

نُشر 2026-04-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiazheng Li, Hongzhou Lin, Hong Lu, Kaiyue Wen, Zaiwen Yang, Jiaxuan Gao, Yi Wu, Jingzhao Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة QUESTA البحثية، مترجم إلى لغة بسيطة مع تشبيهات إبداعية.

المشكلة الكبرى: جدار "الصعوبة المفرطة"

تخيل أنك تحاول تعليم طالب (نموذج لغوي كبير) كيفية حل مسائل رياضية صعبة للغاية، مثل تلك الموجودة في أصعب مسابقات الرياضيات في العالم.

لديك طريقتان رئيسيتان لتعليمه:

  1. إعطاؤه مسائل سهلة: سيحلها بشكل صحيح وبسرعة، لكنه سيتوقف عن التفكير بعمق؛ سيكتفي فقط بحفظ الأنماط. وعندما تعطيه أخيراً مسألة صعبة، سينهار لأنه لم يتعلم أبداً كيف يصارع أو يستكشف أفكاراً جديدة.
  2. إعطاؤه مسائل صعبة: هذا هو المكان الذي يحتاج فيه للتعلم حقاً. ولكن هنا تكمن العقبة: إذا كانت المسألة صعبة جداً، فسيستعصي عليه الحل فوراً. سيبدأ بالتخمين العشوائي، ويخطئ، ولا يحصل على أي تغذية راجعة. الأمر يشبه محاولة العثور على إبرة في كومة قش وأنت معصوب العينين. لا يستطيع المعلم (خوارزمية التدريب) مساعدته لأن الطالب لا يصل أبداً إلى إجابة "صحيحة" لتعزيز التعلم. سيظل يدور في حلقة مفرغة، مهدرًا الوقت والطاقة.

هذه هي المعضلة التي واجهها الباحثون: المسائل السهلة تجعل النموذج كسولاً؛ والمسائل الصعبة تجعل النموذج يستسلم.

الحل: QUESTA (استراتيجية "عجلات التدريب")

ابتكر مؤلفو هذه الورقة، QUESTA، حيلة ذكية لإصلاح ذلك. أدركوا أنه بدلاً من إلقاء الطالب في الجزء العميق من المسبح، يجب عليهم إعطاؤه حلولاً جزئية أو تلميحات في البداية.

فكر في الأمر كالتالي:

  • الطريقة القديمة: تسلم الطالب معادلة فيزيائية معقدة وتقول له: "حل هذه!". إذا لم يكن يعرف الخطوة الأولى، فسيفشل.
  • طريقة QUESTA: تسلمه نفس المعادلة، ولكنك تكتب نصف الحل الأول على السبورة من أجله. تقول له: "إليك الإعداد، الآن عليك إكمال البقية".

من خلال إعطاء النموذج "بداية قوية" (حلاً جزئياً)، تصبح المسألة قابلة للإدارة. يمكن للنموذج إكمال المسألة بنجاح، والحصول على مكافأة "عمل جيد!"، ويتعلم كيف يفكر.

كيف يعمل الأمر في الواقع

أخذ الباحثون مجموعة بيانات تحتوي على 220,000 مسألة رياضية. قاموا بتصفية المسائل السهلة (لأنها ليست مفيدة للنمو) والمسائل المستحيلة (التي يفشل فيها النموذج بنسبة 100% من الوقت).

ثم أنشأوا منهجاً تدريبياً خاصاً:

  1. المرحلة الأولى (تلميحات كثيفة): أخذوا أصعب المسائل وأعطوا النموذج 50% من الإجابة كتلميح. تعلم النموذج كيفية إتمام المهمة.
  2. المرحلة الثانية (تلميحات خفيفة): بمجرد أن أصبح النموذج جيداً في ذلك، قللوا التلميح إلى 25% فقط. كان على النموذج القيام بمزيد من العمل، لكنه ظل يمتلك شبكة أمان.

هذا يشبه لعبة فيديو حيث تبدأ في "الوضع السهل" مع دليل إرشادي، ولكن مع ارتقائك في المستوى، يختفي الدليل، مما يجبرك على اللعب في "الوضع الصعب" باستخدام المهارات التي تعلمتها للتو.

النتيجة السحرية: نماذج صغيرة، عقول كبيرة

الجزء الأكثر إثارة في هذه الورقة هو النتيجة. لقد اختبروا هذا على نموذج صغير جداً (1.5 مليار معلمة فقط). عادة ما تُعتبر النماذج الصغيرة "غبية" مقارنة بالنماذج الضخمة التي تحتوي على 32 مليار معلمة أو أكثر.

ومع ذلك، باستخدام QUESTA:

  • تفوق النموذج الصغير (1.5B) على النماذج الضخمة (32B) في العديد من الاختبارات المعيارية الرياضية الصعبة.
  • حل مسائل لم تستطع النماذج الضخمة حلها.
  • لم يصبح أفضل في نوع واحد فقط من المسائل، بل أصبح "مفكراً" أفضل بشكل عام.

لماذا يهم هذا الأمر (لحظة الإدراك)

عادةً، عندما تدرب الذكاء الاصطناعي على مسائل صعبة، فإنه يميل إلى "الانهيار". يصبح واثقاً جداً في طريقة واحدة محددة للحل، ويتوقف عن الاستكشاف؛ يصبح جامداً.

QUESTA تمنع هذا الانهيار. ولأن النموذج يتم تحديه باستمرار بمستوى "مناسب تماماً" من الصعوبة (بفضل التلميحات)، فإنه يحافظ على فضوله حياً. يتعلم استكشاف مسارات مختلفة للوصول إلى الحل، وليس فقط المسار الذي حفظه.

ملخص التشبيه

تخيل أنك تحاول تسلق جبل شاهق (قدرة الاستنتاج).

  • التدريب القياسي: إما أن تبدأ من الأسفل في مسار مسطح (مسائل سهلة) ولا تصل أبداً إلى القمة، أو تحاول القفز مباشرة إلى القمة (مسائل صعبة) فتسقط.
  • QUESTA: تقوم ببناء سلسلة من منصات السقالات على جانب الجبل.
    • أولاً، تبني منصة في منتصف الطريق وتترك المتسلق يتدرب على التسلق من هناك.
    • بمجرد أن يصبح قوياً، تزيل الجزء السفلي من السقالات، مما يجبره على تسلق القسم السفم بنفسه.
    • في النهاية، تختفي السقالات، لكن المتسلق أصبح قوياً بما يكفي للوصول إلى القمة بمفرده.

الخلاصة: تثبت QUESTA أنك لا تحتاج إلى عقل أكبر لحل مسائل أصعب؛ بل تحتاج فقط إلى طريقة أذكى لتعليمه. من خلال إعطاء الذكاء الاصطناعي "إجابات جزئية" أثناء التدريب، يمكننا تحويل النماذج الصغيرة والرخيصة إلى عباقرة في الاستنتاج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →