← أحدث الأبحاث
🤖 machine learning

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

تقترح الورقة إطار عمل أخذ عينات أقل ضجيجاً (LENS)، وهو نهج للتعلم المعزز يحدد ويزيل رموز التداخل من المطالبات لتوجيه تحسين السياسة، مما يحسن بشكل كبير من كفاءة وأداء وسرعة تقارب استدلال النماذج اللغوية الكبيرة في المهام المعقدة مقارنة بالطرق الحالية مثل GRPO.

المؤلفون الأصليون: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

نُشر 2026-04-21
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طالب ذكي جداً ولكنه مشتت الانتباه بسهولة (الذكاء الاصطناعي) كيفية حل المسائل الرياضية المعقدة. تعطيه ورقة عمل (المطالبة/Prompt) وتقول له: "حاول حل هذه. إذا أجبت بشكل صحيح، ستحصل على نجمة ذهبية. وإذا أخطأت، فلن تحصل على شيء".

هكذا يعمل التعلم التعزيزي مع المكافآت القابلة للتحقق (RLVR). يحاول الذكاء الاصطناعي تجربة العديد من الحلول المختلفة (تسمى "عمليات التدفق/rollouts"). إذا حصل على نجمة ذهبية، فإنه يتعلم. وإذا لم يحصل على شيء، فإنه لا يتعلم شيئاً.

المشكلة: "الضجيج" في الغرفة

تجادل الورقة البحثية بأن الذكاء الاصطناعي يفشل غالباً ليس لأن الرياضيات صعبة للغاية، بل لأن ورقة العمل تحتوي على بعض الكلمات المشتتة.

فكر في الأمر كالتالي: تسأل الطالب: "حل 2+2، ولكن تجاهل حقيقة أن السماء خضراء وأن وحيد القرن موجود".

  • الرياضيات (2+2) سهلة.
  • لكن الطالب يصاب بالارتباك بسبب الجمل الإضافية الغريبة عن وحيد القرن والسماء الخضراء. يتشتت انتباهه، ويصاب بالذعر، ويعطي إجابة خاطئة.

في عالم الذكاء الاصطناعي، تسمى هذه الكلمات الإضافية الغريبة "رموز التداخل" (Interference Tokens). وهي أجزاء صغيرة من التعليمات تربك النموذج، مما يسبب فشله حتى في المسائل التي كان بإمكانه حلها.

ولأن الذكاء الاصطناعي يستمر في التشتت بسبب هذه الرموز، فإنه نادراً ما يحصل على "نجمة ذهبية". وبدون النجوم الذهبية، لا يستطيع المعلم (خوارزمية التدريب) تعليم الذكاء الاصطناعي أي شيء، وتتوقف العملية برمتها.

الطرق القديمة (ولماذا هي سيئة)

كانت المحاولات السابقة لمعالجة هذا الأمر تشبه:

  1. إعطاء الطالب 100 ورقة عمل بدلاً من واحدة: "ربما إذا حاولت مرات كافية ستكون محظوظاً!" (هذا مكلف وبطيء).
  2. رمي أوراق العمل الصعبة: "دعونا نتوقف عن إعطائك مسائل تحتوي على وحيد القرن عليها". (هذا يمنع الطالب من تعلم كيفية التعامل مع المشتتات في العالم الحقيقي).

الحل الجديد: LENS (ضجيج أقل، صوت أوضح)

يقترح المؤلفون إطار عمل جديد يسمى LENS. فكر في LENS كـ محرر ذكي جداً يساعد الطالب على التعلم عبر خطوتين ذكيتين:

الخطوة 1: ممارسة "الغرفة النظيفة"

أولاً، ينظر المحرر إلى ورقة العمل المربكة. يحدد "رموز التداخل" (جمل وحيد القرن) ويمسحها مؤقتاً.

  • النتيجة: يرى الطالب الآن مسألة "2+2" نظيفة وبسيطة. يحلها فوراً ويحصل على نجمة ذهبية.
  • الاستبصار: وجدت الورقة أن إزالة جزء ضئيل جداً من الكلمات (أقل من 5%) يحول المحاولة الفاشلة إلى محاولة ناجحة بنسبة تزيد عن 20%!

الخطوة 2: نقل "النادي الرياضي الذهني"

هنا تكمن الخدعة السحرية. الذكاء الاصطناعي لا يتعلم فقط حل المسألة "النظيفة".

  • يقول المحرر: "حسناً، لقد حللت النسخة النظيفة بشكل مثالي. الآن، عد إلى ورقة العمل الأصلية الفوضوية التي تحتوي على وحيد القرن".
  • يستخدم الذكاء الاصطناعي الثقة والمنطق المستمدين من نجاح "الغرفة النظيفة" لمواجهة النسخة الفوضوية. إنه يتعلم كيف يتجاهل الضجيج ويركز على الرياضيات.

الأمر يشبه تدريب ملاكم. أولاً، تتركه يتدرب في صالة رياضية هادئة بدون أي مشتتات (الغرفة النظيفة). بمجرد أن يتقن الحركات، تضعه في ساحة صاخبة وفوضوية (العالم الحقيقي) وتقول له: "تذكر كيف كنت تتحرك في الصالة الهادئة؟ افعل ذلك هنا، وتجاهل الجمهور".

لماذا هذا مهم؟

  • تعلم أسرع: يتوقف الذكاء الاصطناعي عن إضاعة الوقت في المشتتات. إنه يتعلم بشكل أسرع (تسريع بمقدار 1.6 ضعف).
  • نتائج أفضل: يصبح الذكاء الاصطناعي أفضل في حل المسائل الصعبة لأنه يتعلم كيفية تصفية الضجيج، وليس مجرد تجنبه.
  • أقل تكلفة: لا تحتاج لتشغيل الكمبيوتر لفترة طويلة أو استخدام الكثير من الكهرباء لأن الذكاء الاصطناعي لا يدور في حلقة مفرغة.

الخلاصة

تكتشف الورقة أن الذكاء الاصطناعي يفشل غالباً بسبب وجود بعض "التفاح الفاسد" (الكلمات المربكة) في المطالبة، وليس لأن المهمة مستحيلة. LENS يعلم الذكاء الاصطناعي كيفية رصد ذلك التفاح الفاسد، وإزالته ذهنياً، وتعلم الحل، ثم تطبيق ذلك الدرس على التعليمات الفوضوية في العالم الحقيقي.

الأمر يتعلق بتعليم الذكاء الاصطناعي كيفية تجاهل الضجيج ليتمكن من سماع صوته الخاص (منطقه) بوضوح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →