← أحدث الأبحاث
💬 NLP

Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models

تقترح الورقة البحثية تحسين تدرج السياسة متعدد الرموز (MPO)، وهو إطار عمل يعامل تسلسلات من K من الرموز المتتالية كأفعال دلالية موحدة لتحسين مواءمة تحسين تدرج السياسة مع البنية القائمة على الكتل لمهام الاستدلال المعقدة، مما يظهر أداءً فائقاً على طرق مستوى الرمز القياسية في اختبارات الرياضيات والبرمجة.

المؤلفون الأصليون: Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

نُشر 2026-02-17
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً ذكياً جداً ولكن حرفياً جداً كيف يكتب قصة أو يحل مسألة رياضية.

الطريقة القديمة: الروبوت "ذو الخطوة الواحدة"
حالياً، معظم طرق تدريب الذكاء الاصطناعي (مثل PPO) تُعلم الروبوت كلمة واحدة في كل مرة.

  • التشبيه: تخيل أنك تعلم طفلاً بناء قلعة من الليغو. الطريقة القديمة تقول: "التقط لِبنة واحدة. أحسنت! الآن التقط اللبنة التالية. أحسنت!"
  • المشكلة: الروبوت لا يفهم أن "الجدار" يتكون من 10 لبنات تعمل معاً. إنه يعامل كل لبنة كقرار منفصل. إذا احتاج الروبوت لكتابة العبارة "إذا كان س يساوي 5"، فقد ينجح في كتابة "إذا" (if)، لكنه بعد ذلك قد ينسى المنطق الخاص بـ "س يساوي 5" لأنه ينظر فقط إلى الكلمة التالية مباشرة. الأمر يشبه محاولة فهم جملة من خلال النظر إلى حرف واحد في كل مرة.

الفكرة الجديدة: الروبوت "ذو الكتل" (MPO)
يقترح هذا البحث طريقة جديدة تسمى تحسين سياسة التنبؤ متعدد الرموز (Multi-Token Policy Gradient Optimization - MPO). بدلاً من النظر إلى كلمة واحدة، يتعلم الروبوت النظر إلى "كتلة" من الكلمات (كتلة نصية) كوحدة واحدة من الفكر.

  • التشبيه: الآن، تقول للطفل: "ابنِ قسم جدار كاملاً (حوالي 10 لبنات) كحركة واحدة فقط".
  • كيف يعمل: عندما يقرر الروبوت تعريف متغير (مثل a = 5) أو كتابة معادلة رياضية، فإنه يعامل العبارة بأكملها a = 5 كـ إجراء واحد. هو لا يحاول فقط تخمين الحرف التالي؛ بل يخطط لـ "الكتلة الدلالية" كاملة في آن واحد.

لماذا يعد هذا أمراً هاماً؟

1. يمنع الروبوت من الإصابة بـ "رؤية النفق" (التركيز الضيق).
في التفكير المعقد (مثل الرياضيات أو البرمجة)، غالباً ما يمتد المعنى عبر عدة كلمات.

  • الطريقة القديمة: يرى الروبوت كلمة "إذا" ويفكر: "حسناً، ما الذي يأتي بعد ذلك؟". قد يختار كلمة تبدو صحيحة من الناحية القواعدية ولكنها تكسر المنطق الخاص بالمعادلة.
  • الطريقة الجديدة: يرى الروبوت الكتلة كاملة "إذا كان أ يساوي 5" ويفكر: "هذه خطوة منطقية كاملة". هذا يضمن أن الكتلة بأكملها منطقية معاً قبل الانتقال للخطوة التالية.

2. يشبه تعلم القيادة عبر "الكتل" بدلاً من "البكسلات".
تخيل قيادة سيارة.

  • على مستوى الرمز (القديم): تنظر إلى الطريق بكسل تلو الآخر. "البكسل أحمر. البكسل أحمر. البكسل أخضر". قد تفوتك حقيقة أن إشارة المرور كاملة حمراء.
  • على مستوى الكتلة (الجديد): تنظر إلى إشارة المرور كاملة كجسم واحد. ترى "ضوءاً أحمر" وتتوقف. أنت تفهم القصد من الإشارة، وليس فقط الألوان الفردية.

3. يجعله أكثر ذكاءً في الرياضيات والبرمجة.
اختبر الباحثون هذه الطريقة في مسائل رياضية صعبة (مثل حل الجبر) ومهام البرمجة.

  • النتيجة: حقق الروبوت "ذو الكتل" (MPO) درجات أعلى بكثير من الروبوت "ذو الخطوة الواحدة". لقد ارتكب أخطاء أقل لأنه توقف عن محاولة تخمين الكلمة التالية بمعزل عن غيرها، وبدأ في التخطيط لـ "الفكرة" التالية.

"السر الخفي" (كيف فعلوا ذلك)

لم يكتفِ الباحثون بإخبار الروبوت بأن يفكر بشكل أكبر فحسب؛ بل أعطوه أداة تدريب خاصة تسمى MTP (التنبؤ متعدد الرموز).

  • فكر في هذا كأنك تعطي الروبوت نظارات تسمح له برؤية 5 خطوات للأمام بينما لا يزال واقفاً عند الخطوة الأولى.
  • خلال التدريب، يتدرب الروبوت على التنبؤ بكتلة جملة كاملة في وقت واحد. وبمجرد أن يصبح جيداً في رؤية الصورة الكاملة، يستخدمون تلك المهارة لتحسين عملية اتخاذ القرار لديه.

الخلاصة

يشير هذا البحث إلى أنه لجعل الذكاء الاصطناعي بارعاً حقاً في التفكير المنطقي، نحتاج إلى التوقف عن معاملته كآلة تتنبأ بالحرف التالي فقط. بدلاً من ذلك، يجب أن ندربه على التفكير في كتل ذات معنى، تماماً كما يفعل البشر عندما نحل مشكلة ما. نحن لا نفكر كلمة بكلمة؛ بل نفكر في أفكار، ومعادلات، وكتل برمجية. تقنية MPO تعلم الذكاء الاصطناعي القيام بالمثل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →